导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
快讯 机构 人物 观点 专题

Anthropic发布Claude Opus 5.5:性能媲美旗舰Fable 5.1,成本直降六成

Anthropic于周二发布了Claude Opus 5.5,这是其称之为Claude 5.5家族中的首款模型。该公司表示,新模型在大多数任务上的表现已达到其最昂贵的旗舰模型Claude Fable 5.1的水平。关键在于,该模型的运行成本比它所取代的Opus 5低20%,且比业界最先进的Fable 5.1便宜60%。

Myriad: Which company IPOs next? Click to make your prediction.

Myriad:哪家公司将率先IPO?点击做出你的预测。

该模型能力极为出色。无论从版本号(5.5对比Fable的5.1)还是家族定位(Opus是公开可用的最大模型,其次为Sonnet,Haiku最小)来看,它都是最先进的。Anthropic承认Fable与Opus之间的差距比基准分数显示的更小,但由于Opus公开可用且每令牌成本更低,对大多数Claude用户而言显然是更优选择。

Opus 5于7月发布,在当时多数基准上以更低价格超越Fable 5;而9月初到来的Fable 5.1逆转了局势,在Anthropic公布的所有基准上击败Opus 5。Opus 5.5再次缩小了差距,不过这次靠的是价格而非原始分数。

开发者平台Lovable曾在7月对Opus 5进行自有编码测试,其在Anthropic分享的声明中表示,早期模型“比前代更稳定,运行间差异远小”——这正是Anthropic如今再次强调的效率卖点。

Opus 5.5也是CEO Dario Amodei发表文章呼吁行业放缓以来的首款模型,他认为AI能力增益正超越旨在控制风险的安全测试。“我们必须放慢提升AI模型能力的步伐,”Amodei本月早些时候写道。

Anthropic主要通过代理式编码(agentic coding)衡量进展——即AI代理自主执行多步操作而非仅回应单一提示。在Terminal-Bench 4.0(测试代理能否在命令行完成复杂专业任务,按完成率百分比计分)中,Opus 5.5达66.4%,领先Fable 5.1的55.8%与GPT-6 Astra的57.9%。FrontierCode(检查代理代码改动能否在真实工程流程中被合并,同样采用通过率计分)中,Opus 5.5为54.4%,Fable 5.1为50.3%。

Anthropic发布Claude Opus 5.5:性能媲美旗舰Fable 5.1,成本直降六成

在GDPval-AA v2.1(使用Elo棋类风格排名系统对44个职业的真实专业工作评分)中,Opus 5.5得分1846,Fable 5.1为1735,Opus 5为1708。

不过Opus 5.5并非全面领先。在Zapier构建的AutomationBench(评估代理能否在无人工协助下走完完整业务流程)中,GPT-6 Astra的41.4%略胜Opus 5.5的40.0%。在Terminal-Bench-Science 0.1(测试命令行环境中的代理科学研究)中,Astra的64.6%以更大优势击败Opus 5.5的58.7%。

更大的卖点是成本。输入令牌(模型读写的文本块,每百万计价)现在Opus 5.5为4美元,Opus 5为5美元;输出令牌从25美元降至20美元。缓存读取(复用已处理上下文以避免重算,占长时代码会话大部分成本)下降60%至每百万令牌0.20美元。

Anthropic发布Claude Opus 5.5:性能媲美旗舰Fable 5.1,成本直降六成

由于Opus 5.5在两项能力上匹配了Anthropic的Mythos级模型(最受限层级,仅供审核的网络安全与生物研究人员使用),它启用了与Fable 5.1相同的安全防护。多数网络安全任务会自动转至较旧的Opus 4.8,这是许多开发者和用户此前抱怨过的问题。

Opus 5.5现已在Anthropic各平台上线,包括亚马逊云科技、谷歌云和微软Azure。Anthropic表示,Sonnet 5.5与Haiku 5.5将在未来数周跟进,将同等降价延伸至整个产品线。