资讯动态

  • 首页Our ProjectsClaude Opus 5.5突袭!68万行代码一天迁完,API价格打8折

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折

2026-09-24 9682

梦晨 听雨 发自 凹非寺 量子位 | 公众号QbitAI Claude最新旗舰 Opus 5.5 跑分登顶! 在代码、知识工作、计算机操作等多项基准测试中拿下第一的同时,输出速度也比 Opus 5 快了 30%以上 。 这暂停得好好的前沿,怎么不到两周又被推进了。 那CEO Dario Amodei发表的“放缓前沿”公开信算什么? 算他能发。 这届模型开始拿代码当画笔 目前看到比较新颖的测试是用纯代码生成图像,SVG鹈鹕骑自行车已经被刷爆了,这次是更复杂的Python渲染。 类似的能力可以扩展成用纯js代码生成渲染视频。 多项跑分登顶,API价格打8折 他们说任务成本降 4成 ,但API价格并没有直接打 6折 。 Opus 5.5的输入、输出价格分别是每百万Token 4美元 和 20美元 ,相比Opus 5下降 20% 。 再加上完成同一任务需要的步骤和Token更少,Anthropic测算,典型任务的总成本可以下降 40% 。 真正下狠手的是 缓存读取价 。这一项从Opus 5的每百万Token 0.50美元 ,直接降到 0.20美元 ,砍了 60% 。 做Agent编程的都知道,长对话和大型代码任务需要反复读取上下文,缓存读取经常占据成本的大头。相比账面上的API单价,这一刀可能更有实际体感。 另外还有一个Fast mode,输出速度最高可达标准模式的 2.5倍 ,价格也翻倍至每百万输入Token 8美元 、输出Token 40美元 ,适合对延迟特别敏感的场景。 订阅用户也加量了,Pro、Max、Team和按席位收费的企业版,五小时使用限额都会提高;Anthropic还提供了一次可以暂存、由用户自行选择时间使用的rate limit reset。 具体看跑分,目前最新鲜的榜就是 Terminal-Bench 4.0 了,衡量模型处理复杂命令行任务的能力。 Opus 5.5拿下 66.4% ,上一代Opus 5是 52.3% ,OpenAI的 GPT-6 Astra 是 57.9% ,Claude自家的 Fable 5.1 是 55.8% 。 已经明显拉开差距。 在另一项编程基准FrontierCode v1.1上,Opus 5.5以 54.4% 超过GPT-6 Astra的 53.3% ,差距就没那么明显了。 而且推理effort开中档效果反而更好。 Opus 5.5在默认effort,也就是中档设置下,反而跑出了 54.6% ,超过表中其他模型的最高成绩,也略高于自己开到最高档时的 54.4% 。 到了这个能力水平, 0.2个百分点 基本已经落在波动范围里。 Anthropic自己也承认,跑分差距越来越难准确反映真实使用体验,他们内部使用时,Opus 5.5和Fable 5.1的差距就没有榜单看起来这么大。 另一项 CursorBench 4.0 ,测的是来自真实Cursor会话的多文件模糊任务。 最高effort下,Opus 5.5拿到 57.8% ,比Fable 5.1的 51.8% 高 6分 ,比 GPT-5.6 Sol 的 41.7% 高 16.1分 。 如果看性价比,Opus 5.5在默认中档设置下得分 52.5% ,依然领先GPT-5.6 Sol的最高成绩约 11分 ,单项任务成本只有后者的 三分之一 左右。 Opus 5.5特别强调在大规模代码库级别的任务上有明显提升。 早期测试者曾用它迁移 68万行代码 , 不到一天 完成。换成人类工程团队,预计至少需要 数周 。 还有一位测试者用它审计并修复一个 20万行代码库 ,耗时 不到3小时 。同样的任务,Opus 5花了 超过20小时 ,使用的Token数量还是它的 2.5倍 。 在一项内部测试中,Anthropic让Opus 5.5和Fable 5.1分别将HAProxy从C语言重写成Rust。HAProxy是一款被广泛使用的Web流量负载均衡软件。 两个版本都通过了HAProxy自身几乎全部回归测试,但Opus 5.5只用了 9.5小时 ,Fable 5.1用了 12小时 ,前者的成本低了 51% 。 Anthropic还让模型优化一个Web应用所有页面的加载速度。Opus 5.5在 40次 测试中成功了 39次 ;Opus 5虽然也缩短了加载时间,但改进幅度更小,还改变了应用原本的行为。 知识工作方面同样值得关注。 在覆盖 44个职业 的真实工作能力评估GDPval-AA v2.1中,Opus 5.5得分 1846 Elo ,Fable 5.1是 1735 ,Opus 5是 1708 。 在默认effort设置下,Opus 5.5的得分就超过了GPT-6 Astra在最高effort下的表现,单项任务成本大约只有后者的 五分之一 。 投资公司Walley

about image

订阅我们的时事通讯

获取更多更新