一分钟速览
1多项编程与专业工作基准超过 Fable 5.1;跨文件开发和长任务更有竞争力,默认 medium 档已有不错表现。
2Opus 5 被抱怨啰嗦、爱争辩。5.5 更愿意接受修改、先说重点;Every 发现长文仍会埋掉最好的观点。
3水下游戏、手绘动画、投石机和积木工具,把画面、操作与反馈连成可看的作品。
4相对 Fable 5.1,API 输入和输出单价均低 60%;相对 Opus 5,官方估算典型任务费用低约 40%。
Anthropic 发布了 Claude Opus 5.5。这次升级覆盖复杂编程、视觉与交互、知识工作,以及一直被吐槽的写作体验。在 Anthropic 的评测中,它的 Terminal-Bench 得分 66.4%,高于 Fable 5.1 的 55.8%;CursorBench 为 57.8% 对 51.8%。在代码库里连续解决问题,和在一段提示词后做出完整作品,是它最值得看的两种能力。
价格也改变了选择:Opus 5.5 的 API 输入、输出单价分别是每百万 Token 4 美元和 20 美元,比 Fable 5.1 的 10 美元和 50 美元都低 60%。与上一代 Opus 5 相比,Anthropic 称典型任务费用约低 40%,输出速度快 30% 以上。
这些升级在日常工作里,分别表现为:
编程:更适合连续推进整项任务。跨文件修改和长时间工程任务更稳;CursorBench 的默认 medium 档已超过 Fable 5.1 的最高档。一般任务可以先从 medium 开始。
视觉与交互:从“做个页面”走向更完整的作品。水下探索游戏、手绘动画、可调投石机和积木搭建工具,把画面、操作和反馈连成了完整体验。
知识工作:更好地检索、整理和交付复杂资料。财报查证、并购建模和跨应用操作的表现都有提升;另一项专业工作测试达到 1846 Elo,高于 Fable 5.1 的 1735。
写作:少绕弯,先说重要信息,更愿意遵守你的表达规则。新版更愿意听反馈,少用套话;写文档和解释问题时,重要信息也更早出现。
写作升级:少一点套话,先把事情讲明白
Opus 5 的“AI 味”曾是高频吐槽:回答先铺背景、爱堆术语和套话,关键结论埋在后面;请它改两句,有时又忙着解释、争辩自己原来的写法。Every 的试用者说,旧版的解释常常“还需要再解释一遍”。写文档或长期协作时,这会让人把时间花在追问和改稿上。
Opus 5.5 主要改的是这种沟通体验。 Anthropic 称它会把重要信息放在前面,减少拗口的表达,更愿意遵守用户给的写作规则。官方账单排错示例让这个变化很容易看出来:新版先告诉你钱差在哪里,然后再讲代码出了什么问题。
同样找对 Bug,新版先说影响
两款模型都找到了同一个账单错误:代码把月末截止时间设成“最后一天的零点”,漏算了那一整天的用量。
区别在展开顺序。Opus 5 先指出是哪次提交引入问题,然后展示代码、解释时间区间,接着说明漏计影响及测试为什么没有发现它。Opus 5.5 一开始就交代:账单下降中,1.50 美元来自免费层调整,另外 9.92 美元来自 Bug;后者导致月末最后一天的用量没有计费。读者先知道影响多大,再读代码了解原因。
官方还展示了两组对照。总结 Slack 讨论时,两款模型都用了三条清单,新版把“问题、立即措施、长期方案”中的责任人和完成状态写得更容易跟进。解释国际象棋程序时,新版围绕“两个格子中间有没有棋子挡住”说明设计:用掩码记录中间格,再计算阻挡数量;数量为零,攻击才成立。它把技术细节连回了读者要理解的问题。
写得更自然,长文仍可能绕远
早期测试者 Theo Jaffee 用同一个提示词——“explain how options work”——展示了两款模型的回答。他认为 Opus 5.5 的写作更直接、自然,减少了让人出戏的套话。这条帖子在检索时约有 1300 赞。
旧版先从“未来交易”和核心思想谈起,再列定义、类型及较长的算例。新版首段直接给出定义和权利金,随后将类型、术语、上涨与下跌情形、盈亏平衡点分开。区别在阅读顺序:先弄懂期权是什么,再看分类和算例。
企业反馈也更接近日常写作任务。
Ramp 工程师 John Ruelas 表示,新版更能遵守团队写作规则,设计文档只需很少修改;重写的一条提示词甚至比他的原版更合意。
Box 的 Yashodha Bhavnani 则称,在其评测中,Opus 5.5 使用的 Token 约为 Opus 5 的三分之一,回答冗长程度减少约 40%,同时保持准确性。
科技媒体 Every 的实测更看重协作体验变顺了:新版愿意接受修改意见,顺着给定材料继续创作,也更能解释取舍。
Every 测得的英文 Flesch-Kincaid 年级值为 6.95,低于 Opus 5 的 7.97 和 Fable 5.1 的 7.43,约对应美国七年级阅读难度;Reading Ease 易读分为 68.4。这项评分衡量英文词句是否容易阅读。
写作仍有一个明显短板:话更好懂,重点却未必更早出现。Every 的文章开头测试中,新版用了 37—39 句表达作者 21 句的内容;Dan Shipper 也发现,它能找出最有意思的观点,却没有把它放在开头。
这让 Opus 5.5 更适合一起讨论想法、扩充初稿;定稿时仍要检查第一段有没有直接说出核心观点。写作升级已经能从配合度和表达中感受到,精炼与取舍还需要编辑。
X 上的演示:游戏、动画与视觉完成度
X 上的开发者和 Anthropic 团队很快放出了可看的作品。游戏与动画最适合观察这次升级:它有没有把场景、操作和反馈真正做出来?
水下探索游戏:场景、任务和反馈连成了一次体验
Anthropic 团队成员 Edwin Arbus 的演示约有 1315 赞。他让 Opus 5.5 制作一款受安提基特拉机械启发的游戏,并称整个作品是一个约 3 MB 的 HTML 文件,通过 Three.js 在浏览器内运行,画面与声音均由代码实时生成。
视频先展示航船与潜水员,随后进入水下:鱼群、海草与光束形成环境;“寻找三枚青铜碎片”的目标、空气倒计时和声呐形成任务;找到机关后出现齿轮装置与完成画面。这组演示的价值在于,不同视觉与交互元素围绕同一探索目标组织起来了。
丧尸游戏对照:同题作品的画面差异
第三方评测账号 BridgeBench 发布的对照约有 653 赞。作者称两款模型使用了相同提示词,讲解中明确标注先展示 Opus 5.5,后展示 GPT-6 Sol。
前半段是较写实的城市射击场景:路面反光、建筑层次、枪械和界面元素较丰富;后半段则是更简化的方块角色与规则化场地。同一条演示里,两种作品的场景密度、画面风格和交互界面差别很直观。
手绘动画:借助既有技能控制风格与转场
开发者 superalesha 的动画约有 478 赞。他要求 Opus 5.5 表现 Claude 模型的发展过程,并说明使用了自己的 hand-drawn-canvas-animation 技能,作品以纯 JavaScript 制作。
视频从铅笔、纸张和星芒标识出发,经过翻页、怀表齿轮、蓝图桥梁、风暴和色彩转场,最后落到一句问候。它展示了如何把统一画风维持到多段场景中。
官方的八个作品,把能力展示得更具体
Anthropic 还发布了一条早期探索合集。其中既有连续叙事的动画,也有能接受输入、给出反馈的应用原型。
连续叙事与数据重建
西瓜故事由 Kevin Ngo 制作。蚂蚁从搬运、种植到经历风暴、收获分享,形成了一段约 29 秒的手绘故事。它展示的是连续场景的表达,而不只是一张插画。
Earthrise 重建则利用图像线索和公开数据,复现阿波罗 8 号拍摄“地出”照片的时刻。演示从原照片出发,展示地平线边缘、位置、镜头拟合、光照与胶片响应等环节,再呈现重建画面。它把图像观察、资料与几何关系串进同一个可视化过程。
把草图和视觉想法变成可操作界面
Kevin Ngo 的 Penpal 把 Claude Code 做成了纸笔风格界面:新会话是一张餐巾纸,项目列表、继续上次会话和用量都保留了具体操作入口。它在风格变化之后,仍然围绕原本的工作组织界面。
投石机从铅笔草图变成桌面上的三维模型。演示者可以拉动投掷臂、调整配重,看弹丸飞行并撞倒方块。这里不只有物体造型,还有“改变参数—观察结果”的交互关系。
Tyler Nishida 的 UI 老虎机随机组合界面元素,为新应用提供起点。另一件作品来自 thedesignely:围绕甲虫海报做出视觉特效控制器,调整参数时,预览随之改变纹理和形变。前者帮助产生组合,后者帮助比较变化后的效果。
生成之后,还能继续修改与复用
积木搭建应用接受照片或文字描述,输出三维积木模型及搭建说明。视频里能看到修改描述后的城堡、逐层步骤和零件指引:它尝试把“看起来像一个模型”推进到“告诉人如何搭起来”。
Kevin Ngo 的 算法绘图程序则让同一套画风产生不同构图。官方说每幅画使用不同的随机种子;展示图中,海浪、岛屿和日落的位置不断变化,铅笔笔触和纸张质感保持一致。对于需要成组视觉素材的工作,这比只能输出一个固定结果更有复用价值。
编程究竟提升多少:默认档位已经很有竞争力
视觉演示之外,官方基准提供了另一种观察。下图涵盖编程、知识工作、电脑操作和图表识别。其中 OSWorld 采用 partial 计分,Chartography 在使用工具的条件下从 Opus 5 的 83.4% 提升到 89.0%。
“effort”可以理解为模型分配给思考的预算。更高档通常意味着花更多时间和费用,但不保证每项任务都得分更高。Opus 5.5 的一个变化,是默认 medium 已经能完成很多此前需要高档模型处理的工作。
考察终端中的多步执行与问题解决。Opus 5.5 的 xhigh 得分为 66.4%,Opus 5 为 52.3%,Fable 5.1 为 55.8%,Astra 为 57.9%。medium 约为 58%,按官方比较,费用约为 Opus 5 max 的五分之一,也只需 Astra 同等表现约 40% 的费用。
除了正确性,还关心修改能否达到代码库的合入标准。Opus 5.5 medium 得分 54.6%,max 为 54.4%;medium 以约 Astra 五分之一的任务费用,超过其 53.3% 的成绩。对这类任务,拉满预算不一定划算。
来自真实用户的复杂跨文件任务。medium 得分 52.5%,已超过 Fable 5.1 max 的 51.8% 和 Opus 5 max 的 46.6%;相对 GPT-5.6 Sol 的 41.7%,费用约为其三分之一。Opus 5.5 max 得分进一步达到 57.8%,但费用也增加。
长任务反馈更接近工程现场。Anthropic 内部让模型将 HAProxy 从 C 改写为 Rust,Opus 5.5 用了 9.5 小时,Fable 5.1 为 12 小时;两者几乎通过全部回归测试,而 Opus 5.5 的费用低 51%。公告还收录了早期测试者不到一天完成 68 万行代码迁移、不到 3 小时审计修复 20 万行遗留代码的案例。
Stripe 工程师 Cristian Rivera 描述的是另一种难题:40 个层叠 PR 的复杂变基。一个 Opus 5.5 会话协调十几个会话,把冲突解释清楚;到第二天下午,40 个 PR 都通过了 CI。Clio 的 Sean Heintz 则报告,模型在跨六个仓库的任务中持续运行超过 18 小时,推进里程碑更快、返工较少。这里的进步既包括继续做事,也包括让人离开一段时间后能重新看懂进展。
Every 的 Kieran Klaassen 还比较了同一道 Ruby 任务:Fable 5.1 high 写了 26 行,Opus 5.5 extra-high 写了 14 行,省掉了他不喜欢的解释性注释。在其程序性能测试中,Opus 生成的代码达到 427 次请求/秒,满足 20 项响应时间上限中的 17 项;Astra 的代码为 463 次/秒、14 项。前者峰值吞吐较低,却满足了更多延迟要求。这测的是生成程序的性能;Kieran 所说“约有 Fable 九成编程能力”则是个人使用判断。
Kieran 还用它搭建摄像头心率原型和 Cozy Island 三维岛屿。他认为 extra-high 的岛屿细节和镜头控制更好,胜过自己测试的 Fable 版本。
但漂亮的界面仍要跑通核心流程。Mike Taylor 的语音表单任务运行了 30 分钟、消耗约 590 万 Token:首页与登录页看起来不错,自动检查也通过了,实际打开构建和访谈页面却报错,指定 AI 服务也没有被调用。审查代码后,还要亲自走一遍应用的主要操作。
知识工作:查得清,交付也更完整
在 GDPval-AA v2.1 的专业工作测试中,Opus 5.5 取得 1846 Elo,高于 Fable 5.1 的 1735 和 Opus 5 的 1708。Elo 表示相对表现,不是正确率。按官方曲线,medium 已超过 Astra max,估算任务费用约为其五分之一。
一个具体例子是财报查证。Anthropic 在财报新闻稿难以定位的网络副本中设置检索任务,要求模型检索并写季度报告,再逐个核查数字与引文。只要出现捏造,整份报告就不合格。Opus 5.5 的 18 次尝试中有 16 次通过,Fable 5.1 和 Opus 5 在这项测试中都没有通过。
另一个内部测试让模型分析两家虚构 HR 软件公司的并购,做 Excel 财务模型和管理层汇报;两款模型估值结论相同,但 Opus 5.5 的产物更完整、易读,耗时 63 分钟对 93 分钟,费用低 50%。
跨应用的 AutomationBench 得分从 Opus 5 的 26.9% 提升到 40.0%,但仍低于 Astra 的 41.4%。科学智能体测试也是 Astra 较高:64.6% 对 58.7%。
在大规模资料收集的 WANDR 测试中,Opus 5.5 从 low 的约 31% 提升到 max 的约 72%,显示复杂检索仍可能受益于更多预算。
Every 的咨询测试呈现了另一面:模型与一个模拟 Dan Shipper 的智能体谈判,连续修改 12 轮后达成共识;但限时 10 分钟制作客户培训流程表时,它先想了近 5 分钟,再制作训练数据、核对资产负债表,到第 9 分钟才写讲义,最终没交出逐分钟流程表。能持续推敲,不代表能排对交付优先级。
费用降低:单价更低,完成任务也更省步骤
官方所说的“典型任务费用低约 40%”,包含两部分:每个 Token 更便宜,以及完成任务所用的 Token 更少。Token 是模型处理与计费的文本片段,两者共同决定最终账单。
对比 Fable 5.1 的每百万 Token 输入 10 美元、输出 50 美元,Opus 5.5 的 4 / 20 美元均低 60%。
智能体会反复携带系统提示词、工具定义和上下文。能够重复使用的前缀命中缓存后,可以按更低的读取价格计费。因此,一项任务里缓存占多少、模型调用多少轮,都会改变总费用。以每次调用合计使用 100 万输入 Token、10 万输出 Token 为例,按表中的单价估算:
这只是固定用量的费用示例;实际账单还取决于缓存写入、调用轮数和最终 Token 用量。
标准模式的输出生成速度,官方称比 Opus 5 快 30% 以上。Claude Code 和开发平台还有 Fast mode,生成速度最高为标准模式的 2.5 倍,输入与输出价格分别为每百万 Token 8 和 40 美元。它适合愿意多付费用缩短等待的场景。
真正用起来:给目标,也给停止点
Every 的 Tyler Nishida 只给了一条高尔夫游戏提示词,模型就组建了一个架构师、三位设计师和三位裁判协作的团队,运行了 1 小时 52 分钟,直到他的测试访问结束。成品截图中可以看到雷雨、浮岛、击球倒计时和球杆控制。
持续做事也会持续消耗额度。Every 有测试者碰到了周用量上限;模型还曾主动否决自己生成的 90% 以上 UI 组件,Tyler 无法从理由中找到清楚的评价标准。
派发长任务时,先说明最终交付物、时间或费用预算,以及什么条件下应该停止。先交出能用的核心结果,再决定是否继续润色,往往比让模型不断给自己加任务更有效。
Every 团队对模型的偏好并不一致:有人转回 Claude 做视觉和产品开发,有人仍用 Astra 编辑文章,取舍取决于具体工作。
Opus 5.5 已在 Anthropic 开发平台及 AWS、Google Cloud、Microsoft Azure 提供,API 模型 ID 为 claude-opus-5-5。Pro、Max、Team 和按席位计费的 Enterprise 五小时额度提高,订阅用户还获得一次可保存、择时使用的额度重置。Sonnet 5.5 与 Haiku 5.5 将在后续几周推出。
安全方面简要说:Anthropic 称其行为审计表现进一步改善,并为高风险任务配置了生产防护;部分场景会拦截或转交其他模型,具体取决于产品与接入方式。日常使用最值得关注的,仍是这次更强的工作能力、更清楚的沟通,以及完成同一项任务所需的时间和费用。