阅读,与值得关注的内容Readance

Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)

Opus 5.5
FIELD REPORT
Model Release Field Notes
66.4%
Terminal-Bench · Fable 5.1 为 55.8%
4 / 20美元
每百万 Token 输入 / 输出
At a Glance

一分钟速览

1多项编程与专业工作基准超过 Fable 5.1;跨文件开发和长任务更有竞争力,默认 medium 档已有不错表现。

2Opus 5 被抱怨啰嗦、爱争辩。5.5 更愿意接受修改、先说重点;Every 发现长文仍会埋掉最好的观点。

3水下游戏、手绘动画、投石机和积木工具,把画面、操作与反馈连成可看的作品。

4相对 Fable 5.1,API 输入和输出单价均低 60%;相对 Opus 5,官方估算典型任务费用低约 40%。

Anthropic 发布了 Claude Opus 5.5。这次升级覆盖复杂编程、视觉与交互、知识工作,以及一直被吐槽的写作体验。在 Anthropic 的评测中,它的 Terminal-Bench 得分 66.4%,高于 Fable 5.1 的 55.8%;CursorBench 为 57.8% 对 51.8%。在代码库里连续解决问题,和在一段提示词后做出完整作品,是它最值得看的两种能力。

价格也改变了选择:Opus 5.5 的 API 输入、输出单价分别是每百万 Token 4 美元和 20 美元,比 Fable 5.1 的 10 美元和 50 美元都低 60%。与上一代 Opus 5 相比,Anthropic 称典型任务费用约低 40%,输出速度快 30% 以上。

每百万 Token
美元
输入 · Opus 5.5
 
4
输入 · Fable 5.1
 
10
输出 · Opus 5.5
 
20
输出 · Fable 5.1
 
50

这些升级在日常工作里,分别表现为:

01 / CODE

编程:更适合连续推进整项任务。跨文件修改和长时间工程任务更稳;CursorBench 的默认 medium 档已超过 Fable 5.1 的最高档。一般任务可以先从 medium 开始。

02 / VISUAL

视觉与交互:从“做个页面”走向更完整的作品。水下探索游戏、手绘动画、可调投石机和积木搭建工具,把画面、操作和反馈连成了完整体验。

03 / KNOWLEDGE

知识工作:更好地检索、整理和交付复杂资料。财报查证、并购建模和跨应用操作的表现都有提升;另一项专业工作测试达到 1846 Elo,高于 Fable 5.1 的 1735。

04 / WRITING

写作:少绕弯,先说重要信息,更愿意遵守你的表达规则。新版更愿意听反馈,少用套话;写文档和解释问题时,重要信息也更早出现。

Writing

写作升级:少一点套话,先把事情讲明白

Opus 5 的“AI 味”曾是高频吐槽:回答先铺背景、爱堆术语和套话,关键结论埋在后面;请它改两句,有时又忙着解释、争辩自己原来的写法。Every 的试用者说,旧版的解释常常“还需要再解释一遍”。写文档或长期协作时,这会让人把时间花在追问和改稿上。

Opus 5.5 主要改的是这种沟通体验。 Anthropic 称它会把重要信息放在前面,减少拗口的表达,更愿意遵守用户给的写作规则。官方账单排错示例让这个变化很容易看出来:新版先告诉你钱差在哪里,然后再讲代码出了什么问题。

1.1

同样找对 Bug,新版先说影响

两款模型都找到了同一个账单错误:代码把月末截止时间设成“最后一天的零点”,漏算了那一整天的用量。

区别在展开顺序。Opus 5 先指出是哪次提交引入问题,然后展示代码、解释时间区间,接着说明漏计影响及测试为什么没有发现它。Opus 5.5 一开始就交代:账单下降中,1.50 美元来自免费层调整,另外 9.92 美元来自 Bug;后者导致月末最后一天的用量没有计费。读者先知道影响多大,再读代码了解原因。

展开顺序
先后
Opus 5
1引入问题的提交
2展示代码
3解释时间区间
4漏计影响
5测试为何没发现
Opus 5.5
11.50 美元 · 免费层调整
29.92 美元 · Bug
3代码与原因
Opus 5与5.5解释同一账单Bug的官方并排截图
FIG.01左为 Opus 5,右为 Opus 5.5。两者都定位到错误,新版更早交代金额和漏计后果。

官方还展示了两组对照。总结 Slack 讨论时,两款模型都用了三条清单,新版把“问题、立即措施、长期方案”中的责任人和完成状态写得更容易跟进。解释国际象棋程序时,新版围绕“两个格子中间有没有棋子挡住”说明设计:用掩码记录中间格,再计算阻挡数量;数量为零,攻击才成立。它把技术细节连回了读者要理解的问题。

1.2

写得更自然,长文仍可能绕远

早期测试者 Theo Jaffee 用同一个提示词——“explain how options work”——展示了两款模型的回答。他认为 Opus 5.5 的写作更直接、自然,减少了让人出戏的套话。这条帖子在检索时约有 1300 赞

旧版先从“未来交易”和核心思想谈起,再列定义、类型及较长的算例。新版首段直接给出定义和权利金,随后将类型、术语、上涨与下跌情形、盈亏平衡点分开。区别在阅读顺序:先弄懂期权是什么,再看分类和算例。

Theo发布的Opus 5回答截图:解释期权原理
FIG.02Theo 标注的 Opus 5 回答:先铺陈概念,再进入定义与长段算例。
同提示词下Opus 5.5的回答截图
FIG.03Theo 标注的 Opus 5.5 回答:定义、分类和算例中的不同情形更容易逐项阅读。

企业反馈也更接近日常写作任务。

Ramp

Ramp 工程师 John Ruelas 表示,新版更能遵守团队写作规则,设计文档只需很少修改;重写的一条提示词甚至比他的原版更合意。

Box

Box 的 Yashodha Bhavnani 则称,在其评测中,Opus 5.5 使用的 Token 约为 Opus 5 的三分之一,回答冗长程度减少约 40%,同时保持准确性。

科技媒体 Every 的实测更看重协作体验变顺了:新版愿意接受修改意见,顺着给定材料继续创作,也更能解释取舍。

Every 测得的英文 Flesch-Kincaid 年级值为 6.95,低于 Opus 5 的 7.97 和 Fable 5.1 的 7.43,约对应美国七年级阅读难度;Reading Ease 易读分为 68.4。这项评分衡量英文词句是否容易阅读。

Flesch-Kincaid
数值越低越易读
Opus 5.5
 
6.95
Fable 5.1
 
7.43
Opus 5
 
7.97
Every测得的各模型英文可读性评分对比表
FIG.04Every / Daniel Rodrigues 的英文可读性表。Opus 5.5 比 Opus 5 更易读;图中 Grok 的两项分数还略好一些。
Note

写作仍有一个明显短板:话更好懂,重点却未必更早出现。Every 的文章开头测试中,新版用了 37—39 句表达作者 21 句的内容;Dan Shipper 也发现,它能找出最有意思的观点,却没有把它放在开头。

37—39
Opus 5.5
21
作者原文

这让 Opus 5.5 更适合一起讨论想法、扩充初稿;定稿时仍要检查第一段有没有直接说出核心观点。写作升级已经能从配合度和表达中感受到,精炼与取舍还需要编辑。

02
Demos on X

X 上的演示:游戏、动画与视觉完成度

X 上的开发者和 Anthropic 团队很快放出了可看的作品。游戏与动画最适合观察这次升级:它有没有把场景、操作和反馈真正做出来?

2.1

水下探索游戏:场景、任务和反馈连成了一次体验

Anthropic 团队成员 Edwin Arbus 的演示约有 1315 赞。他让 Opus 5.5 制作一款受安提基特拉机械启发的游戏,并称整个作品是一个约 3 MB 的 HTML 文件,通过 Three.js 在浏览器内运行,画面与声音均由代码实时生成。

视频先展示航船与潜水员,随后进入水下:鱼群、海草与光束形成环境;“寻找三枚青铜碎片”的目标、空气倒计时和声呐形成任务;找到机关后出现齿轮装置与完成画面。这组演示的价值在于,不同视觉与交互元素围绕同一探索目标组织起来了。

环境
鱼群 · 海草 · 光束
任务
青铜碎片 · 空气倒计时 · 声呐
反馈
齿轮装置 · 完成画面
视频
60 S


已关注
关注
重播 分享
观看更多
    小互AI

    0/0

    00:00/01:00
    进度条,百分之0
    00:00
    /
    01:00
    01:00
    全屏

    倍速播放中
    您的浏览器不支持 video 标签

    继续观看

    Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)

    转载
    ,
    Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)
    小互AI
    已同步到看一看写下你的评论

    Edwin 的水下探索游戏,60 秒。Anthropic 团队成员作品。
    2.2

    丧尸游戏对照:同题作品的画面差异

    第三方评测账号 BridgeBench 发布的对照约有 653 赞。作者称两款模型使用了相同提示词,讲解中明确标注先展示 Opus 5.5,后展示 GPT-6 Sol。

    前半段是较写实的城市射击场景:路面反光、建筑层次、枪械和界面元素较丰富;后半段则是更简化的方块角色与规则化场地。同一条演示里,两种作品的场景密度、画面风格和交互界面差别很直观。

    视频
    79 S


    已关注
    关注
    重播 分享
    观看更多
      小互AI

      0/0

      00:00/01:19
      进度条,百分之0
      00:00
      /
      01:19
      01:19
      全屏

      倍速播放中
      您的浏览器不支持 video 标签

      继续观看

      Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)

      转载
      ,
      Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)
      小互AI
      已同步到看一看写下你的评论

       
      2.3

      手绘动画:借助既有技能控制风格与转场

      开发者 superalesha 的动画约有 478 赞。他要求 Opus 5.5 表现 Claude 模型的发展过程,并说明使用了自己的 hand-drawn-canvas-animation 技能,作品以纯 JavaScript 制作。

      视频从铅笔、纸张和星芒标识出发,经过翻页、怀表齿轮、蓝图桥梁、风暴和色彩转场,最后落到一句问候。它展示了如何把统一画风维持到多段场景中。

      视频
      87 S

      已关注
      关注
      重播 分享
      观看更多
        小互AI

        0/0

        00:00/01:27
        进度条,百分之0
        00:00
        /
        01:27
        01:27
        全屏

        倍速播放中
        您的浏览器不支持 video 标签

        继续观看

        Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)

        转载
        ,
        Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)
        小互AI
        已同步到看一看写下你的评论



        03
        Explorations

        官方的八个作品,把能力展示得更具体

        Anthropic 还发布了一条早期探索合集。其中既有连续叙事的动画,也有能接受输入、给出反馈的应用原型。

        3.1

        连续叙事与数据重建

        No.01/ 08

        西瓜故事由 Kevin Ngo 制作。蚂蚁从搬运、种植到经历风暴、收获分享,形成了一段约 29 秒的手绘故事。它展示的是连续场景的表达,而不只是一张插画。

        视频
        29 S


        已关注
        关注
        重播 分享
        观看更多
          小互AI

          0/0

          00:00/00:29
          进度条,百分之0
          00:00
          /
          00:29
          00:29
          全屏

          倍速播放中
          您的浏览器不支持 video 标签

          继续观看

          Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)

          转载
          ,
          Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)
          小互AI
          已同步到看一看写下你的评论

          Kevin Ngo 的西瓜故事:蚂蚁搬运、种植、经历风暴,最后分享收成。
          No.02/ 08

          Earthrise 重建则利用图像线索和公开数据,复现阿波罗 8 号拍摄“地出”照片的时刻。演示从原照片出发,展示地平线边缘、位置、镜头拟合、光照与胶片响应等环节,再呈现重建画面。它把图像观察、资料与几何关系串进同一个可视化过程。

          视频
          MP4


          已关注
          关注
          重播 分享
          观看更多
            小互AI

            0/0

            00:00/00:52
            进度条,百分之0
            00:00
            /
            00:52
            00:52
            全屏

            倍速播放中
            您的浏览器不支持 video 标签

            继续观看

            Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)

            转载
            ,
            Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)
            小互AI
            已同步到看一看写下你的评论


            3.2

            把草图和视觉想法变成可操作界面

            No.03/ 08

            Kevin Ngo 的 Penpal 把 Claude Code 做成了纸笔风格界面:新会话是一张餐巾纸,项目列表、继续上次会话和用量都保留了具体操作入口。它在风格变化之后,仍然围绕原本的工作组织界面。

            Penpal纸笔风格Claude Code界面,包含项目列表、新建会话和用量
            FIG.05官方探索 3:Kevin Ngo 的餐巾纸界面,新建会话、继续任务和项目导航融入纸笔风格。
            No.04/ 08

            投石机从铅笔草图变成桌面上的三维模型。演示者可以拉动投掷臂、调整配重,看弹丸飞行并撞倒方块。这里不只有物体造型,还有“改变参数—观察结果”的交互关系。

            视频
            MP4

            已关注
            关注
            重播 分享
            观看更多
              小互AI

              0/0

              00:00/01:20
              进度条,百分之0
              00:00
              /
              01:20
              01:20
              全屏

              倍速播放中
              您的浏览器不支持 video 标签

              继续观看

              Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)

              转载
              ,
              Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)
              小互AI
              已同步到看一看写下你的评论



              No.05 · 06/ 08

              Tyler Nishida 的 UI 老虎机随机组合界面元素,为新应用提供起点。另一件作品来自 thedesignely:围绕甲虫海报做出视觉特效控制器,调整参数时,预览随之改变纹理和形变。前者帮助产生组合,后者帮助比较变化后的效果。

              视频
              MP4

              已关注
              关注
              重播 分享
              观看更多
                小互AI

                0/0

                00:00/00:16
                进度条,百分之0
                00:00
                /
                00:16
                00:16
                全屏

                倍速播放中
                您的浏览器不支持 video 标签

                继续观看

                Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)

                转载
                ,
                Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)
                小互AI
                已同步到看一看写下你的评论

                3.3

                生成之后,还能继续修改与复用

                No.07/ 08

                积木搭建应用接受照片或文字描述,输出三维积木模型及搭建说明。视频里能看到修改描述后的城堡、逐层步骤和零件指引:它尝试把“看起来像一个模型”推进到“告诉人如何搭起来”。

                视频
                MP4


                已关注
                关注
                重播 分享
                观看更多
                  小互AI

                  0/0

                  00:00/01:23
                  进度条,百分之0
                  00:00
                  /
                  01:23
                  01:23
                  全屏

                  倍速播放中
                  您的浏览器不支持 video 标签

                  继续观看

                  Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)

                  转载
                  ,
                  Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)
                  小互AI
                  已同步到看一看写下你的评论


                  No.08/ 08

                  Kevin Ngo 的 算法绘图程序则让同一套画风产生不同构图。官方说每幅画使用不同的随机种子;展示图中,海浪、岛屿和日落的位置不断变化,铅笔笔触和纸张质感保持一致。对于需要成组视觉素材的工作,这比只能输出一个固定结果更有复用价值。

                  18幅风格一致、构图不同的算法海景绘画
                  FIG.06官方探索 8:Kevin Ngo 的算法绘图,每幅对应不同种子。
                  04
                  Coding

                  编程究竟提升多少:默认档位已经很有竞争力

                  视觉演示之外,官方基准提供了另一种观察。下图涵盖编程、知识工作、电脑操作和图表识别。其中 OSWorld 采用 partial 计分,Chartography 在使用工具的条件下从 Opus 5 的 83.4% 提升到 89.0%。

                  Opus 5.5与Fable5.1、Opus5、GPT6 Astra及GPT5.6 Sol的完整官方评测矩阵
                  FIG.07官方完整评测矩阵。默认采用 max;Terminal-Bench 的 Opus 5.5 为 xhigh、Astra 为 high。
                  effort
                  Definition

                  “effort”可以理解为模型分配给思考的预算。更高档通常意味着花更多时间和费用,但不保证每项任务都得分更高。Opus 5.5 的一个变化,是默认 medium 已经能完成很多此前需要高档模型处理的工作

                  low
                   
                   
                  medium
                   
                  默认
                  high
                   
                   
                  xhigh
                   
                   
                  max
                   
                   
                  Terminal-Bench 4.0
                  A
                  66.4%

                  考察终端中的多步执行与问题解决。Opus 5.5 的 xhigh 得分为 66.4%,Opus 5 为 52.3%,Fable 5.1 为 55.8%,Astra 为 57.9%。medium 约为 58%,按官方比较,费用约为 Opus 5 max 的五分之一,也只需 Astra 同等表现约 40% 的费用。

                  Opus 5.5 · xhigh
                   
                  66.4%
                  Opus 5.5 · medium
                   
                  ≈58%
                  Astra
                   
                  57.9%
                  Fable 5.1
                   
                  55.8%
                  Opus 5
                   
                  52.3%
                  FrontierCode v1.1
                  B
                  54.6%

                  除了正确性,还关心修改能否达到代码库的合入标准。Opus 5.5 medium 得分 54.6%,max 为 54.4%;medium 以约 Astra 五分之一的任务费用,超过其 53.3% 的成绩。对这类任务,拉满预算不一定划算。

                  Opus 5.5 · medium
                   
                  54.6%
                  Opus 5.5 · max
                   
                  54.4%
                  Astra
                   
                  53.3%
                  CursorBench 4.0
                  C
                  52.5% · medium

                  来自真实用户的复杂跨文件任务。medium 得分 52.5%,已超过 Fable 5.1 max 的 51.8% 和 Opus 5 max 的 46.6%;相对 GPT-5.6 Sol 的 41.7%,费用约为其三分之一。Opus 5.5 max 得分进一步达到 57.8%,但费用也增加。

                  Opus 5.5 · max
                   
                  57.8%
                  Opus 5.5 · medium
                   
                  52.5%
                  Fable 5.1 · max
                   
                  51.8%
                  Opus 5 · max
                   
                  46.6%
                  GPT-5.6 Sol
                   
                  41.7%
                  Terminal-Bench不同思考档位的得分与费用曲线
                  FIG.08Terminal-Bench:medium 约 58%,high 约 64%,xhigh 66.4%;Opus 5.5 的标准误差为 ±2.6 个百分点。
                  FrontierCode不同思考档位的表现与费用
                  FIG.09FrontierCode:medium 与 max 成绩接近,费用差距明显。横轴为每任务美元,对数刻度。
                  CursorBench默认与最高思考档位的得分成本对比
                  FIG.10CursorBench:默认档 52.5%,最高档 57.8%;增益与成本需要一起看。

                  长任务反馈更接近工程现场。Anthropic 内部让模型将 HAProxy 从 C 改写为 Rust,Opus 5.5 用了 9.5 小时,Fable 5.1 为 12 小时;两者几乎通过全部回归测试,而 Opus 5.5 的费用低 51%。公告还收录了早期测试者不到一天完成 68 万行代码迁移、不到 3 小时审计修复 20 万行遗留代码的案例。

                  9.5小时
                  Opus 5.5 · HAProxy C → Rust
                  12小时
                  Fable 5.1 · HAProxy C → Rust

                  Stripe 工程师 Cristian Rivera 描述的是另一种难题:40 个层叠 PR 的复杂变基。一个 Opus 5.5 会话协调十几个会话,把冲突解释清楚;到第二天下午,40 个 PR 都通过了 CI。Clio 的 Sean Heintz 则报告,模型在跨六个仓库的任务中持续运行超过 18 小时,推进里程碑更快、返工较少。这里的进步既包括继续做事,也包括让人离开一段时间后能重新看懂进展。

                  Field Test Kieran

                  Every 的 Kieran Klaassen 还比较了同一道 Ruby 任务:Fable 5.1 high 写了 26 行,Opus 5.5 extra-high 写了 14 行,省掉了他不喜欢的解释性注释。在其程序性能测试中,Opus 生成的代码达到 427 次请求/秒,满足 20 项响应时间上限中的 17 项;Astra 的代码为 463 次/秒、14 项。前者峰值吞吐较低,却满足了更多延迟要求。这测的是生成程序的性能;Kieran 所说“约有 Fable 九成编程能力”则是个人使用判断。

                  Ruby 任务 · 代码行数
                  14
                  Opus 5.5 extra-high
                  26
                  Fable 5.1 high
                  次请求/秒
                  427
                  Opus
                  463
                  Astra
                  响应时间上限 · 满足项
                  17 / 20
                  Opus
                  14 / 20
                  Astra

                  Kieran 还用它搭建摄像头心率原型和 Cozy Island 三维岛屿。他认为 extra-high 的岛屿细节和镜头控制更好,胜过自己测试的 Fable 版本。

                  Opus 5.5构建的摄像头心率监视器原型
                  FIG.11Every / Kieran 的心率原型:截图中的 72 BPM 标为合成信号演示,并非真实心率测量结果。
                  Cozy Island基准测试对比:左为Fable 5.1,右为Opus 5.5
                  FIG.12Every / Kieran 的 Cozy Island:左为 Fable 5.1,右为 Opus 5.5,可见房屋、码头与时段滑杆。
                  Check the Flow

                  但漂亮的界面仍要跑通核心流程。Mike Taylor 的语音表单任务运行了 30 分钟、消耗约 590 万 Token:首页与登录页看起来不错,自动检查也通过了,实际打开构建和访谈页面却报错,指定 AI 服务也没有被调用。审查代码后,还要亲自走一遍应用的主要操作。

                  05
                  Knowledge Work

                  知识工作:查得清,交付也更完整

                  在 GDPval-AA v2.1 的专业工作测试中,Opus 5.5 取得 1846 Elo,高于 Fable 5.1 的 1735 和 Opus 5 的 1708。Elo 表示相对表现,不是正确率。按官方曲线,medium 已超过 Astra max,估算任务费用约为其五分之一。

                  GDPval-AA v2.1
                  Elo
                  Opus 5.5
                   
                  1846
                  Fable 5.1
                   
                  1735
                  Opus 5
                   
                  1708
                  GDPval专业知识工作得分与任务费用
                  FIG.13GDPval-AA:同一专业任务表现下,Opus 5.5 提供了更低费用的选择;最高档为 1846 Elo。

                  一个具体例子是财报查证。Anthropic 在财报新闻稿难以定位的网络副本中设置检索任务,要求模型检索并写季度报告,再逐个核查数字与引文。只要出现捏造,整份报告就不合格。Opus 5.5 的 18 次尝试中有 16 次通过,Fable 5.1 和 Opus 5 在这项测试中都没有通过。

                  财报查证 · Opus 5.5
                  16 / 18 通过
                   
                   
                   
                   
                   
                   
                   
                   
                   
                   
                   
                   
                   
                   
                   
                   
                   
                   

                  另一个内部测试让模型分析两家虚构 HR 软件公司的并购,做 Excel 财务模型和管理层汇报;两款模型估值结论相同,但 Opus 5.5 的产物更完整、易读,耗时 63 分钟对 93 分钟,费用低 50%。

                  63分钟
                  Opus 5.5 · 并购建模
                  93分钟
                  对照模型 · 并购建模

                  跨应用的 AutomationBench 得分从 Opus 5 的 26.9% 提升到 40.0%,但仍低于 Astra 的 41.4%。科学智能体测试也是 Astra 较高:64.6% 对 58.7%。

                  AutomationBench跨应用工作流通过率与费用
                  FIG.14AutomationBench 由 Zapier 运行。Opus 5.5 曲线优于 Opus 5 与 GPT-5.6 Sol,最高分略低于 Astra;测试中拦截调用计作失败。

                  在大规模资料收集的 WANDR 测试中,Opus 5.5 从 low 的约 31% 提升到 max 的约 72%,显示复杂检索仍可能受益于更多预算。

                  WANDR资料收集测试在不同预算下的结果
                  FIG.15WANDR:更高思考预算提高得分,也增加费用;使用的是 Anthropic 披露的离线工具设置。

                  Every 的咨询测试呈现了另一面:模型与一个模拟 Dan Shipper 的智能体谈判,连续修改 12 轮后达成共识;但限时 10 分钟制作客户培训流程表时,它先想了近 5 分钟,再制作训练数据、核对资产负债表,到第 9 分钟才写讲义,最终没交出逐分钟流程表。能持续推敲,不代表能排对交付优先级。

                  限时 10 分钟
                  逐分钟流程表:未交出
                     
                  0
                  5
                  9
                  10
                  思考
                  训练数据 · 资产负债表
                  讲义
                  06
                  Pricing

                  费用降低:单价更低,完成任务也更省步骤

                  官方所说的“典型任务费用低约 40%”,包含两部分:每个 Token 更便宜,以及完成任务所用的 Token 更少。Token 是模型处理与计费的文本片段,两者共同决定最终账单。

                  每个 Token 更便宜
                  +
                  完成任务所用的 Token 更少
                  =
                  典型任务费用低约 40%
                  Opus5.5与Opus5每百万Token价格
                  FIG.16官方价格表:输入与输出单价下降 20%,缓存读取单价下降 60%。
                  每百万 Token
                   Opus 5.5 Opus 5
                  输入
                  Opus 5.54 美元
                  Opus 55 美元
                  输出
                  Opus 5.520 美元
                  Opus 525 美元
                  缓存读取
                  Opus 5.50.20 美元
                  Opus 50.50 美元
                  缓存写入
                  Opus 5.55 美元
                  Opus 56.25 美元

                  对比 Fable 5.1 的每百万 Token 输入 10 美元、输出 50 美元,Opus 5.5 的 4 / 20 美元均低 60%

                  智能体会反复携带系统提示词、工具定义和上下文。能够重复使用的前缀命中缓存后,可以按更低的读取价格计费。因此,一项任务里缓存占多少、模型调用多少轮,都会改变总费用。以每次调用合计使用 100 万输入 Token、10 万输出 Token 为例,按表中的单价估算:

                  输入中缓存读取比例
                   Opus 5.5 Opus 5
                  0%
                  Opus 5.5
                   
                  6.00 美元
                  Opus 5
                   
                  7.50 美元
                  80%
                  Opus 5.5
                   
                  2.96 美元
                  Opus 5
                   
                  3.90 美元
                  100%
                  Opus 5.5
                   
                  2.20 美元
                  Opus 5
                   
                  3.00 美元

                  这只是固定用量的费用示例;实际账单还取决于缓存写入、调用轮数和最终 Token 用量。

                  标准模式的输出生成速度,官方称比 Opus 5 快 30% 以上。Claude Code 和开发平台还有 Fast mode,生成速度最高为标准模式的 2.5 倍,输入与输出价格分别为每百万 Token 8 和 40 美元。它适合愿意多付费用缩短等待的场景。

                  2.5
                  Fast mode · 最高生成速度
                  8 / 40美元
                  Fast mode · 每百万 Token
                  07
                  In Practice

                  真正用起来:给目标,也给停止点

                  Every 的 Tyler Nishida 只给了一条高尔夫游戏提示词,模型就组建了一个架构师、三位设计师和三位裁判协作的团队,运行了 1 小时 52 分钟,直到他的测试访问结束。成品截图中可以看到雷雨、浮岛、击球倒计时和球杆控制。

                  自组团队
                  1 小时 52 分钟
                  架构师
                  × 1
                  设计师
                  × 3
                  裁判
                  × 3
                  Opus 5.5自主搭建的高尔夫游戏原型截图
                  FIG.17Every / Tyler Nishida 的高尔夫游戏原型。单条提示词启动的是近两小时的自主制作过程。

                  持续做事也会持续消耗额度。Every 有测试者碰到了周用量上限;模型还曾主动否决自己生成的 90% 以上 UI 组件,Tyler 无法从理由中找到清楚的评价标准。

                  Before You Hand Off

                  派发长任务时,先说明最终交付物、时间或费用预算,以及什么条件下应该停止。先交出能用的核心结果,再决定是否继续润色,往往比让模型不断给自己加任务更有效。

                  1最终交付物
                  2时间或费用预算
                  3停止条件

                  Every 团队对模型的偏好并不一致:有人转回 Claude 做视觉和产品开发,有人仍用 Astra 编辑文章,取舍取决于具体工作。

                  视频
                  32 S


                  已关注
                  关注
                  重播 分享
                  观看更多
                    小互AI

                    0/0

                    00:00/00:32
                    进度条,百分之0
                    00:00
                    /
                    00:32
                    00:32
                    全屏

                    倍速播放中
                    您的浏览器不支持 video 标签

                    继续观看

                    Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)

                    转载
                    ,
                    Claude Opus 5.5 发布:多项基准超越 Fable 5.1 编程、视觉与写作大幅升级,价格却大幅降低(实战案例)
                    小互AI
                    已同步到看一看写下你的评论


                    Availability

                    Opus 5.5 已在 Anthropic 开发平台及 AWS、Google Cloud、Microsoft Azure 提供,API 模型 ID 为 claude-opus-5-5。Pro、Max、Team 和按席位计费的 Enterprise 五小时额度提高,订阅用户还获得一次可保存、择时使用的额度重置。Sonnet 5.5 与 Haiku 5.5 将在后续几周推出。

                    安全方面简要说:Anthropic 称其行为审计表现进一步改善,并为高风险任务配置了生产防护;部分场景会拦截或转交其他模型,具体取决于产品与接入方式。日常使用最值得关注的,仍是这次更强的工作能力、更清楚的沟通,以及完成同一项任务所需的时间和费用。


                    前往微信阅读全文

                    内容来自公众号,可前往微信查看原文。

                    查看作者的更多文章 →