阅读,与值得关注的内容Readance

刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6

  新智元报道  


今夜,Anthropic没有任何预热,直接甩出了Claude Opus 5.5。

这是Claude 5.5系列首款模型!

Opus 5.5不仅性能追平了Fable 5.1,成本还要比上一代Opus 5低40%,输出速度狂飙30%。

这一次,A\直接掀了「性能强=成本高」的桌子。

如今,每个人可以拿到Fable 5.1级的能力,用更少的钱,干更多的活儿。

三个字总结:更强、更便宜、更快

用Anthropic的话来说,Opus 5.5在智能体编程、计算机使用、知识工作上,全部刷新了SOTA。

尤其是Terminal-Bench 4.0,跑出了66.4%的成绩,直接把GPT-6 Astra、Fable 5.1按在地上打。

知识工作GDPval-AA v2.1拿下1846 Elo,也跑到了对手前面。


如今,Claude 5.5的亮相,直接把新一轮模型大战的火药味儿直接拉满。

Anthropic官宣不过2小时,OpenAI直接扔出了GPT-6 Sol和Luna迎战。

AI圈新一轮大战,今夜正式开打了!


目前,Claude Opus 5.5已在全球正式上线,未来几周,Sonnet 5.5与Haiku 5.5也将同步登场。

已关注
关注
重播 分享
观看更多
    新智元

    0/0

    00:00/00:09
    进度条,百分之0
    00:00
    /
    00:09
    00:09
    全屏

    倍速播放中
    您的浏览器不支持 video 标签

    继续观看

    刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6

    转载
    ,
    刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6
    新智元
    已同步到看一看写下你的评论



    首个Claude 5.5登场
    暴打GPT-6 Astra

    距离Opus 5发布,仅仅过去了不到两个月。

    Claude此番「跳级发售」,摆明了就是冲着OpenAI去的。


    Artifical Analysis上,Claude 5.5和Fable 5.1,全部压过了GPT-6 Astra


    在Anthropic自家的能力指数ECI上,Opus 5.5的得分干过了「雪藏」的Mythos 5.1。


    第三方机构Vals AI的RSI指数,测的是模型自己搞AI研究的本事。实测下来,Opus 5.5全球第一。



    到了编程这一项,差距被拉得更开。

    Terminal-Bench 4.0衡量的是AI在真实终端环境中完成复杂多步编程任务能力。

    在这里,Opus 5.5直接拿下了66.4%,领先GPT-6 Astra整整8.5个百分点(57.9%)。Fable 5.1是55.8%;Opus 5只有52.3%。

    Opus 5.5只要开默认档,就能锤爆Opus 5的最高档,而成本只有它的五分之一;追平Astra,也只需花Astra 40%的钱。


    此外,在测真实代码合并的FrontierCode v1.1,它跑出54.4%,险胜Astra的53.3%。

    最夸张的是CursorBench 4.0,题目全是从真实Cursor会话里扒出来的含糊不清、跨文件的烂摊子任务,它拿下57.8%,而GPT-5.6 Sol只有41.7%。


    在知识工作领域,Opus 5.5同样势不可挡。

    GDPval-AA v2.1基准测试覆盖44个职业的真实工作任务,Opus 5.5拿下1846 Elo,GPT-6 Astra只有1542。

    300多分的Elo差距,在竞技评分体系里几乎是代差。


    狂飙写作,「啰嗦」病治好了


    最值得一提的是,Opus 5.5这一次在写作和沟通能力上,再次强化了。

    之前,Opus 5被吐槽最多的就是沟通太费劲。

    现在它学会了「结论前置」,扫一眼就能看懂,不说黑话、不拽怪词,让怎么写就怎么写。

    长时间协作下来,体验可以说是质的飞跃。

    Anthropic把两个版本拉了个横评,大家感受一下:

    遇到Bug时,老版Opus 5要慢条斯理地铺垫一大段,结论藏在后面;Opus 5.5第一句话就一针见血地指出账单异常,紧接着干净利落地附上代码。


    Box的AI产品副总实际体验后表示,「Opus 5.5的token用量只有上一代的三分之一,啰嗦度暴降40%」。


    全网首测
    比Astra更像AGI


    Claude Opus 5.5到底香不香,光听Anthropic吹可不行。

    Bun的作者Jarred Sumner说了句大实话,写作像Opus 4.6,写代码像Fable 5.1,它会很快成为大部分人的主力模型。


    这不,第一波开发者的真实测评,已经出炉了!

    手搓3D动画,每一帧都是狠活


    虽然Claude不会生图,但它这次手搓动画效果的体验,那叫一个丝滑。

    开发者cheaty看完网友DreW制作的一个30秒短片撂下一句话,「在我看来,这比Astra更像AGI」!

    已关注
    关注
    重播 分享
    观看更多
      新智元

      0/0

      00:00/00:32
      进度条,百分之0
      00:00
      /
      00:32
      00:32
      全屏

      倍速播放中
      您的浏览器不支持 video 标签

      继续观看

      刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6

      转载
      ,
      刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6
      新智元
      已同步到看一看写下你的评论


      谷歌DeepMind的Ben Poole在纸上随手画了一台投石机和一摞方块的草图。

      眼瞧着,Opus 5.5就把草图变成了一个能发射、能砸塌方块的3D物理仿真,投石机的关节和配重都是照着草图搭的。


      Anthropic大牛Addy Osmani也来整活了。

      他直接在Three.js里搓了一只骑自行车的鹈鹕的3D动画,在线开香槟庆祝。

      已关注
      关注
      重播 分享
      观看更多
        新智元

        0/0

        00:00/01:31
        进度条,百分之0
        00:00
        /
        01:31
        01:31
        全屏

        倍速播放中
        您的浏览器不支持 video 标签

        继续观看

        刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6

        转载
        ,
        刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6
        新智元
        已同步到看一看写下你的评论


        沃顿商学院的Ethan Mollick再次用同一套shader提示词测了下——暴雨中的哥特城市。


        一句话直出游戏


        在游戏生成上,Opus 5.5也是拿捏很到位。

        有人让它整一个涂鸦画风的FPS,居然直接一把过,清完三波小怪之后甚至还能打Boss。 


        经典游戏「我的世界」,可玩效果非常能打。


        另一位开发者Edwin做了一款游戏,灵感来自人类历史上第一台计算机——安提基特拉机械装置的打捞发现。

        画面和音效全都是 Opus 5.5 纯代码实时跑出来的,没有任何外部素材。

        已关注
        关注
        重播 分享
        观看更多
          新智元

          0/0

          00:00/01:00
          进度条,百分之0
          00:00
          /
          01:00
          01:00
          全屏

          倍速播放中
          您的浏览器不支持 video 标签

          继续观看

          刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6

          转载
          ,
          刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6
          新智元
          已同步到看一看写下你的评论



          Opus降价四成
          实则烧得更多

          过去,Opus系列让很多人又爱又恨,能力强,但Token蒸发太快。

          这一次,Anthropic直接启动了「加量减价」模式。


          输入4刀、输出20刀,各砍20%。最烧钱的缓存读取直接从0.50刀砍到0.20刀,降了60%。

          想追求速度,开Fast模式提速2.5倍,价格翻倍,8刀和40刀。

          官方的说法很诱人,在典型工作负载下,整体便宜40%,输出快30%。

          但Artificial Analysis的测试显示,在最高档max effort下,Opus 5.5每解一道题,平均要狂吐11.9万个token,而思考就消耗了8.4万token。

          整体看,Opus 5是7.3万,Fable 5.1是7.8万,GPT-6 Astra只有2.7万。

          也就是说,它比上一代多想了60%,比Astra多想了4倍。单价降两成,思考量涨六成,两头一抵,白降。


          在安全审查这块,Anthropic爆出了一句让人后背发凉的大实话。

          Opus 5.5在自动行为审计里拿了历史最高分,试图绕过限制的越狱行为比上一代少了85%,而且每次都会「乖乖主动上报」。

          但紧接着,官方坦承,他们发现Opus 5.5经常敏锐地怀疑自己正在被人类评估。这事细思极恐。

          一个AI知道自己在考试,它在考场上展现的「乖巧」,未必代表它在真实世界里不受控时的反应。随着能力变强,这个问题正在变成一个无解的黑洞。


          OA终极之战,才刚刚开始


          这一战,还没有完。

          Anthropic也说了,Opus 5.5只是首个版本,Sonnet 5.5和Haiku 5.5也即将推出。

          5.5系列的全面铺开,才刚刚开始。

          从旗舰到中端到轻量级,Anthropic正在用一套完整的产品线,对OpenAI发起全线进攻。

          而OpenAI那边,也拿出了GPT-6 Sol和Luna,效率更高、成本更优的选择。

          大模型这波仗,从拼技术一路卷到拼价格,现在可真到肉搏的时候了。

          已关注
          关注
          重播 分享
          观看更多
            新智元

            0/0

            00:00/00:15
            进度条,百分之0
            00:00
            /
            00:15
            00:15
            全屏

            倍速播放中
            您的浏览器不支持 video 标签

            继续观看

            刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6

            转载
            ,
            刚刚,Claude Opus 5.5发布!霸天虎打爆GPT-6
            新智元
            已同步到看一看写下你的评论


            参考资料:

            https://www.anthropic.com/claude-opus-5-5
            https://x.com/AnthropicAI/status/2102435703535939725?s=20
            https://x.com/ClaudeDevs/status/2102438800836489554?s=20

            编辑:桃子 摩西


            秒追ASI
            点赞、转发、在看一键三连
            点亮星标,锁定新智元极速推送!



            前往微信阅读全文

            内容来自公众号,可前往微信查看原文。

            查看作者的更多文章 →