阅读,与值得关注的内容Readance

它的 token 标价只有对手一半,账单贵了 88%

一边是 $2/$6,一边是 $4/$20。跑完同一批任务,便宜的那个每任务收 3.74 美元,贵的那个收 1.99 美元。

◇  ◇  ◇

开篇

把两行价目表并排放在一起:

Grok 4.7        输入 $2 / 输出 $6   每百万 token GPT-5.6 Sol     输入 $4 / 输出 $20  每百万 token

看标价,前者便宜得不像话。输入价是一半,输出价只有零头。

再把 Artificial Analysis 跑完一整套 Intelligence Index 之后的账单并排放:

Grok 4.7 xHigh      $3.74 / 任务 GPT-5.6 Sol Max     $1.99 / 任务

标价便宜一半的那个,结账时贵了 88%。

9 月 21 日,xAI 发布 Grok 4.7。这个反转不是黑它,恰恰是这次发布最值得琢磨的地方。

标价与账单的反转

标价与账单的反转

◇  ◇  ◇

昨天到底发生了什么

先把事实摆清楚。

Grok 4.7 在 9 月 21 日上线,同一天进了 Cursor、Grok Build、Grok API,GitHub 也在当天的 changelog 里宣布灰度推送到 Copilot 全家桶——VS Code、JetBrains、Xcode、CLI、云端 agent 都有份。

官方说法是:底座模型比 4.6 大(HN 上有人扒出多约 40% 的权重),强化学习跑得更久,训练任务里刻意加重了"要干好几个小时才能完成"的那一类,还有一整套新的安全防护栈。

价格一分没涨。$2 / $6,跟 Grok 4.6 完全一样。另有一个双倍速的 fast 版本,收双倍价。

官方放出来的对比表也确实好看。七项 benchmark,对比对象是 Grok 4.6、GPT-5.6 Sol Max 和 Claude Fable 5.1 Max:

benchmark
Grok 4.7
Grok 4.6
GPT-5.6 Sol
Fable 5.1
CursorBench 4.0
46.3%
40.4%
41.7%
51.8%
DeepSWE v1.1
71.0%
65.2%
72.7%
70.0%
EEBench(电子工程)
64.0%
53.0%
39.4%
56.4%
Terminal-Bench 4.0
38.0%
20.3%
37.3%
57.9%
Harvey 法律 agent
19.6%
15.8%
2.5%
6.7%
HealthBench Pro
56.7%
48.5%
60.5%
62.1%

对着 4.6 那一列看,每一项都涨。Terminal-Bench 从 20.3% 跳到 38.0%,近乎翻倍——这个幅度在一代模型之内是相当罕见的。

Harvey 法律 agent 那一行尤其扎眼:19.6% 对 GPT-5.6 Sol 的 2.5%,快到八倍。EEBench 也是压倒性的。这两块是 Grok 这次真正拉开身位的地方,跟"代码"关系不大,但对某些行业是实打实的。

问题出在别的地方。

官方对比表的七个格子

官方对比表的七个格子

◇  ◇  ◇

同一个测试,三个数字

Terminal-Bench 4.0 这一项,你现在能查到三个互不相同的分数。

官方口径:38.0%。

Artificial Analysis 用 Grok Build 这个 harness 跑:33%。

Artificial Analysis 单测模型本身(xHigh 档):大约 26%。

三个数不是谁在撒谎。差别在谁来跑这个模型。

Terminal-Bench 测的是多小时的终端任务——开 shell、读文件、试错、改、再试。模型只是发动机,真正决定跑多远的,是外面那层 harness:怎么切上下文、工具怎么定义、失败了怎么重试、什么时候压缩历史。换一层壳,同一个模型能差七个百分点。

这不是 Grok 一家的毛病,是整个行业现在读 benchmark 的基本常识:看见一个分数,先问它是在谁的 harness 里跑出来的。

顺带说一句,官方那张表里还有个小动作被 HN 挑了出来——Grok 4.7 用的是 xHigh 推理档,对比的 Grok 4.6 用的是 High 档。不同档位比,涨幅自然好看。

按 AA 的独立口径往外看一眼,位置就没那么乐观了:

Terminal-Bench 4.0:GPT-6 Astra 60%,Claude Fable 5.1 55%,DeepSeek V4.1 Flash 27%,Grok 4.7 约 26%。

连便宜很多的 DeepSeek V4.1 Flash 都在它前面一点。开发者 Dan McAteer 在 X 上对这个成绩的评价只有一个词:"horrendous"。

AA 的综合 Intelligence Index 同样:Grok 4.7 拿 46,Fable 5.1 和 GPT-6 各 53。中游偏上,没进第一梯队。

同一个 benchmark 的三个数字

同一个 benchmark 的三个数字

◇  ◇  ◇

真正贵的那一项,不在价目表上

现在回到开头那个反转。

AA 测了一件价目表上不写的事:跑完一个任务,模型要吐多少 token。

Grok 4.7 xHigh    约 81,000 output token / 任务 Grok 4.6 High     约 36,000 GPT-6 Astra Max   约 27,000

比上一代自己多烧 125%,比 GPT-6 Astra 多烧 196%。

单价低,但用量翻了三倍,乘出来就是那个 $3.74。而标价高得多的 GPT-5.6 Sol Max,因为话少,结账 $1.99。

这里面有一条对任何团队都成立的提醒:你买的不是 token,是"一件完成的活"。一个函数跑通、一份文档过审、一个任务不用重试——这才是计价单位。按 token 单价做选型,等于按面粉价格点面包。

还有一笔更隐蔽的账。HN 上有人把它扒了出来:

Grok   $2/M 输入,$6/M 输出,但 cache read $0.50/M Fable  $10/M 输入,$50/M 输出,但 cache read $0.25/M

长跑型 agent 的账单结构里,cache read 常常是大头——每一轮对话都要重读前面积累的上下文。Grok 在这一项上反而是 Fable 的两倍价。发布会的幻灯片不会放这一行。

token 用量把单价优势吃掉

token 用量把单价优势吃掉

◇  ◇  ◇

也别一棒子打死

话说回来,这次发布不是没有真东西。

AI 圈的 @haider1 在 X 上把 CursorBench 的 cost-per-task 排行截了图,用词是"absurd actually":

Grok 4.7 xHigh     46.3%  @ $6.01 / 任务 Fable 5.1 Medium   46.8%  @ $7.05 / 任务 GPT-5.6 Sol Max    41.7%  @ $8.23 / 任务

在 CursorBench 这个场子里,Grok 4.7 用更少的钱换到了几乎相同的分数。同一个模型,换个 benchmark 就换个结论——这恰恰说明"值不值"这个问题没有全局答案。

HN 上也有长期用户给出了很具体的定位:

它不是最便宜的,也不是最强的,但对我的 backend、Go、基建活儿来说,这个组合刚好。

反面评价同样具体。有人吐槽它"会几乎立刻结束任务然后宣布 Done",是几个主流模型里最偷懒、最爱糊弄的一个。也有人用了 Cursor 之后觉得它画 SVG 比 4.6 明显强。

幻觉这块倒是实打实进步了:AA-Omniscience 测出来的幻觉率从 4.6 的 34% 降到 29%。

换个场子换个结论

换个场子换个结论

● ● ●

◇  ◇  ◇

写在最后

如果你正在给团队选模型,这次发布最有用的不是那七行 benchmark,是它暴露出来的那套读数方法。

三件事,今天就能做:

  1. Ⅰ别再用 token 单价做横向对比。
     记一个新指标:完成一个你们自己的真实任务,花多少钱。AA 管它叫 cost per task,你们内部叫什么都行。
  2. Ⅱ看见 benchmark 分数,先问是谁的 harness。
     38%、33%、26% 是同一个模型同一个测试,差别全在外面那层壳。
  3. Ⅲ把 cache read 单价单独拉出来看。
     长跑 agent 的账单里它经常是最大的一块,而它几乎从不出现在发布会的价格对比图上。
选型时该看的三个数

选型时该看的三个数

至于 Grok 4.7 本身——拿你们最常跑的那三类活儿,同样的文件、同样的完成标准,让它和现在的默认模型各跑一遍。记四个数:过没过、改了几轮、用了多久、花了多少。

三个任务不叫 benchmark。但足够让你在换默认模型之前,看清账单长什么样。

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →