晚上看了Ben Thompson对OpenAI总裁Greg Brockman的访谈。
Ben问了一个很好的问题:“所以这是一次模型发布,还是一次产品发布,或者这两者还有区别吗?”
Greg直接说这两者融合到一起了。
如果是一次模型发布,那重点得讲智能有多大提升、成本有多大下降,但感觉这两项并没有特别惊艳。
如果看AA的智能指数,Astra相比Sol的提升不到1分,都是61分,比Fable5.1低5分,比Fable5还低1分。
成本上,虽然token用量比Sol降低了70%,但价格也贵了2.5倍。综合看,单任务成本,Astra只比Sol降低了6%。
当然不同榜单,跑分有差异,跑分也与实际体验有差。目前我有收到两位用过Astra同学的反馈,认为确实好用,但谈不上代际级别的提升。
所以,这次不能把Astra单独当一个模型来吹。Greg这次着重吹的是Astra的computer use,就是操作计算机的能力。
Greg说,十年前,OpenAI就有一个愿景:
“如果你能搞定屏幕像素、键盘、鼠标,一个在上面端到端训练的 AI,它就能够真正去处理任何任务,任何你希望人们获得帮助的事情,这个 AI 都能做。
如果你看看过去两年我们所处的时代,那是一个连接器(connector)时代。你有某些软件,人类用起来完全没问题,但 AI 无法访问它。那你要怎么办?你不得不写一个非常具体的连接器去对接那些 API,而且并不是所有东西都对外开放,所以你不能做到人类能做到的一切。然后你再想想,有那么多软件根本没有 API,那些就彻底在边界之外了。
所以我们身处这样一个受限的世界:AI 在帮助你这件事上被束缚得如此之紧。我认为我们现在拥有的技术几乎就是那个通用连接器。”
其实这段话已经把OpenAI的焦虑说出来了。OpenAI为啥要做computer use,或者连接器,到底想连接什么?
上下文。
模型智能再牛逼,没有上下文,看不到outlook的客户邮件,访问不到one drive里面的文件,无法通过teams协作,一切白瞎。这是谁的领域呢?微软。
这也是微软一直在等的时刻,等模型层商品化(即模型之间的智能几乎无差异),然后通过“拥有上下文”取胜。
不过Astra的computer use还是基于模仿人类看屏幕、点鼠标、敲键盘的UI操作(类似Manus操作浏览器),速度远慢于直接接微软graph的API,而且成本远远更高。所以,computer use的作用仅限于访问没有API的软件。
但computer use这玩意,微软Copilot Studio在今年5月就已经有了,不仅可以选择OpenAI的computer-using agent,还可以用Claude。
当然,Astra的computer use肯定比前面模型更好用了,这从OSWorld 2.0的跑分和单任务时长上能看出来。而且模型实际使用体感也有提升。
但谈不上震惊瘫坐和AGI。
Fable 5和GPT 6 Astra(这次要把工程能力放进来一起吹,要不然内容不饱和?)让我隐隐约约感觉到,模型智能提升速度是不是有所放缓?希望哪位大佬一巴掌打醒我。