中国AGI两条上山路径:一条让机器理解、运用语言,另一条让机器认知、推演并改造世界,二者终会交汇。作者 | Ada 编辑 | 漠影 过去三年,通往AGI的主叙事,几乎都从语言开始:更多文本、更大参数、更长上下文、更强推理,再加上工具调用与智能体。这条路已经证明了自己的力量。它让机器能够读写、编程、检索、规划,并开始接管一部分原本只存在于电脑屏幕里的复杂工作。但当任务从“在网页上完成一份表格”变成“把一个灯泡稳稳拧进灯座”,问题忽然变了。机器人不仅要看见物体,还要判断手指该怎样接触、这一下转动会发生什么、拧偏了是否应该停下、下一步怎样纠正。它需要的,不只是一个能描述世界的模型,而是一套能在行动前预演后果、在行动后复盘得失的内部世界。这正是当下AGI竞争开始出现分岔的地方。同样脱胎于清华实验室的智谱与生数,恰好提供了两组值得观察的中国样本:前者以语言模型与智能体为核心组织能力,后者以世界生成、实时交互与世界动作模型为线索推进。它们像在同一座山的两面攀爬:一面从人类已编码的语言和知识出发,另一面从世界持续发生的变化与反馈出发。一条路从语言出发,一条路从世界出发。地貌不同,难题不同,却指向同一座山。而要看清第二条路究竟难在哪里,最好先把镜头从宏大的AGI拉回一双正在工作的手。把一只灯泡拧进灯座,看上去是一个再简单不过的动作。真正难的地方,恰好发生在最容易被忽略的一瞬间:灯泡的螺纹刚刚碰到灯座,手指需要感到那一点阻力;旋转角度偏了,玻璃会卡住;握得太紧,动作又会变形。人的手并不会先算完一长串公式再行动,它会一边看、一边碰、一边根据细小的反馈调整下一下力道。这才是“手巧”的本质。它不是把一段动作重复得更像人,而是在每一次动作之前,能判断这样做会发生什么;在每一次接触之后,能知道自己该如何改。今天的机器人,离这件事仍有距离。它可以看懂“把灯泡拧上去”这句话,也可以在实验室里复刻一段训练过的轨迹。但当灯泡的位置偏了一点、手指碰到了新的材质、物体在旋转中开始打滑时,真正考验它的不是有没有一双会动的手,而是有没有一个会预演后果、理解反馈的“内在世界”。这也是世界模型之所以成为AI新前沿的原因。而不久前亮相的Motus2,正是生数沿着这条路线,走到“手必须真的碰到世界”这一关时,给出的一个新答案。 01.世界模型越说越乱闭环却越来越清楚
世界模型——不同领域正从不同入口,撞向同一个问题。视频生成,想让模型学会世界如何随时间展开:人物转身后是否还是同一个人,镜头移动后空间关系是否依然成立,一只杯子落下时会不会遵守重力。空间智能,希望模型生成可以从不同视角检验的环境;机器人和自动驾驶,则必须回答一个更苛刻的问题:如果我向左移动两厘米、夹爪收紧一点、手腕多转五度,世界接下来会变成什么样?表面上,它们产出的东西不同:像素、空间状态、动作轨迹。底层却都绕不开同一个闭环:智能体观察世界,采取行动,行动改变世界,新世界再产生新的观察。今年6月,李飞飞与World Labs团队在《A Functional Taxonomy of World Models》中,给这个混乱的概念画了一张功能地图。文章从经典的POMDP框架出发,将当下被称为世界模型的系统概括为三种主要功能:输出像素观测的渲染器、输出几何或物理状态的模拟器,以及输出下一步行动的规划器。这套分类的重要之处,在于先把“大家到底在做什么”讲清楚。两个月后,朱军团队发布《General World Models from First-Principles》,又从另一个方向向前推了一步。如果说前者问的是:今天被称作世界模型的系统,分别在这条链路上输出了什么?后者问的则是:一个模型若要真正走向“通用”,这些能力应当如何在同一个循环中耦合、成长和自我修正?这两个问题并不冲突,反而构成了理解当前世界模型的一对坐标。李飞飞团队为行业拆开了“渲染、模拟、规划”这些功能部件;朱军团队则把视线放在部件之间如何真正转起来:模型要理解此刻的世界,预测不同条件下的未来,采取改变世界的行动,再让真实反馈进入下一轮理解与决策。这也是朱军团队所说的通用世界模型第一性原理:理解、想象、行动,不是并列的功能标签,而是一条不能断开的因果链。只会生成未来画面,模型仍可能只是一个“看起来很懂世界”的旁观者;只有当它的动作会改变环境,而环境又能反过来修正它下一次动作时,模型才开始成为这个世界里的参与者。为了把这条路讲得更清楚,朱军团队将通用世界模型划分为五级:L1是世界生成,模型学习世界如何演化;L2是与世界交互,外部输入开始持续改写后续状态;L3是在世界中行动,模型的动作进入环境,并从环境变化中获得反馈;再往上,L4是能够围绕长期目标自主感知、规划、探索和学习的世界智能体,L5则进一步走向多个机器人、数字智能体、人类与工具之间的协同组织。这是自主性逐级解锁的路线图。 02.AGI的两条坡不是互相替代的两套智能