阅读,与值得关注的内容Readance

一个持续活着的 AI 世界,到底难在哪?

在《黑客帝国》里,The Matrix最可怕的地方,不是它能生成一个逼真的世界,而是可以让这个世界一直运行。

红绿灯照常切换,汽车驶过街口,尼奥可以推开任意一扇门,走进任意一条街,只有当规则偶尔失效、系统露出破绽,人们才会意识到,眼前的现实其实是一套代码。

二十多年后,实时世界模型已经开始靠近这个想象的一部分。模型可以实时生成道路、建筑和人物,用户也可以进入其中移动、探索,甚至直接改变接下来发生什么。但今天的实时世界模型,还很难做到基础的一点:让这个世界持续存在。

爱诗科技最新发布的通用实时世界模型 PixVerse R2,值得关注的也在这里。它并不是简单增加某一种玩法,而是尝试把移动、改写、叙事和角色互动放进同一个持续运行的实时世界里。

上线后,PixVerse R2 迅速登上twitter 热度总榜第二名的位置,获得了海外用户极高的关注度

从用户能够感知到的体验看,大致可以拆成三层。

第一层是实时探索。

相比今年年初首发的PixVerse R1主要通过提示词改变后续画面,R2加入了方向移动、镜头控制、跳跃等更接近游戏的操作。比如在一段滑雪Demo中,人物可以持续向前滑行,也可以随时改变方向。随着视角和路线变化,远处的雪道、山体和环境继续生成。

第二层是实时改写世界。

用户不只决定“往哪里走”,还可以在世界运行过程中继续改变它。例如让R2生成一个繁华都市的街头夜景,用户可以临时要求下雪,也可以让一名路人出现并上前问路。模型需要尽量保留原有街道、人物和空间关系,同时把新的天气、角色和事件加入其中。

第三层是持续叙事和角色互动。

在互动Demo《Zero Mark - 零印法师》中,玩家可以在场景里漫游、召唤怪物、许愿,也可以与其中的角色直接交谈。模型不仅要决定下一帧长什么样,还要记住人物身份、剧情进度和此前发生过的事件。

为了支撑这些体验,R2还增加了一层更底层的能力:多模态、低延迟输入。文字、语音、图片参考、方向键和镜头控制可以共同进入系统,而不同信号对应不同的响应速度——转向、移动需要即时反馈,复杂文本指令则可以留给模型更长的处理时间。

这些能力单独看都不算新,真正的难点在于,它们要同时作用在一个持续的世界状态上。

这也是实时世界模型真正值得想象的地方。

如果一个生成出来的世界能够持续存在、接受人的输入,并根据新的行为不断往前演化,它就不再只是生产视频的工具,而可能成为一种新的数字环境。游戏不必预先写完所有地图和剧情,影视内容可以随观众选择实时展开,数字人、虚拟空间乃至机器人的训练环境,也可以从“被提前制作”变成“边运行边生成”。

The Matrix当然仍是遥远的科幻想象,但通往那种世界的第一步,或许并不是把画面做得更逼真,而是先让一个生成出来的世界真正“活下去”。

 一个世界为什么很难既聪明,又跑得足够快? 

R2被定义为“实时世界模型”。

“实时”意味着,这个世界不是提前生成完再交给用户,而是跟着人的操作继续往前走;“通用”则意味着,它不只服务于某一种场景。用户可以在里面移动、转向,也可以临时改变天气、加入角色,或者让故事继续发展。

通用实时世界模型每生成一步,都要把刚刚发生过的事情带到下一步里,这条路在哪里、这个人是谁、刚才发生了什么、用户现在又想做什么。

时间越久,链路越长,技术上面临的难度就越大。

一方面是“一致性”。模型需要记住越来越多过去的信息。一个角色不能走出镜头再回来就换了衣服,一栋建筑不能转过身就消失,已经发生过的剧情也不能被下一轮生成覆盖掉。前面的输出还是后面的输入,一个小错误如果没有被及时纠正,也可能一路积累下去。

另一方面是速度。世界越复杂,需要同时维护的状态越多,计算量也越大。但实时交互留给模型的时间非常有限。生成视频慢十几秒,用户可以等;聊天模型停顿一两秒,也还能接受。但如果按下方向键后,几分钟人物才开始移动,这个产品就很难再被称为“实时”。

过去两年,不少团队都在模型能力和速度上做取舍。

Google DeepMind在2025年发布的Genie 3,已经可以用720p、约24帧的速度实时生成环境,并把一致性维持数分钟。用户也可以临时改变天气、加入物体。但DeepMind同时承认,它目前能够处理的动作空间仍然有限,多角色交互和更长时间运行也没有完全解决。

Odyssey选择了另一种方式。Odyssey-1最快可以做到约40毫秒生成一帧,并连续运行5分钟以上。为了让世界不那么容易在长时间生成中“跑偏”,团队主动把后训练的数据分布收窄了一些。但代价也很直接,模型更稳定了,但能处理的世界更窄。

World Labs在做RTFM时,要求单张H100上就要达到可以交互的帧率。但这个要求反过来影响了整个系统设计,它没有让模型无限读取此前所有画面,而是只调取与当前位置有关的空间记忆,以控制上下文和计算量。

这些方案技术上并不一样,但背后的逻辑是一致的:实时不是模型做好之后再考虑的性能指标,而是一条从一开始就存在的预算线。多少算力、多少延迟,基本决定了模型能记多久、世界能做多复杂、用户可以做多少事情。

很多时候,先决定的不是“世界能有多大”,而是“机器能不能跑得动”。

这也是为什么过去不少实时世界模型最终都会在某个地方做减法:缩窄场景、减少动作、限制持续时间,或者降低模型规模。这背后基本是同一个思路:把系统压进实时的计算预算里,再在剩下的空间中增加能力。

R2想尝试的是另一种解法。

根据爱诗科技公开的技术路线,它先扩大模型能够处理的任务、模态和时间尺度,再想办法把同一个模型压进实时运行的延迟范围,而不是一开始就针对某个场景训练一个更小、更窄的模型。

这并不意味着通用和实时之间的矛盾已经被彻底解决。R2在复杂场景细节、物理一致性和更长时间运行上,仍然有明显的提升空间。但它最起码验证了一件事,一个实时世界,不一定先要把自己做小。

 R2没有缩小城市,而是换了建城的顺序 

R2背后,爱诗做了一个反直觉的选择。与其一开始就在速度和能力之间找一个折中点,不如先把两个问题拆开:基础模型只负责把世界做得足够复杂;等模型学会了,再解决怎么让它跑得足够快。先穷尽能力边界,再攻克效率边界。

R2主要有两个核心训练阶段。

第一阶段是Omni Causal AR。爱诗先训练一个统一的因果世界模型,让它吸收更多视频、任务和交互轨迹,同时把文本、参考图、声音、WASD等性质差异很大的信号,放进同一套模型中处理。

这一阶段的核心是Scaling。R2的Scaling并不只发生在参数规模上,而是同时扩展五个维度:模型容量、数据、任务、控制信号和时间尺度。训练对象从几秒钟的独立视频,延伸到连续长视频和多轮交互;模型需要学习的,也从“下一帧长什么样”,变成“在此前已经发生这些事情之后,世界接下来应该如何变化”。

这首先会带来两个现实问题。

一个是,不同指令发生在不同的时间尺度上。按下方向键之后,几十毫秒内就需要得到反馈;但一句“让天空开始下雪”,影响的却可能是之后数秒的世界。如果把所有交互都切成相同长度的生成单元,要么简单动作响应过慢,要么复杂事件无法完整展开。R2因此引入Dynamic Chunk,让方向移动等简单操作使用更短的生成单元,完整事件则保留更长的时间窗口。

另一个问题是记忆。世界持续运行之后,历史状态会越来越长,但模型不可能在每一次生成时,都重新计算此前出现过的所有画面。R2因此把长期的人物和环境信息、近期动作,以及之后可能再次调用的对象状态分别保存;对于运行过程中已经暴露出的错误,则通过Error Bank重新放回训练。爱诗称,在内部测试中,这套机制将长期亮度漂移指标从0.201降低到0.129。

先把世界训练完整,第二步才是让它真正跑起来。

过去,一套长视频模型要走向实时,往往需要经过多次能力迁移:先从双向视频模型转成自回归模型,再训练用于蒸馏的Teacher,经过 DMD蒸馏,最后还要用Self-Rollout处理训练阶段和真实推理之间的差异。链路越长,每一次迁移都可能损失一部分此前已经获得的画质、动作能力和长程一致性。

R2把这条链路压短了。完成长程训练的Omni Causal AR,直接成为实时模型蒸馏的起点。到了实时阶段,模型不再重新学习一遍“世界应该如何运行”,而是集中解决一个工程问题:怎么用更少的计算,把已经学会的能力跑出来。

爱诗主要从计算本身下手。Block-sparse Attention不再让每一个Token都重新计算完整历史,而是只处理当前真正相关的时空信息。爱诗称,这可以把Attention的稀疏度提高到90%以上。另一套Pyramid方案,则先以较低分辨率确定人物动作、镜头运动和场景结构,再把成本更高的高分辨率计算留给纹理和细节。

所以,R2真正的变化并不只是“用了一个更大的模型”。它没有通过把模型做小来换取速度,而是试着降低一个更复杂模型每一步运行所需要的计算成本。

这层差别决定了,R2面对的不只是一轮性能优化。

如果实时性始终需要靠缩小模型、限制任务或者收窄场景来获得,那么模型每向外扩展一步,都会重新撞上速度这堵墙。能力和效率始终绑在一起,Scaling也就很难持续:模型越强,运行越慢;为了重新获得速度,又不得不削掉一部分已经获得的能力。

到了实时世界模型,问题又多了一层。模型扩大之后,计算成本也会随之增加;而无论能力增长多少,一个需要几秒钟才能响应方向键的模型,都失去了实时交互的意义。

因此,R2目前更值得关注的,并不是它证明了“模型越大越好”,而是它尝试搭出一条让能力和效率相对独立推进的路径。

而只有当世界既足够复杂,又能够持续运行,通用实时世界模型才有机会从“生成内容”进一步变成“生成环境”。

 如果世界能够持续运行,最先改变的会是什么? 

如果R2这条技术路线成立,它带来的变化,可能不只是把实时世界模型做得更强,而是改变生成式AI生产内容的基本单位。

过去几年,生成式AI交付的大多是一个“结果”:一张图、一段视频、一次回答。用户输入指令,模型生成内容,任务结束。

R2试图把这个单位往前推一步。用户进入一个世界之后,它仍然继续运行。可以往前走,也可以临时改变天气、加入人物;角色不仅出现在画面里,还需要记住刚刚发生过什么,并对新的指令继续作出反应。换句话说,模型生产的不再只是一段已经完成的内容,而是一个仍在等待下一次输入的环境。

最直接的想象是游戏。

今天的游戏世界,大部分内容仍然在玩家进入之前完成。地图提前制作,NPC提前设置,剧情树和任务分支提前写好。即使玩家拥有很高的自由度,也是在开发者已经搭好的世界里行动。

R2展示的是另一种生产方式。在它目前的Demo中,用户已经可以用WASD移动,在世界运行过程中改变环境,也可以和角色进行多轮互动。今天这些能力还远不足以支撑一款真正的开放世界游戏,但它已经让一种更具体的可能性出现:游戏里的一部分内容,不必全部提前做好。

一张地图可以随着玩家前进继续生成;一个角色的反应,可以根据此前真正发生过的对话变化;一些支线事件,也不必在开发阶段穷举全部可能,而是在规则范围内根据玩家行为产生。

过去,开发者需要为大量“玩家可能会去、也可能永远不会去”的区域提前投入美术、关卡和剧情成本。世界模型如果能够稳定运行,一部分内容就有机会从“预生产”变成“按需生成”。

R2目前距离这一步仍然很远。长时间一致性、复杂物理、多角色关系,都还有明显不足。但它已经把“生成之后还能继续玩”从视频模型之外,拉进了产品讨论。

更近的机会,可能还会先出现在视频生产里。

今天很多AI视频工具,本质上仍然更接近“单镜头生成器”,AI降低了第一次生成的门槛,却还没有真正解决影视生产里更麻烦的那部分工作——连续修改、镜头衔接和资产复用。

通用实时世界模型提供的是另一种可能。创作者面对的不再是一段段彼此独立的视频,而是一个可以反复进入、继续拍摄的数字场景。前期可以用它做动态分镜和场景预演,中期可以在同一空间里换机位、改动作、增加角色,后期也有机会只修改局部,而不是整段推倒重来。

这背后更值得注意的变化,是AI视频生产可能从“生成镜头”转向“积累资产”。

过去,一段AI视频生成完成后,它的价值大多停留在这段成片本身。角色、场景和空间关系很难被稳定带进下一个镜头。如果世界模型能够长期维持这些状态,一个角色、一间房、一条街,甚至一座虚拟城市,就可能从一次性的生成结果,变成能够反复调用的生产资产。

R2当然还没有证明,实时世界模型已经跨过真正的临界点。

今天看到的Demo,距离一个稳定、复杂、能够长期运行的数字世界仍有距离。长期运行中,物理规则会有出错,细节一致性和记忆状态会出现偏移。更现实的问题是,当模型继续变大、世界继续变复杂,实时运行的成本能否被持续压下来。

接下来真正值得观察的,是这套方法能否随着规模继续成立:数据更多之后,世界是否更稳定;模型扩大之后,交互是否还能保持实时;当持续时间从几分钟延长到几十分钟甚至更久,人物、空间和规则是否依然能够维持一致。

如果这些能力能够同步提升,R2的意义就不只是一轮模型升级。它证明了,通用实时世界模型不必永远靠做减法来换取速度,而可能拥有一条能力继续扩张、效率持续追赶的演进路径。

特别策划


前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →