阅读,与值得关注的内容Readance

AI视频的下一场战争,不在视频


作者丨小龙
编辑丨关雎


据彭博社9月7日报道,字节跳动正在基于旗下视频生成模型Seedance,开发一款可以实时生成空间视频的AI模型,正式进入世界模型这一前沿赛道。

报道称,字节跳动创始人张一鸣正在亲自督导项目,协调公司多个业务部门,并集中调配AI人才与算力资源。

新模型的目标,是让AI根据用户的动作和语音,实时生成可以交互的虚拟环境,潜在应用包括游戏、直播、短剧和VR。

ByteDance World Model: From AI Video to 3D Worlds | SuperMaker AI

如果这项技术最终成熟,字节做的就不只是一个更强的视频生成模型。

Seedance过去解决的问题,是让机器生成一段看起来真实的视频;这一次,它开始尝试让机器持续生成一个用户可以进入、移动和互动的空间。两者看起来只差了一步,背后的技术问题却完全不同。


从生成画面,到生成一个世界

一段AI视频,无论多么逼真,本质上还是一段已经生成好的内容。

模型需要根据文字、图片或者视频输入,预测接下来应该出现什么画面,并尽可能保持人物、物体和镜头运动的一致性。

用户观看的是模型已经做出的结果,视频结束以后,场景也就随之结束。

世界模型面对的是另一类任务。

假设模型生成了一个房间,用户向左走,系统需要继续生成符合原有空间关系的画面;用户拿起桌上的杯子,杯子的位置和房间里的其他物体需要保持合理关系;用户转身回看,刚才身后的墙、桌子和窗户仍然应该存在。

用户每做一次动作,模型都要根据新的状态继续生成后续世界,而不能简单地从头“画”一个看起来相似的房间。

Google DeepMind目前公开的Genie 3,就是沿着这条路线推进的实时世界模型。

Genie 3: Is Google Making Game Engines Obsolete?

Google称,Genie 3能够根据文本生成可以探索的环境,并以每秒20至24帧的速度运行,同时保持一定的环境一致性。

Meta也在通过V-JEPA系列研究让模型从视频中学习物体运动、人与物体之间的互动,以及行动可能产生的结果。

因此,视频生成和世界模型之间,并非简单的画质升级。前者主要关心“这一帧应该长什么样”,后者需要进一步处理“这个空间里有什么”“物体怎么运动”以及“用户做了这件事之后会发生什么”。

模型需要维持一个持续变化的世界状态,这也是实时世界模型难度明显上升的地方。

字节从视频生成切入世界模型,有一条相对自然的技术路径。

Seedance本身已经在处理人物动作、镜头运动、物体关系等大量视觉信息。字节此前发布的Seedance 2.0进一步扩展了文本、图片、音频和视频等多模态输入,并强调复杂运动、多人互动和物理表现。


从这个角度看,空间视频并不是把原来的模型换一个应用场景。模型需要继续向前学习空间关系和动态变化:用户从什么角度看到一个物体,物体移动以后周围环境如何变化,不同动作之间怎样保持连续性。

这些能力积累起来,才有机会从“生成视频”走向“生成可以持续运行的环境”。

这条路线也解释了为什么实时性会成为新一轮竞争的重要指标。普通视频生成可以接受较长的等待时间,用户只需要等模型把结果算出来;交互式世界则不能让用户每走一步都停下来等待生成。如果系统要根据头显中的移动、转身甚至语音指令持续改变场景,生成速度必须接近实时渲染。

据彭博社报道,字节正在探索约50毫秒的延迟和每秒20帧左右的生成速度,并考虑把大量计算放到云端,再将结果传输给终端设备。这个目标如果能够实现,对于VR产品的硬件计算压力也会产生影响。


游戏可能只是第一站

这也是Pico出现在这条新闻里的原因。

字节旗下的Pico拥有VR头显,用户本身就在一个可以持续获取空间信息的设备里。头显能够知道用户正在朝哪里看、如何移动,AI则负责根据这些输入生成新的环境。如果模型和设备结合得足够紧密,VR内容就不再完全依赖开发者提前制作好的场景,而可以根据用户行为实时变化。

PICO 4 - Wikipedia

这会改变VR内容的生产方式。今天的VR游戏仍然需要开发团队预先设计地图、角色、物理规则和任务,再由设备实时渲染这些内容。

生成式世界模型则提供了另一种可能:开发者只需要设定环境和规则,模型负责在运行过程中补全大量场景和内容。用户进入一座城市,看到的街道、建筑和人物可以由模型生成;用户改变路线,模型继续生成此前没有制作过的区域。

游戏可能会成为更容易理解这一变化的场景。玩家未来或许可以直接描述一个环境,例如“生成一座被暴雪覆盖的未来城市”,模型负责生成可探索的空间;玩家改变天气、进入建筑或者与NPC互动,环境继续发生变化。

游戏公司依然需要负责玩法、规则和产品设计,但大量固定资产的制作方式可能发生变化。

直播和短剧也存在类似机会。主播可以进入AI生成的空间,节目场景随着内容变化;短剧中的部分场景可以根据剧情实时生成,而不需要把所有画面提前拍摄完成。

对于字节来说,这些场景与抖音、CapCut等现有内容业务存在天然连接,因此世界模型一旦达到足够高的实时性,商业化路径并不局限于VR。

世界模型更大的价值,在于它可以提供一个让AI反复“练习”的环境。

机器人训练一直受到现实数据成本的限制。一台机器人在真实工厂里完成一次错误操作,可能意味着设备损坏、生产线暂停或者人工干预;很多危险场景也无法通过真实环境大量采集。如果模型可以生成足够接近现实的虚拟环境,机器人便可以在其中反复执行任务,并观察不同动作产生的结果。

Meta的V-JEPA 2已经在探索这条路径。Meta公布的研究显示,模型可以从大规模视频中学习世界的变化,再结合少量机器人数据进行动作规划,例如判断如何抓取和移动陌生环境中的物体。


这让世界模型与Physical AI之间建立起一条越来越清晰的连接:模型先从视频和其他数据中学习世界如何变化,再生成或预测环境中的不同结果,机器人则可以在这样的环境里进行训练和规划。

对于机器人公司来说,世界模型的意义不只是生成一个好看的虚拟空间,而是降低获取训练数据的成本。

自动驾驶也存在类似需求。汽车需要面对的并非有限的几个标准场景,而是大量现实世界中的长尾情况:行人突然出现、车辆突然变道、道路施工、极端天气等。真实道路数据当然重要,但仅依赖真实世界收集这些情况,效率和成本都存在限制。

一个能够生成多样化环境并保持物理关系的模型,可以成为训练和测试体系中的补充工具。

因此,World Model正在逐渐从游戏和VR研究进入Physical AI讨论。对于AI公司而言,模型最终服务的对象可能从“人”扩展到“Agent”和“机器人”。


Google、Meta、字节
正在走向同一张牌桌

目前,Google、Meta和字节的切入点并不相同。

Google拥有DeepMind长期积累的强化学习、生成模型和机器人研究,Genie 3强调从文本生成可实时探索的环境;Meta则从视觉理解和世界预测切入,V-JEPA系列重点研究AI如何理解物理世界,并进一步服务机器人;字节则拥有Seedance这一成熟的视频生成模型,从视觉内容生成向空间和实时交互延伸。

三家公司手里的资源结构也不同。Google有Gemini、DeepMind和Google Cloud,Meta有Llama、Reality Labs以及庞大的社交平台,字节则同时拥有Seed、豆包、抖音、CapCut、Pico和火山引擎。世界模型一旦进入产品阶段,模型本身只是其中一环,算力、终端、内容和用户入口都会影响最终的商业化能力。

这也是字节此次项目被外界关注的原因。张一鸣亲自督导、跨部门调配资源的动作,说明公司对这条路线的优先级可能相当高。



与此同时,字节近期也在继续扩大AI基础设施投入。路透社9月4日报道称,字节获得约296亿美元贷款,相关资金将支持包括AI芯片和数据中心在内的投入。

世界模型恰好是一个非常“吃算力”的方向。模型需要持续生成环境,还要处理用户输入并维持空间和状态的一致性。如果未来真的要让数以百万计的用户同时进入AI生成的世界,计算需求远高于离线生成几段视频。


AI视频的下一场竞争
可能发生在视频之外

过去两年,AI视频行业最直观的竞争是画质、时长、人物一致性和镜头控制。模型越来越像一个自动化的影视制作工具,内容公司和创作者可以用更低的成本生产画面。

世界模型把这个产业往外推了一层。

用户面对的不再是一段固定的视频,而可能是一套实时生成的环境;开发者生产的不再只是预先制作好的素材,也可能是一组由模型持续生成的空间和规则;机器人获得的也不只是动作数据,而可能是一个可以反复试错的虚拟世界。

如果这条路线继续发展,视频生成模型的价值就很难再用“每分钟生成多少视频”来衡量。模型能不能保持空间一致性,能不能理解物体之间的关系,能不能根据动作快速预测环境变化,能不能以足够低的成本持续运行,都会成为新的指标。
字节现在押注的,正是这条尚未完全跑通的路线。

实测Seedance2.0,从玩具级到生产力,字节AI视频的颠覆性进化| 人人都是产品经理

Seedance从一段视频出发,正在尝试生成一个空间;Pico让用户进入这个空间;如果未来再接上Agent和机器人,AI生成的环境还可以成为机器学习和Physical AI训练的一部分。

视频可能只是AI理解和生成现实世界的一个入口。

当模型开始生成的不只是画面,而是一个可以持续运行、可以被人和机器共同使用的环境,AI视频这条赛道的边界也就随之被推远了。


图片
图片

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →