阅读,与值得关注的内容Readance

21位视觉研究者发布VGI白皮书:通用智能需要从视觉经验中学习

一篇新白皮书把问题往前推了一步:机器看见图片,还不等于它理解了世界。21位作者来自视觉、机器人和人工智能研究领域。他们提出“视觉通用智能”(Visual General Intelligence,VGI)。这是一项研究议程,讨论系统如何从图像、视频和几何信息中学习,再用于预测、想象、重建和行动。

图注:VGI白皮书首页列出21位作者及其所属机构,论文将视觉经验、视频、几何和世界理解放在同一条研究线上。

01

这不是一份“AGI已经找到答案”的宣言。

论文标题是《Visual General Intelligence: A White Paper》。作者共21位。名单中包括AIST、牛津大学、OpenAI和剑桥大学。还包括Google DeepMind、卡内基梅隆大学、纽约大学、斯坦福大学和普林斯顿大学。

作者没有给出唯一的VGI定义,也没有声称视觉路线已经足以通向AGI。论文更像一张研究地图。它把视觉基础模型、视频生成、空间智能、具身智能、持续学习和科学发现放到同一个问题里,追问视觉经验可以产生哪些可迁移的能力。

证据边界:VGI目前是论文提出的研究议程。它能说明研究者正在怎样重新组织问题,不能直接证明现有模型已经获得通用的视觉智能。

02

“会描述画面”,离“理解世界”还有一段距离。

白皮书反复区分两种能力。第一种是把视觉输入转成答案、标签或文字描述。第二种是从视觉经验里恢复世界的结构。它要判断物体在哪里,哪些东西保持不变,以及遮挡后可能发生什么。它还要理解观察者的移动,并预测下一刻的画面。

这也是论文把图像、视频和几何并列起来的原因。静态图像提供外观,视频展示变化,几何提供空间关系。系统只有把这些线索连起来,才可能从“看见一个杯子”进一步推断它的形状、位置和遮挡关系。它还要判断杯子被推动后会怎样移动。

论文中的关键判断是:视觉智能不能只靠复述画面来测试。还要看模型能否编辑、模拟和验证内部表示,并用它支持行动。

真正困难的地方,是让机器从连续经验中形成对世界的可用理解。

03

研究路线分成了三条:预测、想象、重建。

白皮书最后把核心假设压缩成三个互补目标。顺序预测要求模型判断视觉状态接下来会怎样变化;开放生成让模型想象可能存在的场景、动作和未来;结构重建则要求模型从不完整的观察中恢复隐藏的空间和物理结构。

这三条线分别对应三种能力。预测逼着模型学习变化规律。生成让模型拥有反事实推演的空间。重建则把注意力拉回物体、深度、表面、运动和遮挡等具体结构。论文认为,三者结合后,视觉模型才有机会从“识别任务的工具”走向“能够形成世界知识的系统”。

作者也保留了分歧。有人押注大规模视频生成模型会成为视觉基础模型;有人强调持续学习、空间记忆和具身行动;也有人提醒,逼真的像素和视频并不能自动证明模型理解了物理世界。

04

这场讨论会改变模型的下一张考卷。

如果VGI持续发展,模型评估就会进入更长的时间跨度和更开放的环境。考题包括:系统知道下一步该看哪里吗?它能发现新变化吗?它能在不重训的情况下适应环境吗?它能用空间表示支持机器人行动吗?

论文还特别强调效率和多模态信息。机器人需要视觉,也需要触觉、听觉和本体感觉;长视频需要稳定的记忆;科学发现需要把视觉结果与其他仪器、单位和领域知识相互验证。视觉路线因此不会孤立运行,它要面对真实世界的成本、噪声、传感器偏差和行动风险。

VGI白皮书目前提供的是问题清单和研究方向。它把“模型看得更清楚”改成了一组可检查的要求。系统要从视觉经验中学习。它要保持空间记忆,预测变化,想象后果,重建隐藏结构。最后,它还要把这些知识用于陌生环境中的可靠行动。

来源:arXiv论文《Visual General Intelligence: A White Paper》;CVPR 2026 Visual General Intelligence Workshop页面。配图为论文首页。

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →