今天一段一分钟的视频在 X 上刷屏。作者只对 AI 智能体说了一句话:"在 Blender 里做一只写实蝙蝠"。智能体就自己装好 Blender、配好接口、调出毛发粒子系统、跑完渲染。途中一直没停,直到 token 用完。作者最后写了一句:"This is AGI。"
变化确实发生了:智能体自主走完了从装软件到出片的全过程。把它直接叫 AGI,还差着一道明确的边界。这道边界在哪,看完视频和它的工具链就清楚了。这条视频里的项目文件名叫 Flying-fox.blend,连名字都是智能体自己起的。
GIF:视频尾段六秒多,AI 在 Blender 里把狐蝠模型调成展翅姿态。最后渲染出这只写实狐蝠。
01
视频里发生了什么
60 秒的画面是一份完整的 Blender 4.1.1 录屏。开头,智能体在弹窗里问"是否删除选中的物体",显然它在清掉默认场景。然后镜头里出现了文件名叫 Flying-fox.blend 的项目。Blender 的版本号显示是 4.1.1,这个版本已经稳定支持粒子系统与 Cycles 渲染。
模型在右侧场景里一点点长出来。毛发粒子被调到写实密度,翼膜结构在调整面板里一点一点变形。细节在屏幕上一点点被压实:毛发密度、翼膜折痕、头部轮廓,都被反复调整过。
视频里,Blender 的右上角面板在快速切换。建模工具、粒子属性、渲染设置,这些面板在 AI 的指令下逐一打开、调整、关闭。每一秒画面背后,是智能体发出的真实 Blender 操作指令。
最后十几秒,渲染窗口打开。一只展翅的狐蝠从黑灰色背景里被推到镜头正中。整段过程没有人手操作,连鼠标移动都是智能体自己发的指令。
截图:Blender 里的 Flying-fox.blend,AI 把毛发粒子系统调到了写实密度。
02
真正变化的是工具链
理解这件事,要看这只蝙蝠是怎么被做出来的。这只蝙蝠来自一个叫 MCP(Model Context Protocol)的开放协议。这个协议让大模型像调用工具一样调用 Blender 的 API。
它把建模、渲染这些原本要人手点的功能,变成了可以被自然语言触发的指令。智能体接到"做一只写实蝙蝠"的指令后,先下载 Blender、装上 MCP 服务器。再连续发出建模指令。
模型负责决定每一步做什么,Blender 负责把模型做出来。换句话说,智能体在写一份长脚本,Blender 是它的执行环境。
这和"AI 生成一张图"是两回事。图像生成是模型直接产出像素;这里是模型在操作一套完整的 3D 软件,靠 Blender 的引擎完成最终渲染。模型是导演,Blender 是剧组。
过去,AI 能写代码、生成图片。但要让 AI 操作一款 3D 软件,需要专门的训练和接口适配。MCP 把这件事标准化了:只要软件提供一个 MCP 服务器,模型就能用同一套协议接入。
工具接入的成本从"专门开发"降到了"按协议实现"。这次演示没有要求 Blender 做改造,社区已经为 Blender 实现了 MCP 接口。
每一步,模型先决定下一步该做什么,再向 Blender 发出一条具体的工具调用指令。Blender 执行后把结果返回给模型,模型看到画面再决定下一步。这个循环在视频里跑了上百次,模型一边调整参数、一边观察结果,直到 token 用完把它打断。
MCP 由 Anthropic 提出,正式发布于约两年前,是一个开放标准。Blender 有一个社区维护的 MCP 服务器,开源可获取。任何接入了这套接口的智能体,都能用自然语言驱动 Blender 做建模、渲染、动画。这套机制不限于 Blender,只要软件有对应的 MCP 服务器,智能体就能用同样的方式操作它。
This is AGI。
03
工具链变了,门槛跟着变
过去,要做这样一只写实的狐蝠。建模师需要熟悉 Blender 的粒子系统、毛发渲染、灯光设置。现在,模型把这件事包了。
但包了不等于省了。模型生成这张图后,人仍需审核:毛发够不够密、姿态自不自然、是否符合作者给出的需求。这些判断仍由人完成。
这条变化落在那些把大量时间花在重复操作上的人身上。对个人创作者来说,这意味着可以从繁琐的 Blender 操作里抽身。把精力放在造型、构图、故事这些更上游的事上。
前提是能写清楚需求、能在结果里看出问题。工具链变长,判断的位置也跟着前移。
对小型团队来说,这种变化也意味着:原来需要一个建模师才能出的角色资产。现在可能只需要一个能把需求写清楚的导演型角色。岗位不会消失,但岗位里的时间分配会重新洗牌。
04
"This is AGI" 的边界
视频最后一幕,那只展翅的狐蝠在渲染窗口里定格。作者打出"它一直工作到我 token 用完",紧接着写下"This is AGI"。
这句话是体验者的高调判断。反主流的读法不接受这种跳跃:变化真实发生在工具链上,AGI 的标签还缺少可验证的依据。智能体能连续做下去,唯一被设的硬边界是 token 预算。预算回来,它就会继续。
没有公开证据显示它能跨工具、跨任务地选择下一个目标。把这件事直接等同于 AGI,是把一段确定的工具调用,归到了通用智能这一类。
再看那只蝙蝠本身。它的毛发密度、姿态、镜头角度,都是智能体在 token 预算内自主决定的。这意味着模型在给定的目标下,已经能做出审美上站得住的选择。
智能体能跑完这样一段流程,关键前提是目标在起点处被写清楚了。"在 Blender 里做一只写实蝙蝠"这句话同时给了智能体任务、风格、工具。它知道该装 Blender、该选 Blender 当工作环境、该追求写实风格。这种"已知目标 + 已知工具"的设定,是今天演示能跑通的隐含前提。
但"在给定目标下"是前提,目标本身是作者给的。换一个目标,或者不给目标,模型会做什么,视频没有展示。给定的工具链和开放的智能之间,还有一段没有被这段视频跨越的距离。今天看到的视频里没有这一步。
AGI 的定义至今没有共识,把任何一个具体演示塞进这个词,都容易让讨论失焦。
截图:视频末段的渲染成品,AI 没有预设这只狐蝠最终会摆成展翅的姿态。
智能体停下来那一刻,是因为 token 用完了。这就是这件事的边界。60 秒录屏里,模型自主跑完了从清场到渲染的完整流程。这就是今天发生的变化。它跑得越长,停下来的那一刻越值得看清楚:那一刻由 token 预算决定,模型自己并未触发停止。这条边界的内容:变化发生在工具链上,边界写在预算里。
来源:Blender MCP 开源项目(社区维护,开源可获取);Model Context Protocol 开放标准(Anthropic,2024 年发布);原帖由 Alix Ollivier (@aollivier82) 发布于 9 月 5 日。