从一张参考图
到可交互的
3D 赛车世界
每一代大模型发布都会有人一句话生成一个 3D 世界,每一代的更迭,这个 3D 世界都会生成的更丰富一点。但看来看去都还是《我的世界》那种方块的感觉,这确实是 3D 世界,但不是我想象中那种和游戏一样的 3D 世界。
有没有办法做一个像游戏里那种圆润饱满的 3D 世界呢?
前段时间 Tripo 给了我一些 API 额度,说如果有兴趣可以试试,提提意见,一忙就扔到一边了,今天我把那个 API 又找出来了。
把它交给 AI,让他自己去看 API文档,生成一个机器人 3D 模型,用网页展示出来。
Tripo的文档非常详细,不需要自己慢慢研究,直接扔给 AI:https://developers.tripo3d.ai/en/docs
Tripo 生成的机器人模型可以活动,可以拆解成一个一个零件,还可以看到这个模型的线框图,如果把一个场景里所有的物体都这样一个一个做出来,不就能做成一个真实的 3D 世界了吗?
于是我用Gpt 6调用Tripo 的 API,制作了一个机器人的游戏,在这个游戏打开之前,我从来没有想过我也可以做 3D 游戏,那些 3D 模型根本不可能做出来,纯用Three.js做 3D 模型和场景也只能玩玩,真要做游戏肯定是不够格的。
Gpt 6 使用 Three.js 直接生成不是能力不行,相反,它在空间设计、机械概念建模、组装部件、调整和制作动作等方面提升很明显,而且和 Tripo 非常互补,让高质量3D资产的装配、修改、绑定和导入引擎变得更容易,可以进入过去受专业门槛和制作成本限制的场景。
好了,进入正题
用 AI 编程工具(Claude Code、Codex 这些)构建 3D 交互内容,对 3D 模型有四个硬性要求:快、轻、准、可被理解:Agent 循环干活,生成慢会卡死整条链路;网页要低面数直出;生成不准,链路就反复中断;零件分得符合语义,代码才知道谁是谁。
我们刚刚生成的机器人,每一个部分都可以分解成零件,那就说明我们可以生成任意的 3D 场景,场景中的每一个物体的每一个零件都可以被编程,这就意味着这些物体都可以互动了。那我就先生成一个简单的3D 世界。
每件东西先用生图模型出一张白底产品图,喂给 Tripo,一两分钟后拿回一个 GLB 文件。Claude Code 读这个文件,把零件一个个命名,给会动的零件定好转轴,然后写页面。
01Pitfall
同一个主角,我用正面图出来 28 个壳,换四分之三视角出来 14 个壳,干干净净。Tripo 看不到的东西它会猜,看得清楚的东西它就老老实实分。
02Pitfall
显示器第一版参考图的屏幕是一块米白色的空白平面,Tripo 把它读成了一个坑,做出来的显示器是凹进去的。
改成"深色玻璃 + 一道斜反光"重出,屏幕就是平的了。电视、笔记本我都按这个画,一次过。这两个坑本质是同一件事:提高输入到输出的「准」,准了 Agent 链路才不会反复中断。
03Pitfall
默认贴图有时候会有整块的灰斑,用 Tripo 的 models/texture 接口,把刚才那个任务的 id 和参考图一起丢回去,贴图会干净很多。
十几件家具,API 一口气跑完,快就体现在这,一件一两分钟,Agent 的循环才转得起来;面数按预算直出、GLB 直接进 Three.js 不用减面,这是轻。为了让我清楚的看每个模型,我让 claude code 做了一个网页展示所有拿到的模型。
每一个模型都能炸开:我都不知道一个椅子还有这么多隐藏结构,这在我们生成模型前的图片环节只有一个椅子的图片,Tripo是真的理解物理世界,他会把这个椅子在真实物理世界中怎么组成的分析出来,按照这个逻辑去组装这个椅子,这个椅子就有 25 个零件。
如果能生成一个 3D 模型,可以旋转,缩放,我们就觉得很牛 X,那这种由各种零件组成且可以拆开的3D 模型就是非常牛 X 了,如果还是四边面的,怎么说呢,做游戏的兄弟们应该懂!!
所有的物品都生成出来之后,我们可以在这个控制台去看每一个的旋转,各个角度,给零件上色,爆炸图。每一个物体的每一个零件都可以单独命名,这样写代码的时候就可以单独控制每一个零件,于是所有物体都可以交互了。
接下来我们来做一个简单的密室逃脱游戏。
那个蓝色小人就是主角。键盘 WASD 行走,点地面自动走过去,点抽屉拉出来,点柜门打开,撞椅子它会转,走到桌前显示器亮,走到电视前电视开,点落地灯和环形灯开关。在电视柜里找到钥匙就可以打开门进入下一关。
哈哈,成了,只要能做到这样就说明我的想法是可以实现的。虽然很简单,但是一个游戏的必备要素都齐全了,想要自己做游戏的兄弟们可以玩起来了。
赛车游戏选车页
先做了五辆车的白底参考图:超跑、拉力车、肌肉车、方程式、越野皮卡。
就是类似这样的,我觉得这个图不算逼真,但作为游戏模型够用了。五辆车,每辆一张参考图,交给 Tripo 跑一遍。
分件结果比我预期好:四个轮子每辆都是独立零件,拉力车连轮毂和轮胎都分开了;肌肉车、拉力车、皮卡的引擎盖独立;超跑和拉力车的尾翼独立;拉力车引擎盖上那组辅助灯、皮卡的车顶灯条也各是各的。
所以选中动效可以全部由零件驱动:超跑尾翼升起、车身弹一下;拉力车悬挂弹跳、辅助灯闪;肌肉车引擎盖掀开、后轮烧胎;方程式前翼调角;皮卡车顶灯条闪。轮子每辆都转,代码里写的就是找到名字以 wheel 开头的零件,绕横轴转。
零件是按语义分的,轮子就是轮子,引擎盖就是引擎盖,所以不用看模型长什么样,按名字就知道谁是谁。
太牛逼了,这个效果我都有冲动立刻把这个赛车游戏做出来。
让模型自己动
起来:绑骨与动画
房间里主角的行走是我们用代码按零件驱动的,不知道兄弟们有没有发现这个小人走路不自然,因为我给的图片两腿就是张开的,而且像两根棍子没有任何弯折,反正就是好假。我们来改进一下给这个小人绑骨,感受一下Tripo的绑骨功能到底能为我们带来什么。
差别太明显了,绑骨的人物和没有绑骨的真实度差太多,自动绑骨是对整个模型蒙皮的,把接缝两侧的顶点绑在同一根骨头上,走路、跑步、挥手,袖口都正常。而且动作更自然,符合物理世界的动作,省了很多调试的麻烦。
看看大神作品
官方生态里已经有一批做的很完整的作品,有几个非常牛 X 的一定要推荐给你们
浏览器内可交互的 3D 人体解剖工作台,被 OpenAI 总裁 Greg Brockman 转发https://developers.tripo3d.ai/en/showcase/anatomy
还有完成度非常高的机械奥德赛游戏,如果你是 windows 用户可以下载到本地体验:https://developers.tripo3d.ai/en/showcase/mechanical-odyssey
我没有 Windows 电脑没法体验,但是看演示视频,这就是一个完成度很高的第一人称射击游戏。
这是一个通过 Tripo 制作 3D 资产的游戏,冲击力很强,让我第一次感觉到制作 3D 大作和我们普通人距离那么近,游戏制作最难的建模鸿沟现在已经被抹平了。
官方开发者展示厅里还有很多其他案例都很炸裂:https://developers.tripo3d.ai/en/showcase
缺的不是代码,
是能用的零件
一句话生成的 3D 世界为什么总是方块?
模型只会写代码,代码画不出圆润的东西,只能拿方块凑。缺的不是更会写前端的模型,是一条能直接用的 3D 资产管线:图进去,零件出来,代码只管把零件摆好、让它们动。
Tripo 干的就是这件事:文字或图片进去,3D 模型出来。做它的公司叫 VAST(三启万物),成立于 2023 年,是全球领先的通用 AI 3D 大模型与世界模型公司,旗下 Tripo Studio 是一站式 AI 3D 创作平台。
创始人兼 CEO 宋亚宸曾任职于商汤科技,并作为早期联合创始人参与创立 MiniMax,也是首位在 SIGGRAPH 发表主题演讲的中国企业家。平台上聚集了数千万创作者,累计生成的 3D 模型数量全球第一。VAST 半年以来累计融资约50亿元,刷新AI 3D领域融资额纪录。
Tripo P2.0 是全球首个能秒级生成高质量原生四边面(Quad)拓扑网格的 AI 3D 大模型,让 AI 生成的 3D 资产无需重拓扑,即可直接进入游戏、动画的绑定与生产管线。P2.0 Preview 于 2026 年 8 月 18 日在 Tripo Studio 上线。
和上一代的区别:
P1.0支持,500–20,000 面
P2.0 PRE支持,500–50,000 面
P1.0不支持
P2.0 PRE支持,500–25,000 面(原生直出)
P1.0秒级生成引擎可用的三角面资产
P2.0 PRE生产级四边面 + 更高面数,无需重拓扑,直接进绑定 / 动画 / 引擎
P1.0实验性
P2.0 PRE支持(正式版完整开放,可只重生成选中区域)
P1.0支持自动分件
P2.0 PRE伴随精度提升,分件更细、更符合语义
相较于 P1.0,P2.0 提供了更广的面数范围,从移动端轻量道具到高精度主角资产都能按需直出。落到我这次的用法上就是一个 face_limit 参数的事:房间里十几件家具全压得很轻,同屏十几个模型浏览器不卡;主角和后面的赛车就把面数给足。同一条管线,轻重自取。
支持多视图输入加局部编辑,哪里不满意可以只重生成选中的区域,精修局部,而不是每次整体重新生成。
输出的格式非常全面,想要在那种场景使用都有对应的格式:
GLB1.网页用就生成 GLB 文件,网格和贴图打包在一起,贴图是完整的 PBR 一套:颜色、金属度、粗糙度、法线。
FBX2.Unity、Unreal、Blender用的话可以输出 FBX格式
STL3.3D 打印的模型可以输出 STL 格式
USDZ4.iPhone 上 AR 预览可以输出USDZ格式。
绑骨和动画也有接口,人形、四足、鸟类、蛇形都有,绑完套预设动作,走路跑步挥手九十多个。
做游戏为什么
非要四边面不可
这里插一个知识点。3D 模型的表面是一张网,大多数网眼要么是三角形,要么是四边形。四边面(Quad)是游戏、动画行业的工业标准拓扑格式,好处有很多:
在 Tripo P2.0 之前,AI 只能原生生成三角面网格,拿到后还要花很长时间重拓扑,这是传统管线里最耗时、创意含量最低的一环,把人搞的非常疲劳。Tripo P2.0 第一次让 AI 在生成阶段就原生直出四边面,直接跳过这一步。
四种路线的差异:
左边是 Tripo P2.0 出的主角,4 千个四边面,袖子、裤腿上的线一圈一圈顺着走;右边是同一个主角的三角面版本,29 万个三角形,密到全身看过去是一团黑。
Tripo P2.0 出的四边面模型肩膀和手肘的循环线一圈一圈沿着结构走,这就是它能直接绑骨做动画的原因。
Tripo P 系列的底层框架叫 Nexus,走扩散模型原生生成网格的路线,相关论文收录于国际图形学顶会 SIGGRAPH 2026,由 VAST 联合清华大学、中国科学院自动化研究所、西安交通大学共同完成。
写在最后
这一圈体验下来,大家对3D 模型快、轻、准、可被理解,这几个要素为什么如此重要能理解了吧?
Agent 是「生成—检查—修改—再生成」这么循环干活的,只有生成够快,才不会卡死整条链路。我能一口气跑完一整个房间的十几件物体,靠的就是出件速度。
Web 和实时应用要低面数、结构干净、加载即用,按面数预算直出。GLB 直接挂到 Three.js 就能转,不需要减面。
忠实还原意图、失败率低,Agent 链路才不会反复中断。「四分之三视角」「屏幕别留白」这些踩坑,本质都是在提高输入到输出的「准」。
布线规整、分件符合语义,Agent 才知道「谁是谁」,才能对单个部件编程和绑定交互。代码里按 wheel 开头的零件让五辆车的轮子通用转动、抽屉和柜门独立开合,靠的都是这个。
AI 负责世界。
场景怎么搭、镜头怎么走、什么东西点了会怎样、零件怎么动,这些交给 AI。
Tripo 负责零件。
任何一个你能画出参考图的东西,高效变成一堆代码能抓的零件。抽屉、柜门、轮子、尾翼、辅助灯,只要参考图上看得出它是独立的,大概率就分得出来。
以前生成 3D 是生成一个能看的东西,现在是生成一堆能用的零件,这两件事对做游戏的人来说天差地别。
VAST 联合创始人兼首席科学家曹炎培在一次公开采访里说过一段话,和我这次的体感对上了:
有空我就把那个小互勇闯 AI 世界的游戏做出来。
Tripo 的开发者文档在 https://developers.tripo3d.ai/docs ,感兴趣的兄弟们可以看看。
全球首届【世界构建黑客松】 Tripothon S1 也开始报名了:https://mp.weixin.qq.com/s/U5qmLsfELrEY-hRq1lj0Dw
想试的可以拿这套流程去玩玩,做个游戏什么的,奖金池有 8 万美金,搏一把,单车换摩托。