2026年,AI圈最热的话题不再是“谁的参数更大”,而是“谁能真正干活”。
从年初OpenClaw掀起全民“养虾”热潮,到各路智能体争相“上岗”,一个清晰的信号正在浮现:大模型正在从数字世界的“聊天高手”,变成物理世界的“行动派”。
但要让AI在物理世界里真正干活,光会聊天远远不够——它得先看懂三维空间,理解物体之间的位置关系,知道“左边”和“右边”意味着什么,甚至能预判一个动作会带来什么后果。
这就是空间具身智能,AI从数字世界走向物理世界的关键一跃。
9月15日,紫东太初开源了面向物理世界的通用多模态大模型ZDTaichu5.0-9B。9B参数,九大国际权威空间理解基准中拿下8项通用组别第一,被认定为10B参数档位空间具身能力最强的通用多模态大模型。
更关键的是,这次开源不只是放出一个模型,而是同步开放了一整套空间多模态数据生产管线详细方案。
可以看出,紫东太初要给产业端的不只是“鱼”,还有“渔”。
空间具身智能:AI从数字世界走向物理世界的“关键一跃”
在AI行业,近期出现一个有意思的转折:过去两年,大家比的是谁家模型写诗更像人、谁家模型考试分数更高;但到了2026年,风向变了。
Gartner在9月15日发布的2026年中国人工智能十大趋势中,将“物理人工智能”和“世界模型”列为关键方向。
报告指出,2026年中国AI主要趋势并非孤立出现,而是2025年格局持续演进和成熟的结果,已演变为企业的结构性刚需。换句话说,AI从“看懂文字和图片”走向“理解并作用于物理世界”,不再是实验室里的畅想,而是产业端的真实需求。
为什么空间具身智能突然变得如此重要?
道理并不复杂。机器人要抓取一个杯子,它得知道杯子在桌子的哪个位置、离自己有多远、从哪个角度伸手不会碰到其他东西;智能制造要优化产线,系统得理解设备之间的空间关系、物料流动的路径;科研自动化要让机械臂完成实验,AI得判断试管和烧杯的相对位置、液体的液面高度。这些任务,靠“聊天”是完不成的。
但长期以来,通用多模态大模型在空间理解上的表现并不理想。ViewSpatial-Bench从相机视角与人类视角两种框架出发,系统评估模型的多视角空间定位能力;VSI-Bench则专门测试多模态大模型在动态3D环境中的空间推理能力。这些基准之所以被学界和产业界共同看重,核心在于它们测试的不是模型的“知识量”,而是模型对物理世界运作方式的理解深度。
换句话说,一个模型可以背下整本百科全书,却未必能判断出“把杯子从桌子左边移到右边”需要怎样的动作序列。这正是空间具身智能的难点所在。
而紫东太初此次开源的ZDTaichu5.0-9B,就是冲着这个难点来的。
9B参数,8项第一:这个“第一”的含金量在哪?
先看数据。
根据九大国际权威空间理解基准的横向评测结果,ZDTaichu5.0-9B在9项基准中斩获8项通用组别第一,被认定为10B参数档位空间具身能力最强的通用多模态大模型。在ViewSpatial基准中,该模型得分62.50,而同档位的Qwen3.5 9B为48.20;在MindCube-tiny基准中,ZDTaichu5.0-9B得分78.27,显著领先同档位竞品。这意味着,在空间具身能力这一细分赛道上,一个9B参数的开源模型,已经能够与全球最顶尖模型站在同一梯队。
但参数小、能力强的背后,是技术路径的差异化选择。
ZDTaichu5.0-9B采用自适应循环推理机制。与大家猜测的行业前沿闭源模型GPT-6 Astra所使用的Loop Transformer架构展现出高度对齐的技术前瞻性。
简单来说,面对简单问题时,模型直接输出结果;遇到空间变换、物体关系判断等复杂任务时,则启动内部多轮推理迭代。这种机制不依赖外部工具链,也不会显著推高Token推理成本。
这个设计思路,反映出紫东太初团队对落地场景的务实判断——产业端需要的是在有限算力预算下稳定运行的空间理解能力,而不是在实验室里堆算力的“暴力解法”。
更关键的是,空间具身能力的提升并没有以牺牲通用多模态能力为代价。在图文理解、OCR、视觉数学、代码Agent等任务上,ZDTaichu5.0-9B仍然保持第一梯队水平。
模型构建了四层递进的能力链条:空间感知→复杂三维空间推理→具身条件推理→物理交互决策。在定位实测案例中,针对“寻找从左到右第二个银色盒子”的任务,ZDTaichu5.0-9B精准输出了目标坐标,而同级的其他开源模型全部定位错误。这个能力,恰恰是机器人抓取的底层核心。
一个9B参数的模型,为什么能做到这些?
答案藏在紫东太初的长期技术积累里。
开源的不只是权重,而是一整套“迭代能力”
此次开源最引人注目的差异化策略在于:紫东太初不仅开放了模型权重,同步开放了经过验证的完整空间多模态数据生产管线详细方案,包括数据接入清洗、三维标注、合成校验等环节。
这直指产业端一个长期存在的结构性痛点——企业拿到开源模型后,往往缺乏将自有工业、科研数据转化为可训练空间任务的能力。一套完整的数据生产管线方案,意味着下游企业可以将自有场景中的仿真数据、产线数据、实验数据持续注入模型,形成“数据飞轮”。
“开源权重是给了一把钥匙,开源数据管线方案是给了一套配钥匙的工具。”一位长期关注AI基础设施的投资人表示,当前国产开源大模型在权重开放层面已趋于同质化,真正稀缺的是从数据到能力的转化通道。
这一策略的产业指向非常明确:机器人、科研自动化、智能制造。这三个领域的共同特征是——场景高度碎片化,通用模型难以直接适配,必须依赖企业自有数据进行持续迭代。
换句话说,紫东太初卖的不是“标准答案”,而是“解题方法”。对于产业端而言,后者的价值远大于前者。
从实验室到产线:真实场景里的“能想能干”
能力不只停留在基准跑分。紫东太初此次披露的落地进展,提供了值得关注的样本。
在科研领域,紫东太初多模态大模型底座已支撑起科研Agent完成干湿实验闭环。所谓“干实验”,指的是文献检索、实验设计、数据分析等计算环节;“湿实验”则是实际动手操作,比如通过机械臂完成滴定、移液等动作。紫东太初的科研Agent已经实现了从文献检索、实验设计、数据分析到报告生成的全链路闭环,数据实时回流,形成“设计—执行—反馈”的循环。
这意味着,AI不再只是科研的“辅助工具”,而是开始成为科研流程中的“核心生产力”。对于生物医药、材料科学等需要大量重复实验的领域,这种能力的价值不言而喻。
在智能制造领域,紫东太初已完成高层规划实体案例的真实场景验证。所谓“高层规划”,指的是AI不仅需要理解单个动作,还要能对多步骤任务进行规划——比如“把A物料从仓库送到B产线,途中避开障碍物,到达后完成组装”。这种能力,是机器人在复杂产线环境中自主工作的前提。
目前,紫东太初的具身智能多模态大模型已在北京、佛山、青岛等多地具身智能训练场落地。
这些验证场景的共同特征是:AI不仅需要“理解”物理空间,还需要在真实环境中“执行”任务。这正是从多模态大模型向具身智能演进的本质跨越。
长期路线图:从理解空间到预测空间
将ZDTaichu5.0-9B置于紫东太初的技术演进脉络中观察,其定位更加清晰。
中科紫东太初是中国科学院自动化研究所孵化的多模态大模型“国家队”,以全栈国产化技术路径致力于打造中国通用人工智能底座。其多模态大模型是全球首个中文千亿参数多模态大模型,首批通过中央网信办备案,曾获2022世界人工智能大会最高奖SAIL奖。
从技术路线看,紫东太初正在构建“模型—数据—场景”三位一体的能力闭环。这并非从某一具体场景切入,而是建立在多年多模态大模型持续深耕基础上的自然演进。
从紫东太初多模态大模型1.0到5.0,紫东太初始终围绕“让模型更完整地理解真实世界”这一主线持续推进:
从1.0的多模态大模型,突破跨模态融合与统一表征,实现图文等多模态信息的统一理解;到2.0全模态大模型,进一步推进全模态统一建模,拓展模型对不同模态信息的协同处理能力;3.0进一步从“理解”走向“执行”,引入多模态智能体、工具调用与复杂任务闭环;4.0则将重点推进至多模态推理,通过主动思考、深度推理与行动能力,让模型具备更强的复杂问题求解能力;到5.0,技术路线进一步向物理世界延伸,聚焦空间理解、具身智能与真实环境交互,让多模态大模型从理解数字世界走向理解、预测并作用于物理世界。
这条从多模态理解、全模态统一,到智能体、深度推理,再到空间具身智能的演进路线,构成了紫东太初多年持续深耕多模态大模型的技术积累。
据了解,紫东太初5.0世界模型将择机发布,推动VLM-WM(视觉语言模型-世界模型)技术路线实现跃迁。在Gartner的2026年趋势报告中,“世界模型”被列为中国AI十大趋势之一,与“物理人工智能”并列,代表着AI从“感知”向“预测”的能力跃迁。
这意味着,当前9B参数模型只是一个阶段性节点——企业的目标是从“理解空间”走向“预测空间”,让AI具备对物理世界动态演化的建模和推演能力。
在国产AI底座的竞争格局中,紫东太初选择了一条差异化路径:不以参数规模取胜,而以“空间理解+数据管线+场景验证”的垂直深度构建壁垒。这条路径能否在产业端形成规模化正反馈,将决定其在中国通用人工智能底座版图中的最终位置。
通往AGI的路有很多条。紫东太初选的这条,至少目前看来,走得挺扎实。