阅读,与值得关注的内容Readance

只有 9B,一个令人惊艳的国产模型,开源了!

现在的多模态模型看图已经很成熟,一张照片里有什么、谁在谁的左边,基本都答得上来。

但只要多绕一个弯,情况就不一样了。

比如给它几张同一个房间的照片,问它如果站到窗边、面向沙发,柜子会在哪个方向。

这种要在脑子里换个视角的题,连顶级的闭源大模型,在专门的评测里也只能答对一半。

而想让大模型走出屏幕,去指挥机器人、实验台、产线设备干活,这恰恰是绕不开的基本功。

前不久,紫东太初团队开源了一个专门面向物理世界的通用多模态大模型:ZDTaichu5.0-9B。

image-20260920202926485

参数量仅 9B,支持单图、多图、长视频等多种输入,任意分辨率的图像也能直接丢给它。

重要的是,它拥有一种空间具身能力,就是既看懂空间关系,又要能据此判断下一步怎么操作。

今天我把它的技术 Blog 和开源仓库翻了一翻,最让我意外的是下面这组成绩。

在 ViewSpatial、MMSI-Bench、MindCube-tiny 三项复杂空间推理基准上,这个 9B 的开源模型,分数超过了 Gemini 3 Pro、Grok 4 和 GPT-5.2。

image-20260920204730821

小参数模型在特定能力上追平甚至超过闭源大模型,如今空间具身理解也成了一个新的例子。

下面跟大家讲讲它的空间具身能力强在哪,通用能力有没有掉,以及背后是怎么做到的。

九项基准,八项同级第一

先看成绩单,在九项国际空间理解基准里,ZDTaichu5.0-9B 有八项拿到了同参数通用模型组的第一。

参与对比的是 Qwen3.5-9B、STEP3-VL-10B 和 gemma4-8B-E4B 这三个同级别的开源模型。

image-20260920204840704

其中拉开差距最大的有两项,一个是考复杂三维推演的 MindCube-tiny,它拿到了 78.27 分。

同一项测试里 Qwen3.5-9B 是 57.60,STEP3-VL-10B 是 62.81。

另一个是考跨视角理解的 ViewSpatial,它拿到 62.50,另外两家分别是 48.20 和 46.14。

唯一没拿到第一的是 CV-Bench,86.82 对 Qwen3.5-9B 的 87.19,只差了 0.37 分。

光看分数可能没什么感觉,官方 Blog 里放了一批对比案例,我挑两个直观的给大家看看。

第一个是立方体折叠题,给一张六种颜色的立方体展开图,问折起来之后从某个角度能同时看到哪三个面。

image-20260920210206661

结果 ZDTaichu5.0-9B 选对了 C,而 Qwen3.5-9B 和 STEP3-VL-10B 都选了 A。

第二个案例是换个位置认方向,给出的是同一个房间的三个视角。

要求模型想象自己站到窗帘的位置、面向沙发,再判断柜子在自己的哪个方向。

已关注
关注
重播 分享 赞
观看更多
    GitHubDaily

    0/0

    00:00/00:27
    进度条,百分之0
    00:00
    /
    00:27
    00:27
    全屏

    倍速播放中
    您的浏览器不支持 video 标签

    继续观看

    只有 9B,一个令人惊艳的国产模型,开源了!

    转载
    ,
    只有 9B,一个令人惊艳的国产模型,开源了!
    GitHubDaily
    已同步到看一看写下你的评论

    ZDTaichu5.0-9B 答出了右前方,另外两个模型都发生了参照系错乱,把方向答错了。

    这其实就是开头说的那个老问题,移动机器人挪两步、摄像头转一下,就分不清左右了。

    通用能力,没有被牺牲

    专门去练空间具身能力,行业里常见的代价是图文理解、OCR、数学这些通用能力往下掉。

    我翻了下仓库的 README,ZDTaichu5.0-9B 是在 Qwen3.5-9B 语言骨干和 NVIDIA C-RADIOv4-H 视觉编码器之上训练的。

    把空间具身能力练上去之后,它的通用榜单成绩仍然留在同级的第一梯队。

    比如图表理解 AI2D 拿到 91.48,视觉数学 WeMath 是 75.9,文字识别 OCRBench 是 85.5。

    image-20260920210314372

    Agent 和文本这边也没落下,指令遵循 IFEval 拿到 93.7,代码能力 LiveCodeBench v6 是 73.4。

    还有代表通用 Agent 的 TAU2-Bench 指标也拿到 87.7 分,这个值说明工具在调用和多步任务表现方面也不错。

    image-20260920210358135

    数据生产管线方案公开,难题多算几轮

    我挺好奇一个 9B 的模型是怎么做到的各项能力都这么好的,总结下来主要靠两件事。

    第一件是数据工程,这里发现训练空间具身模型,最费劲的其实不在模型结构,而在数据。

    ZDTaichu5.0-9B 的训练分成预训练、监督微调、高质量退火和 GRPO 强化学习几个阶段,数据总量约 1.28T tokens。

    image-20260920210435084

    到了强化学习阶段,答案对不对、空间坐标有没有命中、输出格式合不合规,都被做成了可以自动校验的奖励信号。

    目前市场上大部分开源模型只是开放权重,而这次紫东太初把整套数据生产管线的详细方案也一起公开了。

    对手里有工业、仿真、实验数据的团队来说,这是一份可以拿来参照的训练工艺。

    第二件是自适应循环推理,这个运行在模型的内部,不依赖外部的思维链。

    模型每输出一个 token,都会先估一下自己的有多大把握。

    肯定的直接输出,遇到视角变换、物体关系判断这类拿不准的,就会在内部多算几轮再给答案。

    image-20260920210502959

    这样设计就能把算力向难题倾斜,让推理成本也能得到控制,不会被拉高。

    关于这部分的实现,感兴趣的朋友,可以到仓库的recurrent_reasoning/目录下翻看相关代码。

    模型虽小,但也接得住真实场景

    说到底,前面提及到榜单分数还是纸面成绩,还得看真实的物理世界里那种一环扣一环的长任务。

    在官方给的演示案例里,有个让我印象挺深的,它让机器人把一把剪刀收进到上层的抽屉里。

    已关注
    关注
    重播 分享 赞
    观看更多
      GitHubDaily

      0/0

      00:00/01:09
      进度条,百分之0
      00:00
      /
      01:09
      01:09
      全屏

      倍速播放中
      您的浏览器不支持 video 标签

      继续观看

      只有 9B,一个令人惊艳的国产模型,开源了!

      转载
      ,
      只有 9B,一个令人惊艳的国产模型,开源了!
      GitHubDaily
      已同步到看一看写下你的评论

      看着简单,但这里面藏着不少难度,抽屉没打开就不能直接放,刀悬在开口上方也不算放进去。

      每一步都有新画面进来,模型要及时更新当前的状态和做出下一步的动作判断,而不是照着固定的计划做下去。

      除此之外,团队还在两类真实场景里做了验证,一类是科研自动化。

      模型能一边调用 Python 做仿真计算,一边在湿实验里跟踪每支试管的身份和任务进度。

      另一类是智能制造,给它一句「将红架上的篮筐放到传送带上」的工单,它能规划出取件、搬运、放置的完整流程。

      已关注
      关注
      重播 分享 赞
      观看更多
        GitHubDaily

        0/0

        00:00/01:32
        进度条,百分之0
        00:00
        /
        01:32
        01:32
        全屏

        倍速播放中
        您的浏览器不支持 video 标签

        继续观看

        只有 9B,一个令人惊艳的国产模型,开源了!

        转载
        ,
        只有 9B,一个令人惊艳的国产模型,开源了!
        GitHubDaily
        已同步到看一看写下你的评论

        不过该说的边界也说一下,ZDTaichu5.0-9B 的定位是负责高层规划的大脑。

        它管的是理解指令、识别环境、拆解步骤,底层的运动控制和设备安全逻辑,仍然由硬件的控制系统负责。

        也就是说,它并不是一个端到端的机器人控制系统。

        写在最后

        再说回开头那组成绩,一个 9B 体量的开源模型,在空间具身推理上赢过了几家闭源大模型。

        在我看来,这件事对行业的影响,远比评测的分数要更大一些。

        过去做机器人、自动化、产线智能化的团队,要么调用闭源 API,要么自己从零训练一个懂空间的模型。

        现在有 ZDTaichu5.0-9B,这个通用能力不差、空间具身能力突出的开源基座,二次开发的门槛被打下来了。

        再加上数据生产管线的详细方案也公开了,手里有现场数据的团队,可以按这套方案进行微调训练自己的模型。

        据此,我的判断是,具身智能的大脑不一定非要超大参数的模型来做。

        物理世界的更看重部署成本和响应速度,专门训练过空间具身能力的小模型,更有优势。

        过去几年,大模型学会了看懂图片,接下来要学会在物理场景里,看懂该如何操作了。

        而紫东太初在这条路上,算是抢先给国内其他团队打了个样,提前交出了一份开源答卷。

        • GitHub 项目地址:https://github.com/Taichu-AI/ZDTaichu5.0-9B

        • 技术 Blog:https://taichu-ai.github.io/ZDTaichu5.0-9B

        • Hugging Face:https://huggingface.co/TaichuAI/ZDTaichu5.0-9B

        • ModelScope:https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B

        今天的分享到此结束,感谢大家抽空阅读,我们下期再见,Respect!

        前往微信阅读全文

        内容来自公众号,可前往微信查看原文。

        查看作者的更多文章 →