编辑|陈陈 紫东太初开源的这个通用多模态大模型 ZDTaichu5.0-9B ,简直夯爆了! 虽然参数只有 9B,却在空间具身智能这条赛道上跑到了前列。 9 项国际权威空间理解基准中拿下 8 项同参数通用组别第一 ,在空间感知、跨视角三维推理、具身任务规划等指标上优于 Qwen3.5-9B、STEP3-VL-10B 等模型,即使加入 Gemini 3 Pro、Grok 4 等闭源模型,仍在 5 项基准上取得最高分。 不仅如此, 该模型在图文理解、OCR、视觉数学、代码 以及 Agent 等通用多模态能力评测中,同样保持第一梯队 。 通用能力榜单 在 11 项 Agent、代码、指令遵循和数学推理测试中 ,也表现出比 Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B 等同量级开源模型的优越性。尤其在 TAU2-Bench 和 IFEval 上,其成绩还略高于 Gemini 3 Pro。 AGENT 和文本榜单 Blog: https://taichu-ai.github.io/ZDTaichu5.0-9B Huggingface: https://huggingface.co/TaichuAI/ZDTaichu5.0-9B Modelscope: https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B Github: https://github.com/Taichu-AI/ZDTaichu5.0-9B/ 伴随模型开源的,紫东太初还公布了 ZDTaichu5.0-9B 背后的技术路线: 自适应循环推理 ,该技术与大家猜测的前沿闭源模型 GPT‑6 Astra 使用的 Loop Transformer 技术采取类似的路线 ,展现出团队极高的技术前瞻性。 另外,紫东太初同步开放了一整套经过验证的 数据生产管线详细方案 ,覆盖预训练、监督微调、高质量退火和 GRPO 强化学习等环节。 通用多模态模型进物理世界,卡在哪里? 这背后对应的是一个正在发生的变化: 过去几年,通用多模态大模型在数字世界的能力提升速度有目共睹,图文理解、复杂视觉问答、跨模态推理,这些任务的评测分数逐渐逼近饱和。 但物理世界是另一回事。 一个机器人面对操作台上的工件,需要同时完成:看清楚目标在哪(空间感知)、换了视角之后还能认出来并判断空间关系(跨视角三维推理)、给出一个不违反物理约束的操作方案(具身推理)。这些能力,在数字世界的多模态评测里几乎不会同时考到,但在物理现场,它们必须同时在线,缺任何一层,任务链条就会在某个节点断掉。 更麻烦的是,空间具身所需的三维关系标注、操作约束数据,和通用多模态的图文数据在分布上差异较大,两类数据混在一起训练,模型很容易在参数受限时顾此失彼。 再就是推理机制:空间推理任务内在地存在难度不均匀性,有的判断一步就能得出,有的(比如参照系变换、多物体相对关系推演)需要更深的迭代计算,但传统模型的算力分配是线性的,不管题目难不难,消耗的计算资源基本一致,这在参数有限的小模型上,是一个真实的瓶颈。 ZDTaichu5.0-9B 的解法是用一套完整的数据生产管线解决数据侧的问题,用自适应循环推理机制解决复杂推理以及算力分配的问题。 结果是,空间具身能力跃升,通用能力不降级。 具体结果如何?我们接着往下看。 10B 档位空间具身能力通用第一,通用多模态大模型迈向物理世界 ZDTaichu5.0-9B 的空间具身能力提升, 首先体现在复杂空间理解任务上 。 给定一张图或一段视频,模型能不能精准定位目标物体的坐标?要求模型同时理解物体属性、空间排序、位置信息三个维度。 实测里,ZDTaichu5.0-9B 准确输出了归一化坐标并精准命中真值,而参与对比的同级开源模型全部定位错误,ZDTaichu5.0-9B 是唯一完成正确目标选择的模型。 视频:寻找从左到右第二个银色盒子( https://mp.weixin.qq.com/s/qdIweDFUOMZbANXYYfrcUw)。 第二层:参照系转换 。真实环境中的机器人,很少保持固定视角。机器人移动之后,摄像头位置变化,原本建立的空间关系也会发生变化。模型需要理解这种变化来自观察角度改变,而不是物体本身移动。 典型任务是要求模型先移动到某个参照物位置、转向面对另一个参照物,再判断第三个物体相对自身的方位。在示例中,ZDTaichu5.0-9B 给出了正确的方位判断。 视频:三视角推理 —— 指令要求移动至绿框窗帘位置、面向蓝框沙发,判断红框柜子相对自身方位( https://mp.weixin.qq.com/s/qdIweDFUOMZbANXYYfrcUw)。 MindCube-tiny 这一榜单要求模型在脑中构建三