国产9B开源模型:空间具身能力断层领先

紫东太初发布ZDTaichu5.0-9B,在空间理解基准测试中表现断层领先,且通用能力不减。
在人工智能从“看懂”向“做懂”跨越的关键时刻,国产多模态大模型再次传来重磅消息。紫东太初团队最新开源的 ZDTaichu5.0-9B 模型,在物理世界的空间理解与操作能力上取得了惊人的突破,直接将 10B 以下规模模型的天花板顶高了一大截。
空间理解能力断层领先
过去,许多多模态模型虽然在处理图片、文字上表现优异,但一旦进入真实物理世界,往往面临“眼高手低”的尴尬。要么空间判断力跟不上行动指令,要么为了强化空间能力而牺牲了通用的文本与逻辑推理能力。
ZDTaichu5.0-9B 的出现,完美解决了这一痛点。它不仅能像人一样理解复杂的空间关系,还能像机器人一样精准执行任务。在九大国际权威空间理解基准测试中,该模型在 10B 规模通用模型中斩获了 8 项第一,遥遥领先于 Gemini 3 Pro、Grok 4 等国际竞品。
实战表现:从“找东西”到“做任务”
模型的强大能力并非纸上谈兵,我们来看几个具体的场景测试:
- 精准目标定位:在杂乱的桌面上,模型能迅速识别出目标物体的属性(如银色盒子)及其空间排列位置(从左数第二个),并输出极其精准的归一化坐标。
- 复杂三视角推理:面对不同视角的房间画面,模型能灵活转换参照系,判断自己与物体之间的方位关系,例如准确识别出“红框柜子位于右前方”。
- 具身交互规划:在美工刀收纳演示中,模型不仅要识别物体,还要判断抽屉状态、夹爪位置,并规划出“拉开-放入-关闭”的连续动作链,展现了极高的任务规划能力。
通用能力不降级:全能型选手
与许多“偏科”的空间模型不同,ZDTaichu5.0-9B 在保持空间能力领先的同时,通用能力依然稳居第一梯队。在 AI2D(图解理解)、WeMath(数学推理)、MathVista Mini(数学视觉)以及 OCRBench 等基准测试中,其分数均大幅领先于同类竞品,甚至在部分测试中逼近或达到更高规格的模型水平。
这意味着,开发者可以将其直接作为 Agent(智能体)的基础模型,用于编写代码、数据分析、科学计算等复杂任务,而无需担心模型在处理非空间任务时出现性能衰减。
行业价值与实用解读
ZDTaichu5.0-9B 的开源,对于 具身智能 领域的开发者、机器人公司以及智能制造行业具有极高的实用价值:
- 降低开发门槛:开源的权重和架构让中小企业和科研机构无需从零开始训练,即可拥有具备强空间感知能力的“大脑”。
- 赋能物理世界:为家庭服务机器人、工业自动化机械臂、自动驾驶辅助系统提供了更精准的感知与决策能力,让机器真正能“看懂”环境并“做对”事情。
- 资源效率优化:作为一个仅 9B 参数的模型,它能在算力有限的设备上运行,同时通过特殊的推理机制,将算力集中在最难的判断环节。
技术解密:如何做到“小身材大能量”?
ZDTaichu5.0-9B 能取得如此成绩,得益于其独特的训练与推理策略。
全栈数据管线
团队构建了一套覆盖预训练、监督微调(SFT)和强化学习的全流程数据管线。在训练过程中,特别注重空间样本与通用任务的混合,并通过严格的校验机制(如拒绝采样)确保数据的一致性,从而打通视觉、语言与时序逻辑的壁垒。
内置自适应循环推理
这是该模型的一大亮点。它引入了类似 OpenAI GPT-6 Astra 的“按需推理”机制。
- 动态算力分配:模型在推理时,会先进行一次标准计算,然后通过“熵门控”评估对输出的不确定性。如果判断准确,直接输出;如果不确定,则在模型内部重复计算特定层块,增加计算深度。
- 双重保障:通过阻尼更新、双重停止判据(监测 KL 散度与残差)等技术,防止模型陷入无限发散,确保在保证精度的同时控制计算成本。
这套机制让 ZDTaichu5.0-9B 成功实现了空间判断与通用能力的双重突破,为国产开源大模型走向世界前沿提供了强有力的技术支撑。