9月15日,中国科学院自动化研究所紫东太初团队正式开源 ZDTaichu5.0-9B 通用多模态大模型。不同于主要面向数字内容的通用多模态模型,ZDTaichu5.0-9B 定位为“面向物理世界的通用多模态大模型”,推动人工智能从“看懂图文”走向“理解空间、规划行动、持续完成任务”。
ZDTaichu5.0-9B作为参数规模为9B的中小体量多模态模型,在同规模通用模型中实现了“空间与具身理解”的最强能力。在九项国际空间理解测试中,该模型拿下八项同组别第一名。
ZDTaichu5.0-9B四大核心特征。
空间理解与具身推理能力突出。该模型构建了“识别物体位置—推演三维空间关系—判断操作条件—输出行动决策”的四层思考链条,能够理解现实世界中的远近、方位、遮挡关系。在杂乱桌面目标定位、模拟转身视角变换、空闲区域判断等测试中,该模型均能精准锁定目标或可用空间,输出可直接供机器人使用的点位。为家庭机器人、工业机械臂“看得准、转不晕、知道往哪里下手”提供有力支撑。
通用能力与具身能力协同提升。行业长期存在“强化三维空间判断力与具身推理能力,往往牺牲图文识别、OCR、数学、代码调用等基础本领”的技术难题。ZDTaichu5.0-9B实现了两全:空间具身能力大幅提升的同时,图文识别、OCR、数学、代码调用等通用能力依旧保持优秀水平,避免顾此失彼。
整套空间多模态数据生产管线方案开放。区别于多数开源模型仅放出训练成品文件,本次开源一并公开了完整可复用的空间多模态数据生产全流程方案,涵盖原始素材清洗、样本筛选、标签制作、模型微调、强化学习优化等环节。外部机构和企业可直接复用,解决“有权重、无数据处理管线”的行业痛点,便于科研机构、机器人企业利用自有仿真画面、工厂实拍视频、实验室记录加工训练素材,训练适配自身业务场景的AI。
算力能耗低。模型搭载自适应循环推理机制,能够判断问题难度:简单任务直接输出,不额外消耗算力;复杂空间推理任务则在内部反复推演校验,投入更多计算资源。同时设计多重保障机制,避免陷入无限循环;复杂长链条机器人任务可接收环境实时反馈,不断更新全局判断。整套设计在不明显增加耗时和算力消耗的前提下,提高复杂现实任务正确率。
在科研、工厂真实场景落地验证
跑分优秀只是基础,能不能在现实环境干活,才是检验人工智能的关键。ZDTaichu5.0-9B 已经在科学实验、智能制造两大场景完成真实测试。
在科研自动化场景,它可以接收科研人员的自然语言问题,自主调用计算工具做求解,交叉校验不同算法的结果,自动绘制分析图表,完成从提问到生成报告的部分科研工作。面对实体化学、物理实验,AI盯着机械臂做液体转移等操作,实时跟踪样品位置、实验进度,根据现场情况调整下一步动作,助力实现自动化干湿实验闭环。
在工厂智能制造场景,面对车间里货架拥挤、零件外观相似、物体被遮挡等现实麻烦,它能够读懂文字工单,自主规划整套动作:从货架取件、移动避障,再到放置到位,把纸上的工作指令,转化为机器人可以执行的完整流程。
开放国产大模型生态,推动AI走进物理世界
ZDTaichu5.0-9B的开源,把理解三维物理世界的整套技术向行业开放,降低具身智能的研发门槛。让更多开发者、科研人员基于这套底座开展创新,推动人工智能真正走进现实,为机器人、自动化科研、工业智能化提供底层支撑。
ZDTaichu5.0-9B 已正式上线。期待广大开发者、科研伙伴、产业伙伴基于ZDTaichu5.0-9B 开展创新探索、产业落地实践,共同丰富国产大模型生态,推动AI技术赋能千行百业。

ZDTaichu5.0-9B架构图
开源地址
Blog: https://taichu-ai.github.io/ZDTaichu5.0-9B
Huggingface: https://huggingface.co/TaichuAI/ZDTaichu5.0-9B
Modelscope: https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B
Github: https://github.com/Taichu-AI/ZDTaichu5.0-9B