紫东太初开源 ZDTaichu5.0-9B:10B 参数内空间具身能力最强通用多模态大模型
2026/09/15 17:43AI云资讯18630
9月15日,紫东太初正式开源ZDTaichu5.0-9B,模型不大实力超群,空间理解专业能力同档最强,通用能力仍居第一梯队。更稀缺的是,本次ZDTaichu5.0-9B不只开权重,更公开数据生产详细方案,并已在科研自动化、智能制造真实实体场景完成验证。此次开源,意味着国产多模态大模型正从“看懂数字世界”迈向“理解并行动于物理世界”。

ZDTaichu5.0-9B模型参数量约 9B,支持单图、多图、长序列视频与任意分辨率视觉输入,聚焦解决真实物理场景下空间感知、跨视角变换、具身任务规划等行业难题。评测结果显示,ZDTaichu5.0-9B是 10B 参数内空间具身能力最强的通用多模态大模型,九大国际权威空间理解基准斩获 8 项组别第一。同时,ZDTaichu5.0-9B创新新采用自适应循环推理架构,对标行业前沿闭源模型 GPT-6 Astra,展现出高度对齐的技术前瞻性。

当前行业一大技术难点在于:提升模型空间具身能力,往往会牺牲模型原有通用多模态能力。ZDTaichu5.0-9B完成突破,在空间能力越级提升的同时,图文理解、OCR、视觉数学、代码 Agent 依旧保持第一梯队水准。

权威基准碾压同级:10B参数内空间具身综合能力第一
在空间具身能力评测上,本次横向评测选取 Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B 等开源模型,同时对比 Gemini、Grok 等闭源大模型,覆盖空间感知、三维推理、多视角变换、具身交互九大权威评测基准,八项取得同参数组别第一名。

模型构建起四层递进能力链条:空间感知→复杂三维空间推理→具身条件推理→物理交互决策,真正实现从 “看懂二维世界” 到 “理解三维物理世界并规划决策” 的跨越。
在空间感知方面,模型可精准识别物体、方位、排布秩序,视频目标定位能力同级领先。在视频定位实测案例中,针对 “寻找从左到右第二个银色盒子” 任务,ZDTaichu5.0-9B 精准输出目标坐标,同级其他开源模型全部定位错误,该能力是机器人抓取的底层核心能力。

在复杂空间推理方面,直击机器人移动、机位变化后 “认不出、判不准方位” 的行业痛点。代表复杂三维推演能力的 MindCubetiny 取得 78.27 分,大幅领先同级竞品;跨视角评测 ViewSpatial 同样拉开差距。三视角推理实测中,参照系发生改变时,仅有本模型输出物体的正确相对方位,其余模型出现参照系错乱,可保障机器人运动过程中物体空间拓扑关系稳定。

具身推理与交互理解层面,模型不止识别画面物体,还可完成空间逻辑推理,判断物品可放置区域、识别操作前置条件。在 ERQA、RoboSpatial 两大机器人具身交互基准取得同参数开源模型第一。杯柄侧空闲区域选择测试中,模型输出点位落在合理空闲区域,对比模型点位全部落在物体占用区域,输出结果可直接用于机器人交互。

通用多模态能力上,ZDTaichu5.0-9B 在图文理解、视觉数学、OCR、指令遵循、数学、代码工具调用多项指标表现优异,通用底座能力没有伴随空间能力增强而受损。


行业稀缺:对外开放整套空间多模态数据生产管线
不同于市面上多数项目仅开放模型权重,本次紫东太初沉淀了一套经过全流程验证,对外可复用、可迁移到行业自有数据集的完整数据工程链路,迁移整套空间多模态数据生产管线,解决企业拿到模型权重,却无法基于自有工业、机器人数据迭代模型的行业痛点。
整套链路完整覆盖预训练、监督微调、高质量退火、GRPO 可验证强化学习全部环节,包含哈希-URL 双重去重、画质过滤、三维能力标签体系、思维链合成、一致性校验等全套工艺。科研机构与企业开发者可复用这套流水线,将自有仿真数据、工业现场数据、实验场景数据转化为模型训练样本。
训练采用渐进式数据课程体系,实现模型能力阶梯式生长。
预训练阶段整合开源图文、网页文档、视频、三维仿真场景多源数据,经过清洗、过滤、解析处理,完成视觉、语言、时序、三维空间概念的基础对齐。

监督微调 SFT 阶段,采用大规模任务轨迹样本,对具身样本强制做多维度一致性校验,通过多轮对话、视频序列样本构建,教会模型结合视觉证据完成任务拆解、工具调用、具身交互。

高质量退火 + GRPO 可验证强化学习阶段,搭建能力域难度质量三维自动标签系统,定向筛选优质样本;设置答案正确性、坐标命中、格式合规多重自动奖励信号,将空间点位输出、结构化规划转为可训练目标,适配长视频、长链条具身推理任务。

自适应循环推理,把算力用在真正难的判断上
为解决空间预测不确定性,支撑高难度空间判断算力需求,ZDTaichu5.0-9B 内置自适应循环推理机制。该推理迭代运行在模型前向传播内部,和 “业界猜测”的GPT-6 Astra 所采用 Loop Transformer 技术路线具备高度的前瞻性,在不扩张参数量前提下提升模型有效推理深度。

工作逻辑依靠熵门控判断任务不确定性:确定性任务直接输出结果,不消耗额外算力;面对空间变换、物体关系判别等高不确定性任务,模型会在内部循环迭代优化隐层表征,无需依赖外部思维链输出。
同时配备阻尼更新、双重停止判据、轨迹读出与状态回滚三重稳定化工程,保障内部循环不会发散。内部循环聚焦提升单步感知推理质量,复杂长程具身任务则依靠外部任务循环接收环境反馈更新全局状态,两层架构协同完成物理世界复杂任务。这套机制让算力向高难度难题倾斜,在不显著增加平均推理成本的情况下,提升复杂任务正确率。
长程具身智能:驱动物理世界持续交互与自主决策
真实物理世界下的长程具身任务,包含大量相互依赖的链式操作:识别目标、处理遮挡、移动到合适观测位置、打开容器、调用工具、搬运物体,最后校验目标是否完成。高层具身规划,要求模型持续维护全局完整任务状态,而不是为每一张输入图像独立生成单次动作。

当下热门的通过 Astra 控制端侧设备领域,我们的模型也同样具备硬核竞争力。ZDTaichu5.0-9B无需人工分步引导,可直接融合实时图像画面、用户目标描述与设备执行反馈,自主研判场景、规划操作步骤,一键输出精准有效的设备控制指令。整套操作全程自主闭环,能够高效驱动端侧工具、智能设备完成既定任务,完美适配复杂的实操场景。

从跑分到实干,让模型真正进入物理世界
依托四层能力链条与自适应推理架构,ZDTaichu5.0-9B 可以实现真实物理世界的长程具身任务闭环。长流程物理任务需要持续跟踪物体身份、位置以及任务进度,依据环境新观测更新状态,而不是机械执行初始动作列表。
在科学智能场景,模型可以打通干湿实验闭环,仿真侧仿真计算链路:接收自然语言科学问题,自主调用 Python/SciPy 工具,同时求解解析解与数值解,交叉比对校验结果,自动输出相空间图、位移速度时序曲线等可视化产物,完成从提问到分析图表报告全流程。

湿实验侧,ZDTaichu5.0-9B 能够在复杂实验环境中持续跟踪物体状态、空间关系与任务进度,依据观测结果动态更新策略,形成从感知、推理到行动的完整闭环,持续将样品身份、空间位置、任务进度三者绑定跟踪,为自动化科学实验平台提供上层任务编排与状态记录能力。

面向工业智能制造场景,模型适配备料配送、机台上料业务,应对密集货架、零件外观相似、物体遮挡等车间现实问题。在跨工位配送、机台上料实测案例中,模型接收工单文本,完成高层语义理解,输出从货架取件、搬运避障到放置到位的完整任务规划,打通工单指令到车间物理执行的链路。

ZDTaichu5.0-9B 的开源发布,打破了物理世界多模态大模型 “权重易得、能力难复现” 的行业困局,为具身大脑、智能制造、自动化科学实验领域,交付了兼顾顶尖空间具身能力与完备通用素养的国产化核心底座。
不止释放模型权重,整套经过工程验证的空间多模态数据生产管线同步对外开放,把过去少数团队掌握的核心数据工艺向全行业敞开,大幅拉低具身智能的创新门槛。这不止是一款大模型的开源,更是推动 AI 从读懂屏幕里的数字信息,走向理解、决策、交互真实物理世界的关键一步。它将激活产学研协同创新活力,加速我国具身智能生态的构建与迭代,为实体经济智能化变革注入硬核底层力量。
关于紫东太初:
中科紫东太初由中国科学院自动化研究所孵化,是跨模态通用人工智能领域的“国家队”企业,以“打造自主可控的中国通用人工智能底座,成为全球领先的多模态大模型技术创新者与产业赋能者”为使命。公司自主研发的紫东太初多模态大模型,是全球首个中文千亿参数级多模态大模型,凭借领先技术实力荣获世界人工智能大会最高荣誉——卓越人工智能引领者奖(SAIL奖),并成为首批通过中央网信办大模型备案、荣获中国信通院大模型可信认证的“双认证标杆产品”。
相关文章
- 海康威视徐习明:聚焦感知多模态大模型,为中国制造业发展服务
- 合合信息发布多模态大模型文本智能白皮书,破解复杂文档处理困局
- 合合信息发布多模态大模型文本智能白皮书,五大核心能力标准引领复杂文档处理变革
- 昇腾原生支持,科学多模态大模型Intern-S1-Pro正式发布并开源
- 128 卡 4 天时间!百度百舸助力 LLaVA-OneVision-1.5 刷新多模态大模型训练效率纪录
- 快手发布多模态大模型Keye-VL-1.5 8B性能领先、视频理解能力更强
- 商汤大装置 x 铁一院:多模态大模型赋能铁路勘察设计,让70年经验“活”起来
- 绝影亮相NVIDIA展台,端侧多模态大模型落地成果显著
- 算力赋能营销革新,东信云与华为云签约共建多模态大模型应用标杆
- 华为云全新发布基于盘古多模态大模型的世界模型
- 金山云完成阶跃星辰最新两款开源多模态大模型适配
- 天数智芯完成阶跃星辰开源多模态大模型适配,共筑AI开源新生态
- 出门问问多模态大模型又添新备案!「序列猴子」语音大模型成功完成备案
- 彩讯股份与智象未来达成战略合作,推动多模态大模型及AI应用落地
- 技术解码 | 多模态大模型AI安全员为无人驾驶保驾护航
- 亮相2024 GITEX海湾信息技术博览会 Soul App多模态大模型实现超拟人互动体验
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









