刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一
6688点击    2026-09-16 15:11

10B参数以内,空间具身能力同档第一的通用多模态大模型来了!


就在昨天,紫东太初正式开源ZDTaichu5.0-9B,新一代面向物理世界的通用多模态大模型。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


一出手,就横扫九大国际权威空间基准,拿下8项同参数通用组别全球第一。


最拉开差距的,是复杂空间推演。


MindCube-tiny上,它拿到78.27分,甩开Qwen3.5-9B整整20.67个百分点,比STEP3-VL-10B也高出15.46个百分点。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


而且,它把空间能力拉上来的同时,图文、OCR、数学、代码这些通用能力,也没落下。


到了真实任务里,这两头还真缺一不可。工单得读懂,工位也得看明白。


读懂「把东西放过去」只是开始。AI还得继续判断:换个位置该往哪走,伸手之前哪里能放,做完一步之后接下来怎么办。


这个9B模型,要补上的就是AI走进物理世界时,最容易掉链子的那一段。


奥特曼要造「大脑」,难在哪里?


这颗「大脑」有多难造?奥特曼的一番话,点中了关键。


9月初,一场播客中,他直接把话挑明,「OpenAI肯定会做人形机器人」!


在他看来,比机身形态更重要的,是搞定让机器人真正干活的那个「大脑」。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


这句话,恰恰点中了具身智能最难啃的部分。


一副机械臂可以反复执行写好的动作。可工位换了,零件挪了,任务做到一半被打断了,接下来怎么办?


总不能每变一次,就让工程师重新教一遍。


这就把问题推到了空间理解上,指令听懂了,还得判断眼前的东西在哪、怎么摆、能不能操作。


认出画面里有个杯子,只回答了「是什么」;判断杯柄朝哪、旁边能不能放东西,才开始接近「能做什么」。


任务一旦拉长,这些判断还得接上。


东西拿起来了,身份得记住;容器打开了,状态要更新。前面一个判断没跟上,后面就可能越做越偏。


ZDTaichu5.0-9B这颗大脑,到底能不能应对这些变化?


接下来,直接看三道对比题。


三题连过,同级全翻车


以下三道题的难度是递进的,正好对应机器人从「看见」到「动手」要过的三关。


第一题:换个位置,柜子还找得着吗?


给到的要求是,移动到绿框窗帘的位置,面向蓝框沙发,判断红框柜子相对自己的方位。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


窗帘、沙发、柜子,全在画面里。难点在于,题目要求换一个地方站,再转一个方向看。


原图里的「左」,未必还是新位置上的「左」。


看起来像一道找方向的小题,实际要求模型连续处理两次变化:先改变站位,再改变朝向。


人会在脑子里转一下房间。模型也得完成同样的参照系转换:先把自己「搬」到窗帘前,再把视线对准沙发,最后重新推算柜子落在新坐标系的哪个方向。三步里任何一步串了,答案就反了。


这背后是参照系变换(frame of reference transformation) 问题。


模型必须同时维护三套坐标:世界坐标系、本体坐标系、相机坐标系,并在视角切换时完成三者之间的映射。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


多数模型的做法是把每帧图像独立编码成视觉Token,再靠语言先验「猜」方位——一旦相机位姿变了,视觉Token 之间的空间拓扑关系没有显式建模,关系就断了。


ZDTaichu5.0‑9B给出正确答案「右前方」。Qwen3.5‑9B和STEP3‑VL‑10B都发生了参照系错乱,给出「右、上、后方」这类错误答案。


它考的,恰恰是移动机器人绕不开的能力。摄像头一转,物体在画面里的坐标就变了。


绝大多数多模态模型在这一刻会丢掉空间拓扑:刚才还记得柜子在沙发左边,机器人挪两步,关系就散了。如果每换一个视角就把空间关系认错,后面规划得再漂亮,也可能走反方向。


第二题:方位算清了,目标能选对吗?


指令很短:找到「从左到右第二个银色盒子」。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


短,不代表简单。


模型要同时干三件事:认出哪些是银色的(属性),把它们按从左到右排好(顺序),还要能真正给出目标的位置。


三件事缺一件,抓错的就是隔壁那个盒子。


技术上,这是一道属性绑定+空间排序+位置输出的复合题。


模型需要把「银色」这个视觉属性、「第二个」这个序数关系、「从左到右」这个空间方向,绑定到同一个目标实例上,并精准输出目标物体的位置坐标。


序数关系尤其棘手:它依赖对整排物体的完整枚举和相对位置排序,而不是孤立地识别某一个盒子。


ZDTaichu5.0‑9B输出归一化坐标 [237,226],精准命中数据集真值。


Qwen3.5‑9B给的是 [360,280],STEP3‑VL‑10B 给的是 [327,220],都指错了盒子。同级通用开源模型里,只有它选对了目标。


放到车间里,这道题有个更熟悉的名字:密集货架上一排外观几乎一样的料盒,工单说「取第三排第二个」。机器人抓取的第一步不是伸手,而是选对目标。


目标选错,后面的抓取再精准也是白忙。


第三题:目标找到了,旁边真能放东西吗?


前两题解决了方位和目标,这次要进一步判断操作条件:找出杯柄那一侧的空闲区域,给出一个能放东西的点。


这道题的门槛在于,模型不能只回答「杯子在哪」,还得回答「杯子怎么摆的」「它旁边哪块是空的」。


拆开看是三步:先识别目标杯子,再解析它的姿态、确定杯柄朝向,最后校验邻近区域有没有被别的物体占着,才能输出一个可用点位。


这本质上是可供性推理(affordance reasoning) 加空间约束校验。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


模型要输出的是一个连续空间中的合法点位,而不是一个类别标签。


这意味着它必须理解物体的三维姿态(杯柄朝哪边)、理解「空闲」的物理含义(没有被其他物体占据)、并把这两者合成为一个可执行的坐标。


很多模型能识别杯子,却给不出「杯柄侧旁边那块空地」的坐标,因为它缺的是从语义识别到空间决策的最后一跳。


ZDTaichu5.0‑9B给出坐标 [650,720],完全落在合理空闲区域。Qwen3.5‑9B和STEP3‑VL‑10B给出的坐标,全部落进了不合要求的区域。


换句话说,机器人真按它们的答案放下去,东西会压在别的物体上。


识别是「知道有什么」,交互是「知道能做什么」。 前者只是看图,后者才是动手前的最后一道判断。市面上不少模型在前一层表现不错,到这一层就开始给出不可执行的答案。


三道题,正好是一条递进的链:空间感知、复杂三维推理、具身条件判断,最后落到物理交互决策。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


不过,空间判断做对了,还不足以接下完整任务。


机器人要知道往哪里放,也得先读懂工单、理解规则,必要时调用工具。


空间能力上去了,通用能力一分没掉


这就带来另一个问题——


把模型往空间和具身方向训练,原本擅长的图文理解、OCR、数学和代码能力,还能不能保住?


如果连工单都读不明白,方位算得再准,也不知道该干什么。再配一个通用模型?两个模型怎么分工、怎么传信息,又是一摊要解决的事。


所以,ZDTaichu5.0-9B要的很明确:空间能力练上去,通用本事也得留住。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


先看读图、算题、认字这些基本功:AI2D拿到91.48分,WeMath为75.9分,MathVista Mini为84.5分,OCRBench为85.5分。


看懂示意图、读出工单文字、算清图里的数量关系,都得靠这些基本功。


在多项空间能力基准测试上,ZDTaichu5.0-9B胜过了多模态模型Gemini 3 Pro,比如ViewSpatial、MindCube-tiny、VSI-Bench成绩领先7%以上。


同时在文本智能体与代码能力上,IFEval(93.7)、AIME2026(89.2)以及LiveCodeBench v6(73.4)表现完备,真正实现了「通用能力不衰减,空间具身能力越级突破」。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


空间能力往上冲,通用能力也守住了第一梯队。


开发者看重的正是这一点:同一个模型,既能读懂任务,也能看懂现场。


那么,这两类能力是怎么一起练出来的?


难题多想几轮

大脑内部也能「三思而后行」


一头在训练,一头在推理。平时学没学扎实,临场能不能想明白,两件事都得解决。


ZDTaichu5.0-9B做了两件相互配合的事:训练时把空间关系和任务约束教扎实,碰上难题时,再给模型多一点计算的余地。


这次推理的核心设计,叫「自适应循环推理」。


直白地说,模型一边生成,一边判断:下一步拿得准吗,要不要再算几轮?


这一片段,细到每一个Token。


模型先完成一轮标准计算,得到下一个Token的概率分布和当前的隐层状态,再由「熵门控机制」判断预测的不确定性。


概率分布越分散,就意味着它越拿不准。


此时,门控机制会决定是否触发额外计算,让模型在当前Token位置循环执行部分层块计算,逐轮修正内部表征,再继续输出。


确定性高的位置,则直接输出,不追加循环。


也就是说,算力具体加在那里,要看生成过程中哪个位置拿不准。


这个循环发生在模型前向传播内部,无需为循环调用外部工具。


这波操作,很难不让人想到传闻中GPT-6 Astra,内部也采用了「循环Transformer」的机制,让其推理能力大涨。


如今,紫东太初直接把这套机制装入了9B模型。


从这个角度看,恰恰体现了团队极高的技术前瞻性,踩中的架构直接对齐前沿巨头。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


哪个Token拿不准,就在那里多花点算力。目标是让复杂空间判断更准,平均推理成本又不至于涨太多。


不过,多想也可能越想越偏,团队为此还加入三道稳定机制。


首先是「阻尼更新」:控制每轮修正幅度,并以原始表征为参照,避免内部特征一路漂移。允许调整,但不能改着改着,把原来的视觉证据丢了。


接着是双重停止判据,同时监测输出分布和隐状态的变化,对应KL散度与隐状态残差,帮助判断迭代是否趋于稳定。


还有轨迹读出与状态回滚,保留中间状态,从多轮结果中选择风险较低的表征,必要时回退。


最后一轮并不天然比前几轮更好。多算几轮,要算出有用的修正,也要知道何时停、何时退。


这三道机制,就是给内部循环装上约束。至于具体耗时和成本,以及每项机制贡献多大,还要看完整测试。


还要分清,模型内部循环解决的是当前这一步的推理。抽屉打开了没有、东西是否真的放进去,得靠新的画面和执行反馈确认。


脑子里多转几圈,不能代替抬头再看一眼。内部循环和外部任务循环各司其职,才能支撑更长的连续操作。


数据怎么教,决定「大脑」学会了什么


不过,再会琢磨的模型,也得先学过靠谱的东西。


ZDTaichu5.0-9B的整个训练过程采用「渐进式数据课程」,像上学一样一级一级往上教。


预训练阶段,先打基础。


这里,先接触开源图文、结构化网页、多视角视频及三维仿真场景,学习视觉、语言、时序和空间概念之间的联系。


原始数据不会直接倒进去。感知哈希和URL双重去重,减少重复内容;画质、图文相关性及隐私安全过滤,拦下问题样本。随后进行重描述、视频抽帧与样本打包。


这些工序不抢眼,却决定了模型学到什么。关键细节糊了,说明还配错,再好的学生也经不起这么教。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


监督微调阶段,训练数据开始像「真正的工作」。


喂的东西换成了大规模任务轨迹,真实业务问答、空间具身案例、Agent完整的工具调用记录。


具身样本尤其需要检查图像、对象关系与操作约束是否一致。抽屉明明关着,答案却教模型直接往里放,这种样本必须拦下来。


长推理也不能只看篇幅。团队通过拒绝采样、格式检查和一致性校验筛掉问题内容,再组织多轮对话、多图与视频序列等训练输入。


后续以「能力域—难度—质量」三维标签查漏补缺,根据反馈定位短板,筛选更有信息量的样本。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


高质量退火阶段使用长推理样本,GRPO强化学习则引入可自动校验的奖励:答案正确性、空间框选坐标命中、输出格式合规,都能成为反馈。


比如,让模型选一块可放置区域,解释写得再漂亮,点落在障碍物上,也过不了关。


反馈要能指向操作所需的判断,模型才有机会把这些能力练得更扎实。


更关键的是,这整套数据生产与训练方案是随权重一起开放的。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


真正的考场,表现同样不俗


本事讲了,原理也拆了。真搬到实验台和车间里,能不能干成活?


真实物理世界的长程任务,是一串相互依赖的链式操作:


认出目标、处理遮挡、挪到合适的观测位置、打开容器、调用工具、搬运物体,最后校验有没有完成。


每一步都依赖上一步的结果,模型得一直记着整件事进行到哪了,而不是每来一张图就独立生成一个动作。


ZDTaichu5.0-9B做了两类实体Demo验证,分工很清楚——


它当高层规划的大脑,负责看懂环境、记住对象、拆步骤; 


底层的抓取、导航、开合交给机器人的控制系统,设备安全逻辑也留在硬件那边。


先看科研,它打通了仿真计算和湿实验。


给它一个自然语言的科学问题,比如一个阻尼振子怎么运动,它自己调Python和SciPy,同时算解析解和数值解,两边交叉核对,再画出相空间图、位移和速度的时序曲线,一份分析报告就出来了。


整个科学分析的工作流,走了个完整。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


到了实验台上,让它按顺序把两支试管放进架子,规矩是先放画面右边那支,再放左边那支。


中途抓取、交接会让试管在画面里的位置不停变,它得一直记住哪支是哪支。看到「一支在架子里、一支还在桌上」,它知道任务没完,输出下一步:把桌上那支拿进去。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


多样品操作里最容易出的两个错,认错样品和搞乱顺序,就是靠这份「身份记忆」压住的。


滴管转移液体也一样,滴管、源烧杯、目标烧杯三者的空间关系绑在一起,滴管悬在目标烧杯上方时,它知道该继续滴。样品身份、空间位置、任务进度三样东西绑着跟踪,这正是自动化实验平台缺的那层上层编排。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


再来看制造,更接地气。


测试中,选的是备料配送、机台上下料检测、工位整理三类最常见的业务,面对的也是工业现场最真实的麻烦:


货架密集、零件长得一样、东西被挡住、目标跑出视野、操作有严格的前置条件。


工单一句话:「把红架上的篮筐放到传送带上。」它要从密集货架里认出红色料架、白色篮筐,判断抓哪、双臂怎么配合,放到绿色传送带上之后还要回头检查有没有放对位置。


机台上料也是同一套逻辑,长工件怎么避障、夹哪里、放到工作台哪个点,全靠它做判断。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


长程任务真正难的,是每一步判断要连得上。


刀从架子上拿出来了,它还得记得这是同一把刀;抽屉没开,就不能算满足放置条件;刀悬在盒子口上方,不等于已经放进去了。


目标被挡住,先判断要不要挪开遮挡物;容器没开,先满足开合前提;还没站到能交互的位置,直接放置大概率失败。


刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一


从三道空间题,到实验台和生产线,这些案例把前面的能力接了起来:通用能力读懂要求,空间能力判断现场,再靠持续反馈推进下一步。


这些任务已经在真机上跑了起来。接下来换设备、换工位,还得一关关接着过。


这颗9B的大脑

还能接着往下练


回头看,奥特曼所说的机器人「大脑」,难就难在这里——


语言里的要求要对上眼前的对象,对象会动、视角会变、条件会缺,而任务不能停。


ZDTaichu5.0-9B这次,把几块关键能力装进了同一颗9B的「大脑」。


空间榜单上冲到同档前列,通用本事没落下,实验台和车间里的连续任务也开始跑起来了。


权重和数据生产、训练过程方案一起交到开发者手里,这件事就还能继续往下做。换成自己的数据、自己的设备,继续练、继续试,让模型一点点熟悉自己的现场。


ZDTaichu5.0-9B开源地址:


Blog:https://taichu-ai.github.io/ZDTaichu5.0-9B

Huggingface:https://huggingface.co/TaichuAI/ZDTaichu5.0-9B

Modelscope:https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B

Github:GitHub - Taichu-AI/ZDTaichu5.0-9B


下一步,紫东太初团队要把这颗「大脑」继续往前推,打造面向物理世界的具身基础模型。


看懂眼前的场景之后,还要能预判:这一步做下去,环境会怎么变?再把判断接上连续动作,根据执行反馈调整下一步。


这意味着,要把多模态推理、世界状态预测和连续动作生成连起来,形成「感知—认知—预测—行动—反馈」的自主闭环。


让AI从理解数字世界,进一步走向理解、预测并改变物理世界。


文章来自于"新智元",作者 "桃子 大卫"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner