摘要:

少做题,是因为千寻只做最难的那道题。真高手,不打低端局。

凤凰网科技 出品

作者|米朵

编辑|赵子坤

一台机器人接到指令后,自主抓取桌签、矿泉水、笔记本,布置好会议桌后,直奔打印机,将会议材料打印好,并将废弃文件丢进碎纸机——全程没有遥控器、没有人工分步提示。

这是第二届世界人形机器人运动会的场景赛现场,人类成了真正意义上的“旁观者”。

首次参赛的千寻智能(Spirit AI)成为这场大考中最引人注目的玩家:

不玩人海战术,没有遥操或固定代码,只报名餐饮、办公两项最有代表性的项目,以100% 全自主推理的方式参赛,从预赛就跻身前列,甩开一众竞争对手,获得办公场景冠军、餐饮场景亚军。像不世出的宗门圣子,挥一挥衣袖、事了拂衣去。

这亮闪闪的奖牌,指向的是一个正在发生的行业拐点:人形机器人的竞争,正在从“本体能力”进一步走向“具身大脑”。

机器人比赛的看点,早已不只是跑得多快、跳得多高,能玩多少花样。当本体能力被充分看见之后,真正的考验正在转移到另一个维度:它到底能不能自主干活。

全场唯一100%自主推理参赛的考生

今年的机器人运动会,“赛场”不止在跑道上。

餐饮、办公、酒店、家庭、工业……这些不再是实验室里的标准化工位,而是1:1复刻的真实场景。

51个项目、1301场比赛,16个国家的666支队伍、2056台机器人同台竞技,但真正引发行业关注的,是首次设置的21个场景赛项,占到全部赛项超四成。

在餐饮场景赛中,机器人需按顺序完成点餐取餐、餐品加热、饮料制作三大任务。热食柜的摆放是随机的,机器人必须自主识别裁判指定食物在柜中的位置。办公场景赛则要求机器人完成会议用品布置、文件处理等一系列长链条操作。比赛规则要求机器人在20分钟内按顺序完成多环节作业,任一环节未达要求即不得分,且不得跳过或放弃。

这些任务与过去机器人传播中常见的跑跳、格斗、舞蹈有着本质区别。后者考验的是单点能力——爆发力、平衡性、动作精度。而场景赛考验的是完整业务逻辑:理解指令、识别物品、规划路径、操作设备、完成交付,中间任何一个环节出错,整个任务即告失败。

这次赛程核心考察的纯自主推理能力难度极高。尤其是在办公场景,多个号称要自主推理的队伍,最终直接失败,无缘决赛。

参赛队伍中,也有不少队伍直接采用简便的遥控操作模式,由选手在场外通过遥控设备控制机器人,这意味着其得分要乘以0.5的系数,分数大打折扣。

而千寻采用全自主方式参赛,机器人搭载自研Spirit v1.6大模型,所有推理均在机器人本体端完成,不依赖人工实时操控。“自主的难度比遥操大得不是一点半点。”千寻智能参赛负责人表示。与相对标准化的实验环境不同,真实世界中的任务往往充满随机性。物品的位置、形态、材质以及操作过程都可能发生变化。

从最终结果来看,千寻不仅从预赛办公场景开始就包揽冠亚军,且是唯一自主推理进决赛的队伍。

待到决赛环节,千寻已是唯一一家全程用模型推理参赛的企业,且一举夺魁。

“自主”难度为何如此之高?因为此次办公场景的比赛,需要机器人拿取纸张,去打印机打印、去碎纸机碎纸,以及布置会议桌,包括准备矿泉水、桌签、会议本等一系列复杂动作。特别是,拿取纸张这一动作,纸张相对较软、随时可能弯折,以及弯折后光线可能会发生变化,都对模型有着极大挑战,要求机器人几乎是要随时应对突发、及时作出调整和应对。

而这种从“执行固定程序”到“现场自主推理”的跨越,正是人形机器人从实验室走向生产力现场必须跨越的门槛。

换句话说,这场比赛实质是一场“开卷”与“闭卷”的同台竞技。有人带遥控器进场,有人完全靠“大脑”自己判断——千寻选择了难度更大的后者,赢得了奖牌。

不卷数量卷质量:同一套大脑的跨场景验证

四百多年前,萨尔浒之战,洞悉战争本质的努尔哈赤面对数倍于自己的明军,说出了那句流传至今的战争名言——

凭尔几路来,我只一路去!

几百年后,面对人海战术、机海战术,遥操参赛千寻只是用一套“大脑”,斩获了两项最难场景任务的优异成绩。

千寻智能此次拿下出色成绩,其核心价值在于验证了同一套具身大脑的跨场景泛化能力。

餐饮场景和办公场景,对机器人的能力要求截然不同。餐饮考验的是取物、微波加热、接饮料、交付……这些都涉及对食物这种易变形物体的精确抓取和搬运,以及对微波炉旋钮这种非标准化交互界面的操作;办公场景则考验物品识别、会议用品布置、文件处理——涉及对不同品类办公用品的分类和归位,以及对桌面布局的空间理解。

这意味着,当机器人面对类似“把可乐放进冰箱”与“把文件归置到桌面”这两个截然不同的指令时,底层逻辑并不是在切换不同的“App”,而是同一个大脑在基于对物理世界的通用理解,进行差异化的动作生成。

千寻智能自研的Spirit v1.6具身基座模型,采用VLA与世界模型深度融合的架构。其核心突破在于解决了行业长期存在的“金鱼记忆”难题——即机器人只能完成短链条、单技能动作,难以保持对长期目标和上下文的持续理解。而在本届运动会的场景赛中,机器人需要完成的正是多步骤、长链条的复合任务。

支撑这一表现的,是千寻覆盖基座模型、数据管线、Agent、感知导航、机器人本体等多个层面的通用机器人智能体。其中,Agent长程大脑负责保存长期目标和任务上下文,将模糊指令拆解为多个子任务并跟踪进度;感知与导航系统负责建立空间信息、规划路线;基座模型则接收语言指令、视觉状态和机器人本体状态,生成动作。

在数据层面,千寻构建了一套独特的“数据金字塔”体系。底层是大规模互联网人类视频,用来建立对物体、场景和人类行为的通用理解;中间层是通过自研 uDAS 可穿戴数采设备采集的人类示范数据,补足人与物理世界交互过程中的动作和接触信息;顶层则是真机遥操作、真实部署和场景回流中产生的高价值数据,用于模型后训练和强化学习。

其中,uDAS 可穿戴数采设备已历经 7 代技术迭代,可在较低成本下记录真实生活中的操作过程。全国各地的数采员佩戴设备,完成收拾床铺、清洗水槽、打包箱子等日常任务,让模型从中学习“怎么抓取”“怎么放置”“怎么和不同物体交互及操作”。据介绍,uDAS 已将单条数据采集成本降至传统遥操作方式的 1/10,数据可用性提升至 95%。

正是这套从数据到模型到部署的完整闭环,让千寻的机器人能够在餐饮和办公两个差异巨大的场景中,都做到自主理解任务、判断环境、纠正误差并完成工作。千寻的跨场景泛化能力,在这一刻也得到了公开验证。

不看花活看效:机器人竞争开始拼“世界级大脑”

毫无疑问,中国机器人的本体能力已被充分看见。

宇树科技的双足人形机器人累计下线1.8万台,G1是全球单一型号出货量最大的双足人形机器人;其“超人”机器人在奔跑速度、跳跃能力等物理指标上不断刷新极限。2026年8月,宇树科技正式登陆科创板,开盘暴涨600%以上。

但一个更深层的变化正在发生。2026年上半年,超过一半的融资涌向“大脑派”公司,本体厂商占比不足两成。截至2026年中,国内已有8家具身智能企业跻身“200亿元估值俱乐部”,支撑这些估值的核心叙事高度一致——均指向各自的通用智能模型。

多位业内人士曾对凤凰网科技表示,国内具身智能产业下半场的核心竞争已切换至“机器人大脑”,大模型能力、数据迭代体系与智能决策水平,成为决定企业长期价值的核心估值锚。

首次参赛的千寻夺冠的意义正在于此:它不是一次实验室里的Demo展示,而是把具身大脑放进了一个公开、真实、可比较的竞技场中接受检验。在场景赛的规则下,有人遥操、有人全自主;有人只能在单一场景中完成任务、有人能跨场景泛化。千寻用100%自主推理证明了“大脑”路线在真实生产力场景中的可行性。

过去几年,机器人行业的传播更容易被跑跳、格斗、舞蹈吸引,那些画面足够酷、足够有传播力。但餐饮、办公这类场景,才是机器人真正要进入的战场。

“看起来很聪明”远远不够,要能够有实力“证明自己真的聪明”,才是机器人行业从Demo炫酷走向能力验证,从展示能力走向生产力验证的关键时刻。

世界级的身体之后,需要世界级的大脑来接管。千寻夺冠释放的信号很明确:人形机器人的竞争,正在从“本体能力”走向“具身大脑”。而这场接力,才刚刚开始。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8vsAMMOHqNU