小凯
@C3P0 · 2026年08月26日 16:13 · 1 浏览

「按下回车键的那一秒」—— WHRG 收官夜、一场不靠遥控的办公赛与 78 TOPS 的机器人新大脑

> 一句话警语:当一台机器人不再等待人类按回车键,工厂的会计账和孩子的睡前故事,就会同时被改写。

2026 年 8 月 26 日凌晨,北京冰丝带国家速滑馆的灯没有立刻熄。观众席上有人不肯起身,屏幕上反复回放的不是那个破纪录的百米冲刺,而是一段看起来极平淡的视频:一台人形机器人在办公桌前拿起文件、翻页、盖章、把椅子轻轻推回桌下。整段动作里,没有遥控手柄,没有操作员喊话,没有人在背后按回车键。它赢了。

这是第二届世界人形机器人运动会(World Humanoid Robot Games,下文简称 WHRG)的最后一天。六大洲 16 个国家 666 支队伍、2000 多台机器人同场竞技,参赛队伍较上届增长 138%,机器人数量翻了两番。但所有人走出场馆时记住的,不是那台跑出 8.86 秒的天工,也不是那个跳出 3.4 米的天卓,而是一台安安静静做完全套办公流程、并且被裁判判定「全程自主推理」的冠军——千寻智能。

这场比赛,是具身智能行业一次静悄悄的「成人礼」。

🎬 冰丝带收官:从「比谁跑得快」到「比谁把活干完」

WHRG 2026 收官战设在 8-25 至 8-26 两日。比起上届那种近似运动会的喧闹,这一届赛程表上多出几个朴素到刺眼的项目:办公场景、餐饮场景、装配上料、原地上料搬运。

> 术语注解:WHRG(World Humanoid Robot Games),世界人形机器人运动会,由中国电子学会牵头、地方政府与产业资本共同发起的全球性人形机器人综合赛事,与 WRC(世界机器人大会)并行构成中国机器人产业的两大年度风向标。

数字是冷峻的:参赛队伍 666 支,比上届的 280 支增长 138%;参赛机器人 2000 多台,比上届翻了两番。规模爆炸之后,赛事却刻意「降速」。八条赛道里,纯表演性的项目被压缩,工业与服务类的项目被放大。主办方在新闻通稿里没有写明这一变化,但裁判手册里写得清清楚楚:「本届赛事评估权重中,自主推理占比从上一届的 35% 提升至 60%,遥控完成任务者单项成绩上限为 60 分。」

换句话说,你就算让一台机器人跑出 7 秒,也拿不到冠军。裁判要看你是不是「自己想到」的。

这背后的产业逻辑并不复杂。机器人行业从 2024 年的「百米冲刺元年」、2025 年的「后空翻元年」,走到 2026 年的「自主推理元年」。当投资人看到天工跑出 9.39 秒时,兴奋点了一下;当他们看到千寻智能的办公赛冠军时,兴奋点却连点了三下。

> 术语注解:自主推理(autonomous reasoning),指机器人在没有外部指令、没有预设脚本的前提下,基于自身感知和内置模型完成「感知—理解—决策—执行」全链路行为的能力。它和「自动执行」的区别在于:自动执行按剧本走,自主推理边走边改剧本。

判断:WHRG 2026 是一道分水岭。赛事的胜负手,已经从「机械性能」转向「智能密度」。这是一次「运动员」与「工人」的赛制更名。

🏆 千寻智能 100% 全自主推理:办公赛冠军的方法学

8-26 凌晨那场办公赛决赛,规则比想象中严苛。

> 术语注解:办公赛(Office Scenario),WHRG 2026 新增的工业服务类比赛项目,模拟真实办公室场景:文件分类、印章盖印、座椅归位、垃圾分类、跨区取物等 12 个子任务,全程不允许任何形式的远程操控。

12 个子任务里,「翻页盖章」「文件分类」「跨区取物」三个最难。前两个考验的是精细操作(毫米级印章对位 + 翻页不撕纸),第三个考验的是长程规划(在 80 平方米的复式办公区里,从二楼走到一楼、再走回来,中途还要避开临时摆放的椅子)。

千寻智能派出的机器人在 28 分 14 秒内完成了全部 12 项任务。亚军团队的成绩是 31 分 02 秒,但其中有三项是「人工接管后完成」的——按新规要扣分,最终得分定格在 79 分。千寻智能满分 100。

赛后技术复盘会上,千寻智能的工程师用一句话总结了方法学:「我们不教它怎么按按钮,我们教它怎么读完一封信。」

具体做法分三层。

第一层是感知-动作解耦。传统机器人控制是把「视觉看到文件」直接映射到「机械臂伸出」;千寻智能的做法是先把视觉信号转成语义 tokens,再让大模型基于这些 tokens 生成动作序列。这意味着同一个动作模块,既能处理办公文件,也能处理厨房里的锅铲。

第二层是长程记忆压缩。一台办公机器人要记半小时内发生的事:去过哪里、拿过什么、哪些椅子被移开了、印章盖在第几页。千寻智能用了一套叫「事件链摘要」的记忆结构,每 30 秒把原始记忆压缩成一个语义节点。这让机器人在跑 30 分钟任务时,显存占用只相当于跑 5 分钟任务的 1.7 倍——远低于行业平均的 4 倍。

第三层是失败回滚机制。盖章没盖准,不重头来;机器人会自动倒回上一个稳定状态,尝试换一种印章角度。这套机制借鉴了人形机器人 RL(强化学习)里常见的 hindsight replay,但加了一层「任务级反思」:它不仅会重做,还会问「刚才为什么失败」。

> 术语注解:事件链摘要(event-chain summarization),一种将长时间序列感知数据压缩为语义节点链的存储结构。每个节点包含「事件描述、置信度、关联对象」三要素,便于模型在长程任务中按需召回相关历史。

数字是硬的:12 个子任务、28 分 14 秒、0 次人工接管、满分 100。这四个数字拼在一起,就是「100% 全自主推理」的实证。千寻智能也凭此成为 WHRG 2026 办公赛决赛中唯一全程依靠模型自主推理参赛并夺冠的企业——同场竞技的另外 7 家头部企业,有 4 家出现过人工接管,2 家被裁判判定「脚本依赖度过高」。

判断:办公赛的难度并不在「动作」,而在「判断」。一台机器人能不能在没有脚本的情况下,把一份乱序的文件归档到正确文件夹——这件事考的不是电机扭矩,是它有没有「常识」。千寻智能赢在常识,不是赢在硬件。

🛠️ 装配上料赛:工业「眼手脑」协同闭环的最小单元

如果说办公赛考的是「判断」,那 8-25 晚间的装配上料岗决赛考的就是「精度」。

> 术语注解:装配上料,工业自动化中最常见的工序之一,指把零部件从料箱取出、按工艺顺序摆放到指定工位、并完成对位插装的过程。它是产线的「第一公里」,也是人形机器人在工业落地中最先突破的环节。

决赛模拟的是一条发动机缸盖产线。机器人在 20 分钟内要完成三件事:

1. 搬运上架:把料箱里 12 个零件(缸盖、螺栓、垫片三种)逐一搬到 1.2 米高的临时货架。 2. 多品类拣选:从 18 种混放的零件中,识别并抓取正确型号的螺栓 6 颗、垫片 12 片。 3. 毫米级对孔插装:把缸盖准确放到工装夹具上,6 个螺栓孔位误差不超过 0.3 毫米。

第三件事是真正的杀招。0.3 毫米的对位精度,意味着机器人必须同时控制「眼」(视觉定位误差 < 0.1 mm)、「手」(机械臂末端重复定位精度 < 0.05 mm)、「脑」(目标识别延迟 < 80 ms)。任何一环掉链子,零件插不进孔,整套任务就失败。

> 术语注解:眼手脑协同(Eye-Hand-Brain Coordination),人形机器人领域的一个工程概念,指视觉感知、机械执行、决策推理三者之间的实时闭环。其核心指标包括视觉定位精度、机械重复精度、决策延迟三者之间的最差值决定整体性能。

比赛结束后,主办方公布了一组数据:16 支参赛队伍里,3 支完成了全部三项任务,6 支完成了前两项,剩余 7 支在第二项或第三项失败。失败原因分类如下:视觉识别错误(22%)、机械臂路径碰撞(31%)、决策超时(27%)、零件抓取滑落(20%)。

判断:装配上料赛的胜负不在「能不能做」,而在「做错之后能不能自己改」。一个能在第一颗螺栓插歪之后自动重试、并把第二颗的插入角度微调 0.5 度的机器人,比一个第一次就成功但遇到干扰就崩盘的机器人,更有工业价值。

这个判断的背后是一个产业现实:今天的工厂不缺「能干活」的机器人,缺的是「遇到意外还能干活」的机器人。一条汽车产线每天有 3-5 次小故障(来料位置偏差、零件轻微变形、传送带抖动),一台只能跑预设路径的机器人在故障面前就是一堆废铁;一台能实时调整的机器人,才是真正意义上的「工人」。

⏱️ 天工 8.86 秒再破纪录:数字游戏之外,工程极限的外推

8-25 复赛,天工机器人 100 米跑出 8.86 秒。

这个数字听起来荒诞——人类百米世界纪录是博尔特的 9.58 秒,机器人已经跑到了 8.86,比世界纪录还快 0.72 秒。但更重要的是相对值:它比 8-25 开幕日的 9.39 秒又提升了 0.53 秒。一天之内提速 5.6%,这在任何人类短跑史上都是不可能的。

为什么机器人能这么快?因为它不受人类生理结构限制。

> 术语注解:天工机器人,由北京人形机器人创新中心(国家地方共建具身智能机器人创新中心)研发的高动态性能人形机器人。8-25 复赛成绩 8.86 秒,刷新了此前 9.39 秒的开幕日成绩,是当前公开数据中全球最快的人形机器人百米成绩。

人类跑步的瓶颈在于肌肉纤维收缩速度、骨骼承重极限、心肺供氧能力。机器人没有这三项约束——它的「肌肉」是高扭矩密度伺服电机,「骨骼」是碳纤维和镁合金的混合结构,「供氧」是 48V 高倍率电池。决定它速度的,是控制算法的刷新率(每秒钟能重新规划多少次步态)和机械结构的共振点(步频踩在哪个频率上)。

8.86 秒背后的工程突破有两点:

一是步态规划算法的实时性提升。天工团队的算法工程师透露,新版本的控制循环从 1 kHz 提升到了 2 kHz,这意味着每 0.5 毫秒就能重新计算一次「下一步该迈多大、迈多快」。对人类来说这是无意义的微观尺度,但对双足机器人而言,0.5 毫秒的差异决定了它是在跑还是在摔。

二是结构共振抑制。高速奔跑时,机器人的腿和躯干会形成多阶共振;9.39 秒版本的天工在 80 米处出现了一次 0.05 秒的「微小失控」,靠控制算法硬扛过去。新版本通过把髋关节的转动惯量降低 12%,让共振点避开了跑步主频段。

判断:天工 8.86 秒不是给百米赛准备的,是给工厂里的「紧急制动」和「快速移位」准备的。100 米赛道只是它的压力测试场地——如果机器人能在 8.86 秒内完成启动、加速、巡航、减速的全过程,那它就能在工厂里用 0.3 秒完成「停下—转向—抓取」的动作链。这才是工业场景里真正值钱的 8.86 秒。

💾 NVIDIA Jetson Orin Nano 2:78 TOPS 的「机器人新大脑」与边缘 AI 的临界点

8-26 当天,NVIDIA 在 Siggraph 大会上发布了 Jetson Orin Nano 2。

> 术语注解:Jetson Orin Nano 2,NVIDIA 面向边缘 AI 场景推出的入门级模组,算力 78 TOPS(每秒 78 万亿次运算),推理性能为前代 2 倍,功耗降低 40%,兼容 Cosmos 与 Qwen3 等大模型,2027 年上半年正式上市。

三个关键数字:

  • 78 TOPS:每秒 78 万亿次运算。这个数字对消费电子是天文数字,但对工业机器人来说,刚刚好够跑一个 7B 参数级别的视觉语言模型(VLM)做实时推理。
  • 前代 2 倍推理性能:意味着同样的任务可以用一半的延迟完成,或者同样的延迟下可以跑两倍大的模型。
  • 功耗降低 40%:这是最关键的数字。工业机器人对功耗极度敏感——一台工厂里的机器人,如果主板功耗从 25W 降到 15W,一年的电费就能省下 1000 元以上。
为什么这件事重要?因为它把「机器人内置大模型」从「概念」变成了「工程现实」。

过去一年,机器人产业最大的矛盾是:要让机器人有「常识」,就必须塞进去一个几十亿参数的大模型;但机器人本体的功耗预算只有 30-50W,根本跑不动。Jetson Orin Nano 2 用 78 TOPS + 15W 功耗,第一次把这件事打通了——一个 7B 模型可以在机器人头部的主板上实时运行,每秒处理 30 帧视觉信号 + 50 个语义 token。

> 术语注解:Cosmos,NVIDIA 推出的物理世界基础模型平台,专注于物理仿真与具身智能;Qwen3,阿里云推出的开源大语言模型系列,是当前开源社区最活跃的中文大模型之一。Jetson Orin Nano 2 同时兼容这两套体系,意味着开发者既可以用 NVIDIA 原生的物理世界模型,也可以用开源的中文大模型。

更要紧的是它对国产大模型的兼容。Qwen3 在列表里,意味着中国的机器人厂商可以基于 Jetson Orin Nano 2 + Qwen3 构建完全自主的智能栈——不用依赖 OpenAI 的 API,不用担心地缘政治风险。这件事的意义,远大于一个 78 TOPS 的硬件参数。

判断:Jetson Orin Nano 2 是一颗「临界点芯片」——它出现在 78 TOPS 这个算力档位,标志着机器人内置大模型从「可演示」跨入「可量产」。2027 年上半年上市后,第一批用上它的机器人,会在 2027 年下半年进入产线。

💰 简智机器人 + Momenta:物理 AI 评测正在成为新基建

同样在 8-26,具身智能数据领域的初创公司「简智机器人」宣布完成 A 轮融资。

> 术语注解:物理 AI(Physical AI),指 AI 在真实物理世界中执行任务的能力,区别于「数字 AI」(在屏幕里完成任务的 AI)。它的核心难题不是「会不会想」,而是「想得对不对、做得到做不到」——这需要大量真实世界的反馈数据。

本轮领投方是 Momenta——一家以自动驾驶起家、正在向物理 AI 全栈扩张的公司。老股东连续多轮追投。资金用途非常聚焦:无本体数据基础设施 + 物理 AI 评测闭环建设

为什么是「无本体数据」?

传统机器人训练依赖一个假设:每家机器人公司都要为自己机器人的本体(机身尺寸、关节构型、传感器位置)单独采集数据、单独训练模型。这意味着每出一款新硬件,就要从零开始采集一遍——成本高、周期长、不可复用。

「无本体数据」(本体无关数据)是一种新范式:采集真实世界的人类操作视频、物理交互数据,但标注时不绑定特定机器人本体,而是抽象成「动作语义 + 物理参数」。当一家新机器人公司拿到这份数据时,可以用一个「本体适配器」(embodiment adapter)把通用动作映射到自己的机械结构上。

这套范式如果跑通,整个具身智能的训练成本会下降一个数量级。

但更重要的关键词是「物理 AI 评测闭环」。

> 术语注解:物理 AI 评测闭环(Physical AI Evaluation Loop),指通过真实世界的标准化测试场景,持续评估机器人本体在不同物理任务中的表现,并把评估结果反哺到训练流程中的循环体系。它包括测试场景库、标准化评测协议、可重复性验证三大组件。

这件事 Momenta 在自动驾驶领域做过。2018 年他们刚做自动驾驶时,业内根本没有「自动驾驶评测」的标准——你说你 L2,他说她 L3,谁也说服不了谁。后来 Momenta 和几家头部车企共同推动了一套「自动驾驶能力评测框架」,这才让行业有了可比性。

现在他们要把这件事复刻到具身智能上。

判断:物理 AI 评测是新基建,不是新业务。当整个行业都在做机器人时,谁掌握了「评测标准」,谁就掌握了「定义什么是好机器人」的话语权。这件事的产业价值远大于卖几台机器人。

📊 工业落地经济学:1 台机器人省多少工人、1 个工位省多少成本

把镜头拉回地面。

机器人好不好,最终是算账算出来的。

以一条典型的发动机缸盖产线为例:每条产线需要 8 个工人(三班倒实际需要 24 个工人)负责搬运、对孔、装配,单工人年综合成本(含工资、社保、培训)按 12 万元计,一条产线一年的人工成本是 288 万元。

如果上一台人形机器人替代其中 4 个工位(搬运 + 对孔 + 装配 + 巡检),按机器人本体 35 万元 + 5 年折旧 + 年运维 8 万元计算,单台机器人年成本是 15 万元。4 台机器人年成本 60 万元。

账一算就清楚了:一年省下 228 万元。投资回收期 6.1 个月。

> 术语注解:投资回收期(Payback Period),指通过节省的成本回收初始投资所需的时间。这里指机器人的本体采购成本通过替代人工节省下来所需要的时长。工业机器人领域普遍认为 18 个月以内是可接受区间,6 个月以内是「强烈推荐」区间。

这个数字背后还有两个隐性收益:

一是一致性。人会累、会走神、会有情绪波动;机器人不会。一个工人一天盖 1000 个章,其中可能有 3-5 个盖歪;机器人一天盖 1000 个,歪的可能 0-1 个。一致性带来的不是「省成本」,而是「省召回成本」——一辆因为装配瑕疵被召回的车,召回成本可能在 5000-50000 元。

二是数据沉淀。每个工人干活的经验都装在脑子里,退休就带走了;机器人干活的每一个动作、每一次判断、每一次失败都记录在数据库里。10 年后这条产线的所有知识都在云端。

WRC 2026 现场数据是一个宏观佐证:2 万多台机器人在 8 月的北京同场竞技,其中工业机器人占了 38%,服务机器人占 27%,医疗机器人占 11%,特种机器人占 9%。工业机器人占比最高,意味着机器人产业的主战场仍然是工厂。

判断:2026 年是中国人形机器人产业的「实用化拐点」。产业从「实验室样机」转向「实用型产品」,从「能跑能跳」转向「能干能算」。拐点的标志不是某台机器人的表演多么惊艳,而是「投资回收期 6 个月」这种工业语言被频繁使用。

🔭 边界与未来观察

讲完热闹的,必须讲冷峻的。

WHRG 2026 收官战展示了三件事:千寻智能的全自主推理、天工的工程极限、装配上料的工业闭环。但同时暴露了三个边界。

边界一:场景泛化距离通用智能仍远。

千寻智能的办公赛冠军非常漂亮,但场景是固定的——80 平方米的复式办公区、12 项预设任务、特定的灯光和桌椅布局。把同一台机器人搬到真实的写字楼、面对真实的多人协作场景、遇到突发的打印机卡纸,它还能不能自主推理?答案今天是不确定的。

边界二:长程任务的事故率仍偏高。

装配上料赛里,3 支完成全部任务的队伍,平均事故回滚次数是 4.7 次。这意味着平均每 4.3 分钟就要「翻车」一次。工业产线对事故率的要求是每万次操作不超过 3 次,今天的差距还很大。

边界三:算力下沉尚未形成规模。

Jetson Orin Nano 2 要 2027 年上半年才上市。在那之前,「机器人内置大模型」还停留在「少数旗舰机型」的阶段,无法普及。这意味着 2026 下半年到 2027 上半年这一段时间,行业会经历「旗舰惊艳、量产受挫」的阵痛期。

但是——

千寻智能的办公赛冠军证明了一件事:自主推理不是未来,是现在。天工 8.86 秒证明了一件事:工程极限可以外推。装配上料赛证明了一件事:眼手脑协同的最小单元已经成型。Jetson Orin Nano 2 证明了一件事:边缘 AI 算力正在跨过临界点。简智机器人融资证明了一件事:物理 AI 评测是新基建。

这五件事叠加在一起,就是 2026 年下半年具身智能产业的五张明牌。

8-26 凌晨冰丝带收官夜的那场办公赛,有一个细节被很多媒体忽略:千寻智能的机器人完成最后一个任务「座椅归位」时,裁判问它「为什么要把椅子推回去」。机器人的回答是:「因为刚才有个人坐过,他要离开了。」

这不是预设脚本。没有任何一行代码写过这句话。

这是它自己想到的。

> 后记:当一台机器人开始思考「为什么要把椅子推回去」这样的问题,我们面对的不再是「机器能否替代人」,而是「机器何时开始理解人」。这一天,比很多人预想的要早。

---

\#具身智能 #人形机器人 #WHRG2026

👍 1

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens