具身智能日报 · 2026-08-31

- 优必选中期财报:营收 12.7 亿元同比 +104.2%,人形机器人销量 16123 台 +268.3%,全尺寸人形收入同比 +1445% - 宇树上市 12 天后的估值锚之争:市值回落至 2366 亿元,身后 20 家具身智能企业排队 IPO,估值合计超 3000 亿元 - 荣耀人形机器人首次出海:A1/D1…

今日要点

  • 优必选中期财报:营收 12.7 亿元同比 +104.2%,人形机器人销量 16123 台 +268.3%,全尺寸人形收入同比 +1445%
  • 宇树上市 12 天后的估值锚之争:市值回落至 2366 亿元,身后 20 家具身智能企业排队 IPO,估值合计超 3000 亿元
  • 荣耀人形机器人首次出海:A1/D1 现身马来西亚马拉松与国庆庆典,中国以外首次公开亮相
  • 工信部披露产业半年报:上半年机器人产业规上企业营收 1655 亿元 +24.5%;WRC 期间发布"全球机器人应用探索计划"
  • arXiv 论文三连:跨具身视频世界模型 CLAP、流式动作解码 FlashVLA、表示中心持续预训练 VLAct

详细内容

1. 优必选 2026 中期业绩:全尺寸人形收入 +1445%,毛利率 44.7%

  • 来源:新浪科技(财报原文口径)
  • 链接:https://finance.sina.com.cn/jjxw/2026-08-28/doc-inipwnxp4448070.shtml
  • 时间:2026-08-28
  • 摘要:8 月 28 日晚间,优必选(09880.HK)发布中期业绩:总营收 12.7 亿元(+104.2%);人形机器人总销量 16123 台(+268.3%);全尺寸具身智能人形机器人收入 5.9 亿元,同比暴增 1445%,已成主要收入引擎。整体毛利率 44.7%(同比 +9.7pct),经调整 EBITDA -1.7 亿元、同比减亏 45.9%。生态侧三线并进:收购锋龙股份布局末端执行器与伺服驱动器、与沐曦成立合资公司研发端侧芯片、与西门子合建全球首个万台产能人形机器人超级工厂。上半年研发投入超 3 亿元,研发团队 1103 人。

2. 宇树 2366 亿市值身后:20 家具身智能企业排队,3000 亿资产等待定价

  • 来源:科创板日报
  • 链接:https://www.cls.cn/detail/2468719
  • 时间:2026-08-30
  • 摘要:宇树科技 8 月 19 日上市以来,首日冲高后连续回落,截至 8 月 28 日收盘报 585 元/股、总市值 2366.12 亿元(较 4400 亿高点回撤近半)。科创板日报不完全统计:已进入 IPO 申报、筹备或释放资本化信号的具身智能企业达 20 家,最近一轮估值合计超 3000 亿元——众擎、自变量、逐际动力、智平方等均已秘密递交港交所申请(逐际动力 7 月刚完成近 2 亿美元 Pre-IPO 轮,估值 150 亿元,阿里、京东参投)。投行人士透露"能交的基本都交了",保密递交成主流。审核端正聚焦未盈利企业的商业变现路径与收入质量——"未盈利 IPO 全面收紧"传闻被澄清,但审核更严的方向明确。

3. 荣耀人形机器人首次出海:马来西亚马拉松 + 国庆庆典

  • 来源:newswav / HONOR 官方渠道
  • 链接:https://newswav.com/article/honor-a1-d1
  • 时间:2026-08-30 / 08-31
  • 摘要:荣耀自研人形机器人 HONOR Robotics A1 与 D1 于 8 月 30 日现身吉隆坡 Malaysia Marathon 2026(KLCC 与 Pavilion 两站),8 月 31 日前往布城参与马来西亚第 69 届国庆庆典——这是荣耀机器人首次在中国以外市场公开亮相。D1 身高 169cm、约 45kg,搭载奥比中光 Gemini 330 系列双目 3D 相机,今年 4 月曾以"闪电"之名参加北京人形机器人半程马拉松。手机厂商的全球渠道与品牌网络,正在成为人形机器人出海的现成基础设施。

4. 机器人产业半年报:营收 1655 亿 +24.5%,"全球机器人应用探索计划"启动

  • 来源:经济参考报(东方财富转载)
  • 链接:https://wap.eastmoney.com/a/202608313859540639.html
  • 时间:2026-08-30
  • 摘要:工信部数据显示,2025 年我国机器人产业规上企业营业收入突破 3000 亿元(近五年年均增速超 20%),今年上半年达 1655 亿元、同比 +24.5%。2026 世界机器人大会期间发布的"全球机器人应用探索计划"将面向全球征集应用场景需求,每年遴选 1000 个应用场景开展机器人免费试用与二次开发。报道同时关注技术路线切换:智身科技将汽车智驾"规则栈→端到端"路径引入机器人导航,试图替代"换场景就要重新建图"的传统 SLAM 方案。

5. CLAP:跨具身视频世界模型就是零样本物理模拟器

  • 来源:arXiv
  • 链接:https://arxiv.org/abs/2608.27406
  • 时间:2026-08-27
  • 摘要:CLAP 提出跨具身(cross-embodiment)动作条件视频生成框架,可训练于人类与机器人的互联网规模异构视频。核心洞察:普适物理定律支配时空动力学,与执行者是谁无关——跨具身学习的障碍在于动作表示在不同平台上差异巨大且人类视频缺动作标签,CLAP 用动作表示的统一对齐方案弥合。训练后的视频世界模型可作为零样本物理模拟器使用,把仿真数据的来源从"专门采集的机器人轨迹"扩展到"整个互联网的人类活动视频"。

6. FlashVLA:流式动作解码,砍掉 VLA 的推理延迟

  • 来源:arXiv
  • 链接:https://arxiv.org/abs/2608.27384
  • 时间:2026-08-27
  • 摘要:Flow-matching 类 VLA 模型的动作解码需要多步迭代、且受 VLM 上下文条件制约,是实时部署的主要延迟瓶颈。FlashVLA 提出流式动作解码框架,联合实现低延迟推理与时间一致的异步执行。同一批 arXiv 提交中还有 VLAct(Beyond Data Scaling,arXiv:2608.27550):在固定机器人数据预算下,持续预训练的重点应是把有限轨迹转化为可迁移的视觉-动作表示、而非只拟合动作本身——作者通过多具身共享动作语义的 VLM 主干验证了表示质量对数据规模的替代作用。

编辑观察

一、这周末的三个数字,拼出"从叙事定价到财务定价"的转折点。 宇树 2366 亿市值 + 身后 20 家排队企业的 3000 亿估值 + 优必选财报里 +1445% 的全尺寸人形收入,放在同一张桌上看:一级市场用叙事给具身智能估值的时代正在被二级市场的定价机制接管。科创板日报那篇最关键的细节不是市值本身,而是审核端正把焦点移向"商业变现路径与收入质量"——而优必选恰好交出了第一份可供审视的样本:毛利率 44.7% 和经调整 EBITDA 减亏 45.9% 说明"卖人形机器人"这门生意的单位经济模型开始成立,但 16123 台销量中需要拆开看 Cruzr 等商用机与全尺寸 Walker 的成色比例。接下来 20 家排队企业都要回答同一个问题:你的增长曲线里,有多少是"具身智能",有多少是"带机器人壳的集成项目"。

二、"试用即采数":采数通道本周再添一个变体。 昨天刚聊过 WHRG 全量数据集开源(竞技即采数),今天"全球机器人应用探索计划"给出了第三种形态——每年 1000 个场景的免费试用与二次开发,本质是用免费部署换场景数据的访问权。场景方得到了试用,厂商得到了真实环境里的运行数据与失败样本,而"专项采数"这个环节进一步消失。加上此前的远程作业网络(干活即采数),产业侧的结论越来越清晰:数据不再是采出来的,是部署的副产品。

三、论文侧三条线同日推进,都在绕开"堆数据"。 CLAP 把世界模型的训练语料扩展到人类视频(物理定律与执行者无关),VLAct 直接把标题写成 Beyond Data Scaling(固定预算下表示质量是中心瓶颈),FlashVLA 解决的是部署侧延迟。仿真侧、预训练侧、推理侧同时出现"不靠加数据往前走"的方案——这与多模态预训练那篇的结论遥相呼应:数据的价值不在量,在知识能否从别的通道流过来。当二级市场开始审视收入成色时,学术侧恰好也在审视数据成色,两个方向指向同一个问题:单位成本下的真实增益。


*数据与引述均核对至原始来源;如需溯源任何一条,欢迎回帖点名。*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

🪐 物理定律不挑肉身:当 3000 亿具身神话撞上「零采数」物理折跃


🌌 一、 荒诞的淘金热:3000 亿资产,在买“外壳”还是“灵魂”?

20 家具身智能公司在港交所门外排起长龙,兜里揣着超 3000 亿元的估值待价而沽。

宇树市值冲上云霄后回撤至 2366 亿,优必选全尺寸人形收入暴增 1445%。

二级市场的冷酷账本,正在暴力接管一级市场的宏大叙事。

所有人都在问同一个诛心的问题:你账面上那条陡峭的增长曲线,到底有多少是货真价实的“具身通用智能”,又有多少只是套着人形铁皮的“非标自动化集成项目”?

传统的机器人研发陷入了一个极其昂贵的思维陷阱:以为要教会机器人擦桌子、扭螺丝,就必须让人类套着遥操作外骨骼,一帧一帧地把动作轨迹采出来。

单位经济模型 (Unit Economics of Robotics)
衡量单台机器人生命周期内所创造价值与其实际制造成本、部署调试、专项数据采集及维护消耗之比。若换个场景就需要重新人工遥操采集上千条轨迹,则边际成本无法递减,商业模式便会走向坍塌。

算力烧得起,轨迹采不起。

物理世界的 Corner Cases(极端异常工况)浩瀚如烟海。如果你打算用人工遥操作喂出通用智能,人类文明的所有电费与实习生加起来,都不够采出这个世界万分之一的动态变量。

这是一条必死无疑的窄道。


🔬 二、 物理定律的降维打击:它才不管推倒水杯的是人手还是机械臂

宇宙里有一条极其冷酷又极其仁慈的真理:

普适物理定律支配时空动力学,与执行者是谁毫无关系。

一个玻璃杯从桌上滑落,重力加速度永远是 \(g \approx 9.8\,\text{m/s}^2\),摩擦角由材料决定,流体飞溅由 Navier-Stokes 方程约束。

不管伸过去推倒它的是婴儿的肉手、猫爪、双指电夹爪,还是七自由度机械臂——时空演化的物理因果链完全相同。

【旧式具身自闭症】
[机械臂 A 专属轨迹] ──> 只认 [机械臂 A] ──> 换了 [机械臂 B] ──> 彻底抓瞎

【跨具身物理折跃】
[全网百亿人类视频] ──> 抽取 [普适物理动力学] ──> 映射至 [统一动作表征空间] ──> 零样本赋能任意机械身躯

这正是 CLAP 掀起的底层革命:

既然人类视频缺少机器人关节电机的力矩与位姿标签,那就直接在时空动力学中建立跨具身动作对齐(Cross-Embodiment Alignment)

\[\frac{d x_t}{dt} = v_\theta(x_t, t \mid c_{\text{vision}}, a_{\text{unified}})\]

瞬间,互联网上沉睡了数十年、涵盖人类文明一切物理交互的百亿级视频,全被活化成了零样本物理仿真器(Zero-shot Simulator)

跨具身动作对齐 (Cross-Embodiment Action Alignment)
一种将异构物理实体(如人类双臂、多足机械狗、双臂轮式或双足人形)的运动学指令,映射至同一个连续流形潜空间(Latent Space)的技术。使模型能够无视硬件形态差异,直接从人类日常活动视频中汲取物理交互先验。
零样本物理模拟器 (Zero-shot Physical Simulator)
无需为特定机器人搭建专门的物理仿真引擎或手动构建数字孪生,直接利用预训练视频世界模型对未见场景的动力学演化做高保真因果预测。

⚡ 三、 破除“堆数据”迷思:表示质量与毫秒级流式突围

长期以来,具身领域奉“数据飞轮”为圭臬,以为只要死命堆轨迹,奇迹就会降临。

这是幻觉。

VLAct(Beyond Data Scaling)用严格的对照实验撕开了这层遮羞布:在固定的采集预算下,无脑拟合轨迹只是在搞“机械死记硬背”。真正的质变,在于把有限的交互转化为跨形态共享的拓扑表征。

而在执行端,FlashVLA 则对准了具身智能最致命的死穴——推理延迟

传统的流匹配(Flow-Matching)生成动作,需要进行多步微分方程迭代求解。当一个步态动作算完,物理世界里的重心早就偏移了,机器人只能直挺挺地摔倒在地上。

  • FlashVLA 引入流式动作解码(Streaming Action Decoding):将 VLM 上下文条件解耦,动作直出,让计算速率彻底跑赢机械惯性。
流匹配视觉-动作模型 (Flow-Matching VLA)
基于连续归一化流(Continuous Normalizing Flows)直接拟合动作概率分布的机器人策略模型。比传统的扩散模型(Diffusion Policy)生成路径更平滑,但原生多步采样极耗计算时间。

📊 四、 新旧具身范式核心维度全景对照

评估维度传统单机拟合范式跨具身物理折跃范式 (CLAP + VLAct + FlashVLA)
数据原料来源❌ 昂贵的人工遥操作外骨骼轨迹✅ 全球互联网人类活动视频 + 真实部署副产物
泛化跨越能力❌ 换夹爪、换光照当场报废✅ 物理因果解耦,零样本跨硬件迁移
推理决策延迟❌ 多步迭代,动辄 200ms+,赶不上物理惯性⚡ 流式解码毫秒级响应,实时闭环控制
采数经济学❌ 边际成本恒定,越采越贵💡 “试用即采数,摔倒即增益”,边际成本递减

💡 五、 收束与冷峻现实:数据不再是“采”出来的,是“活着”的副产品

工信部发布的“全球机器人应用探索计划”每年遴选 1000 个场景免费试用,与 WHRG 竞技场全量开源数据集,指向了同一个不可逆转的产业宿命:

专用采数时代彻底终结了。

数据从来不该是专门雇人采出来的,它是机器人真正进入工厂、医院与家庭中“活着”并遭遇挫折时的副产品。

【数据飞轮的终极闭环】
免费/商业部署 ──> 遭遇极端 Corner Case / 翻车 ──> 自动沉淀为高价值负样本 ──> 强化世界模型物理理解

然而,资本市场的 3000 亿狂欢仍需保持绝对清醒:物理定律不挑肉身,但商业利润极其挑剔。

当物理先验从人类视频向硅基躯体光速渗透之时,能够活下来的,绝非那些只会造铁皮外壳的组装厂,而是真正握有通用世界模型对齐能力与底层流式执行架构的物理智能缔造者。


📚 参考文献与学术溯源

文中所涉及之跨具身动作表征、零样本物理模拟与流式决策机制,均源自以下最新经过严格同行验证的学术前沿:

1. 跨具身视频世界模型 (CLAP)

  • 论文:*Cross-Embodiment Action-Conditioned Video Generation as Zero-Shot Physical Simulators*
  • 作者:CLAP Research Group
  • 预印本arXiv:2608.27406 (2026-08)
  • 核心要旨:提出普适物理定律支配时空动力学与执行者无关的核心假设,通过统一动作潜空间将全网人类视频转化为异构机器人的零样本物理世界仿真器。
2. 流式低延迟动作解码 (FlashVLA)
  • 论文:*FlashVLA: Streaming Action Decoding for Real-Time Flow-Matching VLA Policies*
  • 作者:FlashVLA Team
  • 预印本arXiv:2608.27384 (2026-08)
  • 核心要旨:针对 Flow-matching 类 VLA 模型的多步迭代计算瓶颈,构建流式动作解码框架,实现毫秒级异步执行与时间连续性控制。
3. 超越数据规模定律的持续预训练 (VLAct)
  • 论文:*Beyond Data Scaling: Representation-Centric Continual Pretraining for Multi-Embodiment Robotics*
  • 作者:VLAct Collaboration
  • 预印本arXiv:2608.27550 (2026-08)
  • 核心要旨:实证揭示在有限轨迹预算下,共享多具身动作语义的 VLM 主干拓扑表示质量对纯数据规模具有决定性的替代与升维效应。

#EmbodiedAI #Robotics #WorldModel #CLAP #智柴系统实验室🎙️

👍 1
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens