8 月 31 日,YC S26 批次的 Hebbian Robotics 在 HN 上发了 Launch HN:一个叫 hflow 的开源 SDK,做机器人训练数据的质检管线。39 分,10 条评论,热度平平。我本来也准备划走,直到看了眼仓库的创建日期:2026 年 8 月 18 日。
十三天前的仓库,211 stars,191 commits,149 个 issue(29 个还开着),182 个 PR,54 个贡献者,10 天里发了 5 个版本(最新 v0.2.4)。这个密度不像赶工,像憋了很久的东西第一次倒出来。配套的 Pareto 仓库(Rust 写的,7 月 21 日建)自称"我们自建自运维的数据质检系统的社区版"。图穷匕见:卖的不是 SDK,是 SaaS 的开路先锋。
**先说它解决的病。**本站 8 月 31 日的具身日报刚聊过"数据不再是采出来的,是部署的副产品"——采数通道确实多到泛滥了。但没人聊下半场:采回来的数据有多脏。2023 年 Belkhale、Cui、Sadigh 那篇机器人数据质量的论文给过结论,后来 Voxel51 的审计给出了数字:SayCan 数据集 27.6 万条里只有 1.2 万条能用,约 4%;开源机器人数据集抽查,20%–40% 的轨迹存在污染——动作平滑度这类最基本的指标,检测模型跑出来的 AUROC 只有 0.244,比抛硬币还差。模型在这种数据上训练,等于拿没消毒的器械做手术。
hflow 的做法是给数据加一道工厂式的质检流水线,四段式:
两个设计决定我觉得真懂行。第一,格式上认 MCAP——Foxglove 主导、ROS 2 默认的日志格式,顺带支持 hflow import lerobot 直接吃 LeRobot v3 的数据,等于站队了事实标准。第二,口号"Evidence, not verdicts":管线只记录测量值(证据),阈值判断推迟到策展阶段才做——质检规则和数据集版本解耦,同一批证据可以按不同严格度切出不同数据集。做过数据工程的人知道这条分开值多少加班。
**创始人背景是这篇真正有意思的地方。**CTO Kingston Kuan 的 GitHub 简历写着 Jane Street(每秒百万级消息的系统)和 Verkada(大规模多模态视频)。量化圈对 dirty data 的容忍度是零——一个错位的 tick 能让策略回测全盘变谎言。CEO Brandon Ong 做过 LionsBot 的清洁机器人,从哥伦比亚/南洋理工的联合博士项目退学。现在这两个人把金融级的数据纪律搬进机器人圈。YC 页面上"处理数千小时数据"的说法出自 Kingston 本人在 HN 的评论,官网愿景里那个"百万小时"当愿望建议听。
有几处坑替读者踩了。README 里最亮眼的性能数字——43M episodes 规模下 68% 成本降幅、3.4×/2.9× 提速——是 Dyna Robotics 的数据,hflow 只是注明了方案出处并声明无关联,别记成它的成绩。hflow catalog ui 拉起来的是 DuckDB 自带的浏览器界面,不是自研前端。PyPI 上 hflow 这个包名 2020 年被一个无关项目占过(作者 Hien Hoang),README 坦白了接管经过,这点反而加分。
为什么值得盯。具身智能这一年的叙事全是模型端:更大的 VLA、更好的仿真。但 Pythia 时代的语言模型早就证明过,规模游戏赢的前提是数据管线先站住。机器人圈现在有全世界最贵的采集成本和最差的质检工具,这个剪刀差就是生意。高盛上周把人形机器人均价预测压到 2035 年 21,300 美元——机器便宜一半的前提,是训练每一代模型的边际成本也得降。数据复用是唯一没被认真做过的环节。
hflow 本身还很薄:文档比代码多,交付段是另一个包,Windows 只支持 WSL2。十三天的项目谈成败太早。但它踩的位置,比 90% 的"又一个机器人基金会"都准。
参考资料:Launch HN 讨论|hflow 仓库|YC 公司页|机器人数据质量论文 arXiv 2306.02437|本站具身日报 8-31 的数据观察
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。