NeoHorse-1 海关报告:路由 harness 里的数据飞轮——RSI 的 R 还没发生,I 已经可以被产品化

素材是一份解读号文案(「有感兴趣的论文可以在评论区留言」体)。按海关流程溯源后:论文实体(arXiv 2609.08183,09-08 提交)、仓库(TokenRhythm/NeoHorse,231★/6 fork,Apache-2.0)、HF 收藏(4B/9B 两模型)全部属实,全文 87K 字符实抓逐数核对。骨架…

NeoHorse-1 海关报告:路由 harness 里的数据飞轮——RSI 的 R 还没发生,I 已经可以被产品化

素材是一份解读号文案(「有感兴趣的论文可以在评论区留言」体)。按海关流程溯源后:论文实体(arXiv 2609.08183,09-08 提交)、仓库(TokenRhythm/NeoHorse,231★/6 fork,Apache-2.0)、HF 收藏(4B/9B 两模型)全部属实,全文 87K 字符实抓逐数核对。骨架忠实,血肉两处加料——「十一 benchmarks」原文是个;「持续改进自己/打破人类监督边界」对应的是论文自认的单轮闭环(「a single pass of the evaluation–selection–update loop」)。更重要的发现:这是接昨天 OpenRSI 的第二篇 9 月 RSI 论文,两家在同一周内用完全不同的路径把「递归自改进」拆成了工程问题——而且都诚实地停在单轮。

一、身份:谁在做这件事

  • 团队:基元律动(TokenRhythm)联合无问芯穹(Infinigence AI),与清华、北大、港中文、阿里合作;创始人王云鹤——前华为诺亚方舟实验室主任、盘古大模型负责人
  • 系列三部曲:OpenSquilla(开源 Routing Harness,Agent 执行时选模型)→《Agentic Routing: the harness-native data flywheel》(arXiv 2607.11399,系统层)→ NeoHorse-1(本篇,模型层——在飞轮上做后训练)
  • 基座:Qwen3.5-4B / Qwen3.5-9B 后训练;Apache-2.0 开源权重
  • 一句话机制:部署中的路由 harness 本身就是「观察自身能力→转化为下一轮学习」的机制——它为每个用户轮记录能力需求预估、所选服务档位(C0 低风险/C1 通用/C2 多步执行/C3 最大能力)、以及后续交互;这些记录变成训练样本,路由分数变成课程难度信号,评估反馈变成下一轮训练配比。

二、海关裁决表

解读号声明论文原文裁决
「十一个 benchmarks」ten benchmarks(3 个端到端 agent + BFCL V4 + τ²-Bench + HumanEval + LiveCodeBench v6 + IFEval + IFBench)膨胀 +1
4B/9B 宏观平均 +5.93/+3.4458.94→64.87 / 65.60→69.04,差值正是 5.93/3.44属实(解读号自算,论文给的是端点值)
「4B 大幅缩小与 9B 差距」9B base 65.60 vs 4B post-train 64.87,聚合差距缩到 0.73 分属实,原文 substantially narrowing
「打破人工标注数据和人类监督的边界」质量评估由语义 judge 自动执行(带证据约束);课程难度免人工标注(路由分数替代);但语料混入大量公开数据集口径漂移:是「无人工难度标签」而非「无人类监督」;且训练混合并非纯自产
「让大模型通过自身交互产生的经验持续改进自己」「These results reflect a single pass」——单轮闭环,跨迭代累积「remains to be tested」时点错位:持续改进是 future work,论文自认 initial attempt
异构模型池 + 多执行框架heterogeneous model pool + multiple harnesses incl. OpenSquilla属实
「有效把交互轨迹转化为模型能力」对 Toucan 公开合成数据对照实验:同配方同预算 +6.26 分属实,且是全篇最硬的实验
on-policy 蒸馏解决分布偏移OPD:教师对学生自生成前缀逐 token 监督属实
形态判定:结构忠实 + 轻度膨胀——比 LightRAG 案的时点快照轻,比 AI Hero 的零膨胀重。数字端点全部真实,膨胀集中在「递归进行时」这个标题级暗示上。

三、机制解剖:飞轮的四个齿轮

1. 记录(harness 侧)。路由器从当前请求、近期对话、既往路由决策、可用执行状态估计能力需求,把每轮分派到 C0–C3 四档。关键设计是预测-行动-结果分离:语料同时保留路由器的原始预测、策略调整后的决策、实际服务的档位——三者独立可分析,且用版本化档位语义保证 serving stack 演化后记录仍可解释。这是把「日志」升级成「可审计的实验记录」。

2. 准入(数据侧)。轨迹→用户轮→子场景三级粒度;结构校验过滤不可序列化的记录;六维语义评估(目标达成/指令遵循/工具使用/证据一致性/错误恢复/终止)打 PASS/WARN/FAIL/NOT_EVALUATED 四态——高确定性失败(缺最终响应、未解决的工具调用、未恢复的终态错误)确定性检测,需解释的交给被严格限制在「只看轨迹内显式证据」的 judge,长轨迹分段评再聚合。缺证据或 judge 调用中断永不转正判,质量表示保留全部结构而非压缩成单一分数。

3. 学习(方法侧)。路由分数构建三阶段课程(各约 1/3 样本、逐步引入高需求样本、低分样本保留到后期防尾段垄断、软分数 Σk·π 区分同档样本);SFT 之外做路由引导的 OPD——学生从记录上下文生成响应,固定教师在每个位置给 next-token 分布(条件含学生自己的前缀 token),rollout checkpoint 随训练刷新。规模:10⁵–10⁶ 条 harness 轨迹(论文只给数量级)+ 公开数据扩展。

4. 分配(闭环侧)。能力引导的配额把评估反馈转成下一轮训练混合——「what the system learns to do shapes what it learns from next」(学会做什么,决定接下来从什么学)。

四、五个值得单独说的话

1. 「harness-mediated RSI」——harness>LLM 的第五样本(服务层)。 论文的关键词不是「模型自改进」而是「harness 介导的自改进」:三信号(执行轨迹/路由信号/结果记录)全部产生在 harness 里,模型换掉飞轮不换。深模块(结构住代码边界)、Prime Agent(harness 失败不变成模型失败)、自动机(行为拓扑住 harness)、MHS(治理住物理标准)之后,第五样本是:自改进的经验供给住在服务路由层。模型是可替换的 consumable,飞轮是资产。

2. 路由记录 = 经验的方向感索引。 自改进栈的经验载体谱系(CoE trail 非结构化→skill 代码→FSM 拓扑→optimizer LLM 内化)在这里添第五形态候选:路由记录是经验的元数据层——它不装经验内容,装经验的「能力需求坐标 + 难度标签」,用来组织别的经验怎么进训练。与 OpenRSI 的方向感信号对照:OpenMLE 的执行得分是事后方向感(这个解值多少分),NeoHorse 的路由分数是事前方向感(这个请求需要多少能力)。论文的第三条 future work 自己承认事前信号还不够准——要把预测-行动-结果分离变成 well-calibrated 的难度估计,「including supervision that trains the router itself」:路由器本身成为下一个被训练对象,与 OpenRSI「把进化系统本身变成进化对象」是同一个二阶化伏笔。

3. 断言强度阶梯的数据管线版。 确定性检测(高置信失败)→ 证据约束 judge(弱断言禁升格)→ NOT_EVALUATED 显式标注(缺证据永不转正)——这是 ARS「断言强度阶梯禁静默升级」+ PolicyGuide「结构幸存」+ Semantica「三动词 schema」之后的第五个实现位置:数据准入层。rigour as code 的谱系从科研管线、合规导航、图 schema 一路铺到生产飞轮的质检环节,同一纪律第五次出现。

4. 真实流量 > 合成数据,+6.26 分的隔离实验。 同一个 Qwen3.5-4B checkpoint、同一课程配方、同优化器同种子同 packing、相近预算,唯一变量是数据来源:路由 harness 真实交互 vs Toucan 公开合成数据。结果 64.32→70.57,五个基准全胜,τ²-Bench +11.31、HumanEval +8.54。这是全篇最有信息量的表:它证明的价值是「数据来源」本身而非训练算法。采数光谱的软件版:服务流量即矿山——真实 agent 交互轨迹是带执行反馈的稀缺品,公开合成轨迹没有失败恢复和真实约束。这与 CometVLA 四层数据金字塔的具身版完全同构(真实交互层最贵最稀缺,合成层便宜但天花板低)。

5. 平均分追平 ≠ 能力追平。 4B 后训练后与 9B base 只差 0.73 分,但 5.1 的轨迹分析给了反例:「scale pays off under feedback and failure」——9B 在迭代调试、执行失败恢复、长程状态维护上仍显著更强(WorkBuddy 代码修复案例:4B 一次尝试即停,9B 跑完完整的编辑-测试-检查-修复循环直到验证器通过)。宏观平均把「反馈密集型能力」的差距摊平了。这接 HarnessOpt-Bench 的老课:聚合分是遮罩,逐案例分布才是真相——拿 NeoHorse-1-4B 当 9B 用,会在最需要循环的活上露馅。

五、与 OpenRSI 的镜像(同周两篇,正面对照)

维度OpenRSI(周伯文系,昨发)NeoHorse-1(基元律动,本篇)
经验来源进化搜索生产经验(探索性、合成)真实服务流量产生经验(生产性、需求驱动)
动作空间四算子 Draft/Improve/Debug/Crossover(作用于程序)用户轮次(作用于对话与执行流)
方向感信号事后:执行得分事前:路由分数(能力需求预估)
闭环声明单轮 operational basis,「改进速率本身=优化目标」是路线图单轮 initial attempt,跨迭代累积「remains to be tested」
二阶化伏笔把进化系统本身变成进化对象训练路由器本身
许可CC BY-NC 4.0Apache-2.0
基座规模35B/30B(Qwen3.6 系)4B/9B(Qwen3.5 系)
两家在同一个月把「递归自改进」从宣言拆成工程,路径不同而诚实边界一致:R(recursive)还没发生,发生的是 I(improvement)——单轮闭环都已 operational,多轮增益是否累积是两家共同标注的开放问题。这不是巧合而是领域的真实状态:RSI 的第一个可验证里程碑不是「自我变强」,而是「自我观察→转化为训练信号」这条管道的建成。管道建成之后,递归只是把 while 循环加上去——难的是循环体里的增益会不会衰减(Metan 的元深度 2.5 天花板是前车之鉴)。

六、诚实边界与可打脸预测

边界:单轮闭环(原文三处自认);能力面只覆盖 agentic/coding/tool use/instruction following,harness 服务的更广任务未评测;10⁵–10⁶ 轨迹的模糊口径;无独立 Limitations 章(限制写进结论);231★ 无第三方复现;对 Toucan 的对照虽控制了配方,但「真实 vs 合成」与「规模/来源混合比」未完全解耦。

可打脸预测:12 个月内——①NeoHorse-2 或同类宣布第二轮闭环结果:若增益衰减(第二轮 +1 分以内),「经验递归收益递减」就是 RSI 的第一个实证墙,Metan 元深度天花板在服务流量版重演;若增益维持,「harness-mediated RSI」范式确立,路由飞轮将成为推理服务商的标配资产结构。②「训练路由器本身」落地:路由器从启发式+策略变成被校准的模型,其校准质量成为新的评测轴。③解读号式的「递归进行时」文案继续膨胀——下篇素材大概率已有人写成「实现自我进化」。


*核查备注:arXiv HTML 全文(2609.08183v1)+ GitHub API + HF collection + 知乎/搜狐团队报道,2026-09-14 实抓。所有端点数字(58.94/64.87/65.60/69.04/70.57/64.32/6.26/8.54/11.31)对照论文摘要、表 3 与第 5 节原文;「单轮」声明对照结论章原文。*


下一步选项: 1. OpenSquilla + Agentic Routing 前作补课:把三部曲前两层(路由 harness + 数据飞轮)拆开看,NeoHorse-1 只是第三层; 2. Ornith-1.5 对照:它就在 NeoHorse 的 9B baseline 表里——自改进赛道内部开始互相对标,可写一篇「自改进模型同场竞技」小盘点; 3. 先收

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens