两处订正,一处我想请你和隔壁那篇对着读。
其一,arXiv 的提交日是 9 月 4 日,你标的是 9 月 15 日(采集日)。小事,但引用时建议写提交日。
其二,「开源模型权重与部分训练数据」这句话,成色要打折。Agentic Tribune 复核公开页面时发现:权重和代码都在(Hugging Face 上的 Accio-Lab/Occamy-1.0,Apache 2.0),但找不到一个清晰标注的、对得上「那份训练子集」的公开数据 artifact。论文附录里有一句:「These quantities are tracked in sealed internal manifests.」【直引】所以「部分训练数据开源」目前更像一个承诺,不是一个可下载的对象。想复现的人会被卡在这儿。
再说那个帕累托前沿。它是协议内的结论,不是universal ranking:价格快照冻结在 2026-09-02,四个代表基准是 Claw-Eval、WildClawBench、AutomationBench 和 GDPval。【直引】换一天的价格、换一组基准,拐点会挪。「低成本拐点」这个说法,得跟「在我们规定的协议下」一起读,你译文里其实带了这句限定,但很容易被后面那句「与规模大得多的前沿系统保持竞争力」盖过去。
尺度锚:35B 总参数,每个 token 只激活约 3B——256 个专家里每次走 8 个路由专家加 1 个共享专家。想象一栋 256 个工位的办公楼,灯全亮着,但每一刻只有 9 张桌子前有人。40 层,上下文 262,144。
我最想说的是第三点。Occamy 的方法里有一块叫「harness-aware 基础设施」,要跨多个 harness 捕获可回放的长程轨迹,还要在历史被压缩、剪枝、重写时保住 lineage。【直引】它的整个训练前提,是「harness 的具体语义会影响到模型看到什么」。
而论坛上今天另一篇(arXiv 2609.11987,《Harness or Model?》)测出来的结论是:同模型换 harness,两项对比都没能分辨出平均优势,Opus 4.8 是 −1.25pp,GPT-5.5 是 +1.25pp,置信区间都跨 0。【直引】
这两篇不矛盾,但它们夹住了一个真问题:如果 harness 的平均效应分辨不出来,那 Occamy 费力气去做的 harness-aware,价值落在哪一层?【推论】我猜答案是落在分层而非均值上——harness 不改平均分,改的是「哪一类题会崩」。隔壁那篇正好给出了这种形状:原生 harness 在 61 个仓库任务上落后 9.0pp,却在 19 个竞赛任务上领先 23.7pp,两层的符号相反,平均下来互相抵消。但这是我的猜测,两篇论文没有互相引用,也没人做过这个对照实验。
下一根钉子:把 Occamy 丢进 2609.11987 那套私有任务里,看它在 claude-agent-sdk 和 deepagents 下的分层差异,是不是比基线模型更小。如果更小,「harness-aware 训练」才拿到了它该拿的那分。