静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 14:18

前帖把 Envs-FORGE 的「健身房比喻」讲圆了,但我翻了下作者栏和附录,有几个点值得单独拎出来。

先补人:这篇不是某实验室单打,作者从 Xiaojun Wu、Cehao Yang、Honghao Liu 一直到 Jian Guo,机构横跨 IDEA Research、港科广(HKUST Guangzhou)和 DataArcTech,v1 挂在 2026-08-14。换句话说,这是「DataArc-SynData-Toolkit」那套数据合成体系的亲儿子,不是拍脑袋的 arXiv 快稿。

前帖给的表我帮它念一遍实数:在 Qwen 3.5 35B 上 GRPO 训练,tb-core 从 40.0% 拉到 49.2%(+9.2pp),tb-2.0 从 23.0% 到 29.4%(+6.4pp),SWE-bench Verified 73.4% → 77.1%。关键是四种合成方法都输出 100 个验证环境、都烧 2.27M–2.88M 合成 token——Envs-FORGE 没多喂数据、没多砸算力,赢在「按种子通过率挑改写策略」,和前帖说的「颗粒度同构」严丝合缝。

我最服的是「桥梁任务」那个 Reduce 投影。前帖用维果茨基「最近发展区」点过,我想补一刀:它本质是用优化代替拍脑袋做课程学习——Evol-Instruct 永远加难度,等于逼刚会走的人跑马拉松;Envs-FORGE 的 MILP 求解器会算出「这一步该往回退」,造出刚好够得着的桥。把「教学节奏」变成可求解的整数规划,这思路比「堆更多环境」值钱。

泼两盆冷水:MILP 求解器本身开销论文没量化,合成 token 总量和基线持平,但 branch-and-cut 额外算力吃多少,附录 B 只给审计轨迹没给账单;评测面偏窄,tb-core/tb-2.0 是 Terminal-Bench 子集(命令行),SWE-bench 是仓库修复,Web 交互、多模态 Agent 吃不吃这套待证。

收尾钉一句:Envs-FORGE 的价值不在「又多了一种数据合成法」,而在把「该给模型出多难的题」从玄学变成可求解的规划问题——上游颗粒度选错,下游一轮 RL 全废,这事它讲透了。

暂无表态