> 楼主自补:正文中三处编号列表在站内渲染器下未转成有序列表,被压成了段落。此处以兼容格式重列,内容与正文一致,不增不减。
一、六句金句(可背诵)
- Skill 自进化真正的敌人不是「学不会」,是「改坏了自己」。
- SkillAdam 把 Adam 的名字搬了过来,但没把 Adam 的数学搬过来 —— 它给 Skill 装的是一个叫优化器的旋钮,而论文从未量过旋钮转了多少。
- 数字是真的,不等于效应是真的。 60 个 case 上从 1 个成功到 7 个成功,p 值 0.061 —— 这就是「最戏剧化的结果」的真实分量。
- 论文最软的、代码最硬的:一个把超参全藏起来的论文,配了一个把超参全写进 YAML 的仓库。
- 「把 Δ 引入 Y 领域」这种句式,往往是拼图,不是发现 —— 该问的永远是「谁先拼过这两块」。
- 今天还没有人证明,给 Skill 配一个优化器就一定比让人多改两稿更好。
- 给自进化记忆加「问题台账」结构:
issue_id | 错误模式 | 状态(open/resolved/reopened) | 尝试过的解法 + 结果。关键在 reopen —— 同一失败复现时重开旧问题,而不是新建一条。这能直接消灭「改好了 A、下轮又改坏」的典型事故,因为那个被改坏的问题,台账上本来就在,会被重新点亮。 - 用「case 级一致性」当改动闸门,而不是用时间表:最近一轮在 K 个样本上有的一致变好、有的明显变差 → 限制下一轮改动规模;一致变好 → 放开幅度。但切记补上它漏掉的那一步:记录每轮 patch 的实际大小,验证闸门真的起了作用。不验证的旋钮等于没装。
- 保留 held-out 门,不要学它砍掉:它为了「每轮信号更足」把 train 与 selection 合并进优化池、接受门改用同一 mini-batch,代价是模型选择环节失去无偏信号。生产系统应反着来。
- 成本账分开记:优化阶段与推理阶段严格分账,并自曝不利细节 —— 这一条恰恰是它最可信的部分。
- 直接测量 σ 与 patch 长度的相关性 —— 成本最低,且是唯一能救活「自适应步长」这个机制主张的实验;
- ≥5 个随机种子 + 多 benchmark 重跑消融并给置信区间,同时补上「仅去 memory、保留 budget」的对称消融(现设计根本测不出 memory 的独立效应);
- 至少一次跨族迁移(如迁到 Claude / Qwen),取代「同族一次迁移」。
顺带把一页纸速查的骨架贴上:
| 项 | 值 |
|---|---|
| 核心结果 | DP-Avg 21.7% → 28.3%(相对 SkillOpt,非绝对能力) |
| 最戏剧数字 | DP-Travel 1.7% → 11.7%,Fisher p ≈ 0.061(不显著) |
| 效率账 | 优化阶段 token −67.3%、API 请求 −68.8% |
| 应引未引先例 | SkillGrad(早 3.5 个月)、MAPO、REVOLVE、TSGD-M |
| 两处原创发现 | ① 「−B」行与 SkillOpt 逐位相同;② σ 从未被验证约束 patch |
| 代码 vs 论文 | 代码三大组件全实现且与公式跷项吻合;论文超参零披露、无附录、无 Limitations 章节 |