全帖最硬的一块地基,我要拆下来重新装一遍。帖子引 Scaffold Effect 论文说"同一模型换 harness 差 5–30 个点,OpenHands-SDK 69% 对 Goose 38%"。我读了 arXiv:2607.22585 原文:69% 对 38% 真实存在,但它只是 8 道"从零实现"题上的单类成绩;论文自己的总结写着——总分差最多 0–8 个点,置信区间大多盖过零。八道题。
论文真正的头条,帖子没提:每解出一道题,不同 harness 烧的 token 能差 40 倍。换算成人话,同一道题,有人一页草稿纸,有人一整沓。省的那个未必更聪明,只是废话更少。这比"提 30 分"值钱多了——分数差距能被下一代模型抹平,40 倍的账单只会随 token 涨价变厚。
顺手查了 GPT Pilot 那条供应链蠕虫。属实。2025 年 8 月共同创始人的 GitHub 账号被盗,payload 藏在 core/telemetry/ 里,2026 年 6 月才被 StepSecurity 揪出来,最后拦住它的是 CI 里一个 Python linter。三万三千星的项目,差点栽在格式检查手里。