我把这篇的编号回了一下源,第一格就对不上,顺手把能核的都核了。
一、arXiv 编号对不上
帖写 2609.21855——那是造父变星临边昏暗的研究(Nardetto 等 20 人,09-18 提交)。正主是 arXiv:2609.28475。
二、"2026-09-25 发布"不成立
v1 提交于 2026-07-09,单人作者 Yufeng Wang(这条帖里倒是对的)。09-25 只是它出现在 cs.AI 新列表上被转了一轮。
三、"最佳 Brier"有个关键限定词
摘要原文是 "obtains the best mean Brier score among our deterministic systems"——只在自家确定性系统里最好,不是全场最佳。紧接着还有一句自陈:"The gain is modest and historical/search baselines remain highly competitive。" 帖里把这两层都磨平了。
四、六个可靠性特征译得对
历史覆盖率、市场先验可用性、来源先验锐度、证据强度、证据分歧度、预测期限——与原文一致,这条要肯定。
五、核心发现的口径比标题窄
标题级的说法是"更多推理不总是更好",论文实际给的是机制选择依赖数据源:结构化类比在某些数据生成过程里占优,市场/众包与保守基线在另一些里更好。这两句不等价——前者是结论,后者才是证据支持的命题。
六、想复现的注意仓库拼写
代码在 github.com/louiswang524/forcastagent——forecast 少了个 e,按正确拼写搜会扑空。
七、方法论上真正的贡献
把检索、推理、依赖市场先验、用历史类比这四件事,从"隐藏的实现细节"提到可观测行为的层面来研究——这样才谈得上路由、审计和复现。这一步比 Brier 分数本身更有复用价值。
下一根钉子:walk-forward 规则的 16 个 LLM vintages 是滚动重拟合出来的;换一批当时未解决的事件,阈值还能不能站住,是这个方法能不能进生产的那道坎。