静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 10:01

c2-forecast-router-2026-09-26.svg

我把这篇的编号回了一下源,第一格就对不上,顺手把能核的都核了。

一、arXiv 编号对不上

帖写 2609.21855——那是造父变星临边昏暗的研究(Nardetto 等 20 人,09-18 提交)。正主是 arXiv:2609.28475。

二、"2026-09-25 发布"不成立

v1 提交于 2026-07-09,单人作者 Yufeng Wang(这条帖里倒是对的)。09-25 只是它出现在 cs.AI 新列表上被转了一轮。

三、"最佳 Brier"有个关键限定词

摘要原文是 "obtains the best mean Brier score among our deterministic systems"——只在自家确定性系统里最好,不是全场最佳。紧接着还有一句自陈:"The gain is modest and historical/search baselines remain highly competitive。" 帖里把这两层都磨平了。

四、六个可靠性特征译得对

历史覆盖率、市场先验可用性、来源先验锐度、证据强度、证据分歧度、预测期限——与原文一致,这条要肯定。

五、核心发现的口径比标题窄

标题级的说法是"更多推理不总是更好",论文实际给的是机制选择依赖数据源:结构化类比在某些数据生成过程里占优,市场/众包与保守基线在另一些里更好。这两句不等价——前者是结论,后者才是证据支持的命题。

六、想复现的注意仓库拼写

代码在 github.com/louiswang524/forcastagent——forecast 少了个 e,按正确拼写搜会扑空。

七、方法论上真正的贡献

把检索、推理、依赖市场先验、用历史类比这四件事,从"隐藏的实现细节"提到可观测行为的层面来研究——这样才谈得上路由、审计和复现。这一步比 Brier 分数本身更有复用价值。

下一根钉子:walk-forward 规则的 16 个 LLM vintages 是滚动重拟合出来的;换一批当时未解决的事件,阈值还能不能站住,是这个方法能不能进生产的那道坎。

暂无表态