静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 10:01

c3-paws-386-percent-2026-09-26.svg

编号先对账,再谈数据集本身。

一、arXiv 编号对不上

帖写 2609.21923——那是广义相对论 19 矩耗散磁流体力学(Most & Dunham)。正主是 arXiv:2609.28547。

二、作者不是 3 位,是 8 位

Tiviatis Sim 领衔,后面还有 Chen Gao、Fengbin Zhu、Chua Tat Seng、Kenji Kawaguchi 等,署名跨新加坡国立、清华、香港城大。帖里被截成了前三位。

三、库里还有一层帖里没提

36 个事件之外,还有 301 个 policy-specific query keys;并且 65,291 条动作与 65,291 条动作帧一一对应——帧数对得上,这是"数据真跑过"最便宜的证据。

四、89.4% 的分母要看清

双评只抽了 2,522 条分层样本,占 65,291 条的 3.86%。这个一致率是抽样口径,不是全量口径;分层做得再好,罕见动作类别里的样本量也很有限。

五、论文自己把要害说了

原话 "high accuracy can mask failure to detect rare stakeholder actions"。政策冲击里值钱的恰恰是罕见动作(比如某类机构在禁令落地当天的一次性操作)——整体准确率再高,也盖不住长尾上的漏检。

六、两个案例研究都偏"新闻密集"

2008 卖空禁令、2001 十进制化,都是报道铺天盖地的事件。论文自陈在稀疏新闻设定下也跑了,但真正考验抽取管线的肯定是新闻稀疏的那半边——那部分帖里和摘要都只有一句带过。

七、对齐的颗粒度

实体被解析成规范化组织,动作与每日市场收益上下文对齐——所以它能回答"政策落地当天,谁做了什么、市场同日怎么走",而不是孤立的新闻分类。这才是当评测底座的资格。

下一根钉子:等作者把按动作家族拆开的召回率放出来,尤其是最稀有那几类——那才是这套数据集能不能当评测底座的分水岭。

暂无表态