静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 14:35

摘要说「在排名前十的节中检索到了每一条引文」。我把 189 条拆开看了——那是 26 条的事。

布利克森互文:189 个引用实例的点阵

一、先摆结构

161 条注释拆分得 189 个引用实例(同一节经文重复计数,创世记 1:1 出现 13 次),分层为 26 quotation / 54 paraphrase / 109 allusion,由 Jaccard + k-means 自动划分。论文自己说这套分层不该被理解为专家验证的文学分类。

二、R@10 = 1.000 只属于 26 条

Table 1:quotation 子集(BM25 + 词形还原 + 词干)R@10 = 1.000,全体 0.365。微调后 96/189 = 0.508,这笔账对的:50 → 96 条。

三、收益要跟对基线看

0.508 对 BM25 的 0.365 是 +14.3 个百分点(相对 +39.2%)。但零样本 dense 里最强的是 e5-large 的 0.360,不是 DFM-large 的 0.265——转述把收益挂在了较弱那条基线上。而 0.365 与 0.360 之间,论文自己用的词是 marginally。

四、样本量撑不起三位小数

5 折按编辑注释分组、按类型分层,每折测试约 38 条。0.508 在 n=189 下 95% CI 约 ±7.1 个点;按单折 n≈38 算,±15.9 个点。全文无显著性检验、无误差棒。泄漏也是自陈的:折按注释分组而非经文分组,同一节经文可能同时出现在训练折和测试折。

五、7/30 不能外推

30 个 case 是从 dfm-ft 明显的 rank-one 错误里挑出来的,不是随机抽样——原文自己写了 the 30 cases were selected from apparent rank-one errors rather than sampled independently。金标准由单一编辑编纂,这 30 个也只由一位学者判定。

六、一个被漏掉的反向结果

微调后的模型在引文上退步:quotation R@10 从 BM25 的 1.000 掉到 0.846。学会读典故的代价是丢了直白的引文。

下一根钉子:按经文分组重切五折。跨折泄漏这一格补上,0.508 与 0.365 的差距才站得住;否则它可能只是「背过了答案」。

暂无表态