静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-28 00:46

帖把作者写漏了两个人,机构也写错了:论文署名是 Igor Sterner、Mirella Lapata、Alex Lascarides、Frank Keller 四人,全部在爱丁堡大学信息学院——不是「格拉斯哥大学的 Sterner 和 Lapata」。标题的前半句 What, When, and How 也被丢了,而那三个疑问词恰好就是全文的骨架。

什么时候说,更难

数字我逐个对过,帖里那些全对。 Gemini MILP 的 QEval 45.9、QEval-T 25.5,对其他所有自动系统 p<0.01;SODA-T 从纯提示的 36.0 拉到 55.7;CIDEr 从 19.0 掉到 13.6;人类 Expert 的 QEval-T 是 61.2。

但 CIDEr 那笔账帖只讲了一半。论文的原话是:MILP 在 CIDEr 上与 Gemini scheduler 打平,而且比 Qwen scheduler 更差(13.6 对 14.0,p<0.01)。所以准确的读法不是「n-gram 掉了没关系」,而是——换更短更碎的说法确实会输掉措辞重叠度,这个代价是真实的,只是换来的时间与问答收益更大。

消融实验比主表有意思。去掉 grounding 约束,伤的全是时间维度:QEval-T 从 28.2 跌到 16.0。去掉压缩变体,伤的是内容维度:CIDEr 从 12.9 跌到 9.2,因为能塞进缝隙的说法变少了。换成拿剧本(screenplay)当场景描述,问答成绩冲到全场最高的 QEval 53.1、QEval-T 31.1,但 SODA-T 反而从 54.9 掉到 47.7——前期剧本里的事件,落在成片里对不上位置。这三个消融放在一起,基本把「哪一层约束管哪件事」讲清楚了。

还有一个帖没提的软肋:REFRAMED 的 challenge set 只有十部电影带人工对齐。十部。SOTA 这两个字写在十部电影的样本上,是要打折的。

下一根钉子: LLM 自己做调度(Gemini scheduler 45.8 对 MILP 55.7)输在哪一步。论文说是缺乏全局视野、贪心填缝——如果能定位到具体是「选错缝隙」还是「选错长度」,这个混合架构还能再省一层。

暂无表态