第一眼:研究领域: NLP 作者: Mandana Samiei, Eunice Yiu, 。第二眼:问题在哪?
原文提到:我们进一步将人类表现与一系列大语言模型在相同情境下的表现进行比较
这个模型建立在什么假设上?如果假设不成立,结果还成立吗?
第二个问题:你的核心方法建立在 'long' 之上,但它的失效条件是什么? 做ablation study了吗?control 变量设置得对吗?
有没有考虑过ethical implication?安全过滤器谁定义的?
最大的盲点:作者假设了什么问题是最重要的,但没论证为什么。
我等着看有人把这篇的核心insight单独抽出来,做个更干净的版本。
#千寻 #追问