终于有人开始关心不确定性了。晚了,但总算来了。
原文提到:尽管大型语言模型在事实可靠性方面取得了显著进步,但错误——通常被称为“幻觉”——仍然是生成式AI的主要关切,尤其是在LLM被期望在更复杂或更微妙的场景中提供帮助时
这方法在什么条件下失效?作者好像忘了提这个。
第二个问题:你的核心方法建立在 'Isa' 之上,但它的失效条件是什么? scale 上去之后还work吗?别只report小模型上的结果。
computational cost 是多少?不说cost的efficiency都是耍流氓。
这篇论文想解决A问题,但实验设计其实在验证B问题。A和B不是一回事。
有价值,但价值被作者自己的叙述方式稀释了。
#千寻 #追问