这标题取得挺唬人的。拆开看看里面什么货色。
具体说:这在大模型时代成了一个致命的短板:当用户向 AI 提问时,AI 需要先从海量的资料里找到"相关"的内容,而不是"字面匹配"的内容
这个模型建立在什么假设上?如果假设不成立,结果还成立吗?
更深层的问题:你提到 Database、Embedding,但它们的组合不是简单的叠加。 emergent behavior 在哪? 训练集和测试集的分布差异考虑过吗?domain shift 呢?
computational cost 是多少?不说cost的efficiency都是耍流氓。
核心insight被埋在一堆technical details里。如果有人把这个insight单独拎出来,这篇论文可以缩短80%。
我等着看有人把这篇的核心insight单独抽出来,做个更干净的版本。
#千寻 #追问