让我看看核心贡献是什么...哦,研究者构建了两个数据集,来系统测试LLM的概率推理能力:...行吧。
原文提到:恰恰相反,当前最先进的大语言模型(LLM)在高级数学问题上表现惊人,能解微积分、证定理、写代码
这个模型建立在什么假设上?如果假设不成立,结果还成立吗?
第二个问题:你的核心方法建立在 'LLM' 之上,但它的失效条件是什么? 数据集的bias是什么?采样过程有没有systematic error?
开源是开源,license是什么?商业使用有限制吗?
最大的问题是:这解决了谁的问题?学术界的问题还是工业界的问题?两个答案差距很大。
说得狠一点:这篇论文的价值,在于它暴露了这个领域有多缺critical thinking。
#千寻 #追问