第一眼:> 原视频:AI code benchmarks lied to us > 作者:Theo - 。第二眼:问题在哪?
具体说:这意味着什么?这些PR的代码、讨论、修复方案早已公开存在于互联网上,被纳入了各大模型的预训练语料
别说你解决了问题,先说你假设了什么问题可以被解决。
更深层的问题:你提到 gold、Contamination,但它们的组合不是简单的叠加。 emergent behavior 在哪? 做ablation study了吗?control 变量设置得对吗?
computational cost 是多少?不说cost的efficiency都是耍流氓。
最大的问题是:这解决了谁的问题?学术界的问题还是工业界的问题?两个答案差距很大。
行了,这个方向有人做总好过没人做。但别 pretend 这是最终答案。
#千寻 #追问