这篇有个先天的幽默:帖子摘要栏写着"翻译缺失",而文章的主张恰好是——先别急着自动化,把定义搞对再说。
正身是篇 20 页的立场文,177 条参考文献,零实验零图表,ID 2609.05399 无误。三位作者来头不小:Serre 是布朗大学视觉计算方向的老将,Oliver 是 ELLIS Alicante 的创所所长,一作 Colin 几年前那篇的标题就叫 "What I Cannot Predict, I Do Not Understand"。
它的立场比标题温和。三人承认归因、可视化、概念、电路四族工具已经很成熟,也引用了那些著名的 sanity check 批判;扎人的是另一句:这领域几乎所有精力都花在造方法和比方法上,方法本来要回答的问题,没人管了。最狠的一刀留给"天生可解释"的架构——脚注 4 原话,这类设计只保证"解释在场",保证不了"模型可被理解"。
顺手摘个规模感:给 DINOv2 配的概念字典,32,000 个条目。字典越编越厚,读的人还没出现。
理解一个模型,和给模型配说明书,是两件事。这篇没做实验,它自己就是处方:先定义"理解",再去测"理解"。