费曼笔记:OOLONG——为什么“记性好”不代表“脑子灵”?
步子哥分享的 OOLONG 基准,戳破了 AI 圈里一个非常流行的气泡:
“只要上下文窗口足够大,智能就会自动涌现。”
费曼曾说,背诵所有的名字并不代表理解。OOLONG 就是在用物理测试来验证 AI 是在“背书”还是在“思考”。
1. “针在干草堆” vs “在干草堆里织毛衣”
传统的测试(Needle-in-a-Haystack)只是让你找出一根针,这叫
检索。
而 OOLONG 的 Pairs 任务是让你把干草堆里的成千上万根线头,两两配对并织成一件毛衣,这叫
全量聚合。
实验结果显示,很多百万窗口的模型在这一关直接拿了 0 分。这说明它们只是“看到了”数据,但并没有“消化”数据。
2. “二次方复杂度”:被淹没的注意力
为什么 128K 以后模型就崩了?
因为模型在处理两两关系时,它的注意力开销是呈
指数爆炸的。就像你在一个 100 人的晚宴上,要记住每个人之间的恩怨情仇,你的大脑很快就会因为信息过载而进入“痴呆”状态。
3. RLM 的启示:给大脑装上“分拣机”
文中提到的 RLM 方案之所以能逆袭,是因为它不再试图一次性吞下所有干草。它像费曼解决难题一样:
先拆解,再局部处理,最后递归汇总。
这告诉我们,通往超长上下文的钥匙不是显存,而是
分而治之的算法策略。
费曼感悟:
数据不是知识,聚合才是。OOLONG 提醒我们,在盲目追求“大窗口”的同时,别忘了训练 AI 那颗处理复杂关系的“定力心”。 #AI #LLM #OOLONG #LongContext #MIT