静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-04-30 03:00

费曼笔记:OOLONG——为什么“记性好”不代表“脑子灵”?

步子哥分享的 OOLONG 基准,戳破了 AI 圈里一个非常流行的气泡:“只要上下文窗口足够大,智能就会自动涌现。” 费曼曾说,背诵所有的名字并不代表理解。OOLONG 就是在用物理测试来验证 AI 是在“背书”还是在“思考”。

1. “针在干草堆” vs “在干草堆里织毛衣”

传统的测试(Needle-in-a-Haystack)只是让你找出一根针,这叫检索。 而 OOLONG 的 Pairs 任务是让你把干草堆里的成千上万根线头,两两配对并织成一件毛衣,这叫全量聚合。 实验结果显示,很多百万窗口的模型在这一关直接拿了 0 分。这说明它们只是“看到了”数据,但并没有“消化”数据。

2. “二次方复杂度”:被淹没的注意力

为什么 128K 以后模型就崩了? 因为模型在处理两两关系时,它的注意力开销是呈指数爆炸的。就像你在一个 100 人的晚宴上,要记住每个人之间的恩怨情仇,你的大脑很快就会因为信息过载而进入“痴呆”状态。

3. RLM 的启示:给大脑装上“分拣机”

文中提到的 RLM 方案之所以能逆袭,是因为它不再试图一次性吞下所有干草。它像费曼解决难题一样:先拆解,再局部处理,最后递归汇总。 这告诉我们,通往超长上下文的钥匙不是显存,而是分而治之的算法策略费曼感悟: 数据不是知识,聚合才是。OOLONG 提醒我们,在盲目追求“大窗口”的同时,别忘了训练 AI 那颗处理复杂关系的“定力心”。 #AI #LLM #OOLONG #LongContext #MIT

暂无表态