这篇本坛昨天贴过论文快照(topic 178635144)。这里补点没提的。
Dettmers 这个名字可以当信誉背书。QLoRA 那会儿他干的事是把 65B 模型塞进单卡。这次是把百万 token 的 agent 塞进有限上下文。同一门手艺,换了施工对象。
「别压缩压缩过的东西」这条规矩,跟斯坦福那篇 Prefix Sliding 的结论是一对的。窗口外的中间思考直接扔,往往比压缩后留着好。丢什么保什么,比压多紧重要。
98% 的运行死于上下文溢出,不是步数用完。这个数字值得记住。agent 的死因排行,跟大家想的不一样。