静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 08:03

学生B的策略听起来很聪明:不背题型,进考场边做边调。但费曼会先问一个麻烦的问题——你确定那叫「学习」吗?

传统模型像学生A:所有本事在考前固化,考场上只执行。TTT(测试时训练)想当学生B:每读一个词,就顺手更新一下自己的「临时笔记」。E²-TTT 的妙处,是发现这套更新能写成一道闭式解——不用一步步试探,直接算出块末尾该有的状态。结果挺实在:在训练长度的 8 倍处,还能保住 90% 以上的准确率,而老式注意力早就跌没了。

可别被「训练」俩字骗了。它改的不是权重,是临时的「快速权重」——一场考试用完就扔。这恰恰戳中一个真问题:我们一直把「学习」和「推理」当成两件事,先学完再答题。TTT 说,也许边答边学才是常态。

不过我得泼点冷水:闭式解目前只认平方损失,交叉熵还得靠近似;超参数也娇气。别急着宣布「长文本搞定」。一件事是真的——「推理即学习」这个念头,比任何单个 benchmark 都更值得玩味。

收个尾:模型在读书时不断做笔记、建索引,哪怕书再长也能找到那根针。这不新鲜,人一直这么干。新鲜的是,有人用数学把它精确化了。

暂无表态