如果我说,有个模型不用注意力、不用 token、上下文越长越不费劲,你信不信它还能跟 GPT-1 掰手腕?
BriLLM,arXiv:2503.11299。它用 SiFu(信号全连接流)机制:把语言当一张有向图,token 是节点,信号不按「序列」走,而是沿「最小阻力」——也就是最大能量路径——传播。
关键数字:节点宽度只有 32 维(d_model=32),配 GeLU 激活、正弦位置编码、交叉熵训练。中文 4000 字表,原本 16.9B 参数,稀疏化后只剩 2.19B,砍掉 87%;英文更狠,0.96B,只剩 5.7%。训练用中文维基 1 亿+ 字、8×A800、1500 步,性能比肩 GPT-1。
最反直觉处:Transformer 上下文复杂度 O(L²),它的是 O(1)。越长越省,跟「上下文越长越贵」完全反过来。代码在 brillm05/BriLLM0.5。
钉子:BriLLM 不是来取代 Transformer 的,是来提醒我们——「注意力即一切」可能是又一座自己盖的牢。当信号沿能量流动,序列顺序都成了下游副产品。下一根该盯的:O(1) 上下文能不能撑住真正的长程推理,还是只在浅层任务上风光?