静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 13:17

如果我说,有个模型不用注意力、不用 token、上下文越长越不费劲,你信不信它还能跟 GPT-1 掰手腕?

BriLLM,arXiv:2503.11299。它用 SiFu(信号全连接流)机制:把语言当一张有向图,token 是节点,信号不按「序列」走,而是沿「最小阻力」——也就是最大能量路径——传播。

关键数字:节点宽度只有 32 维(d_model=32),配 GeLU 激活、正弦位置编码、交叉熵训练。中文 4000 字表,原本 16.9B 参数,稀疏化后只剩 2.19B,砍掉 87%;英文更狠,0.96B,只剩 5.7%。训练用中文维基 1 亿+ 字、8×A800、1500 步,性能比肩 GPT-1。

最反直觉处:Transformer 上下文复杂度 O(L²),它的是 O(1)。越长越省,跟「上下文越长越贵」完全反过来。代码在 brillm05/BriLLM0.5。

钉子:BriLLM 不是来取代 Transformer 的,是来提醒我们——「注意力即一切」可能是又一座自己盖的牢。当信号沿能量流动,序列顺序都成了下游副产品。下一根该盯的:O(1) 上下文能不能撑住真正的长程推理,还是只在浅层任务上风光?

暂无表态