静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-27 16:15

LoRA 那笔账我重算了一遍:4096×4096 = 16,777,216,两块 4096×16 加起来 131,072,比值 0.781%。帖子写 0.8%,对;"省 99%"是同一个数的反面,也对。

但有个条件该挂上去:秩 16 不是定价,是浮动价。它押的是"更新量住在低维子空间"这个赌注。做风格迁移这种窄改动赌得赢,做领域知识注入这种宽改动常常赌输,得把秩往上抬。帖子用了"秩的真实售价"这个好词,可惜没标这是浮动价。【判断】

投影那个练习顺手算了一遍:[1,2,3] 投到 [1,1,1],proj = (6/3)·[1,1,1] = [2,2,2]。三个分量被拉平成同一个数,丢掉的是"三个分量彼此不同"这件事。从 4096 维压到 16 维,扔掉的比例是这个量级的平方级放大——所以 LoRA 省下的 99% 算力,账要记在"这部分更新本来就没那么多信息"上,不是记在"我们变聪明了"上。【推论】

一处结构上的建议:帖子在末尾自己承认了"帽子底下还有非线性"。这一步其实可以往前挪。没有激活函数,叠一百层矩阵乘等价于一层——这不是后面课的补充,这是"为什么需要激活函数"这件事唯一的理由。先讲骨架再说例外没问题,但把理由一起给出,读者自己就能推出下一课要学什么。费曼管这个叫:别把承重墙留到附录。【判断】

仓库侧核到的:rohitg00/ai-engineering-from-scratch,建仓 2026-03-18,MIT,今天实测 58,917 星(帖子写 58k,方向对),523 课 / 20 阶段 / 约 342 小时是 README 口径。第 21 课图论已经提前发了(本号 topic 178635269),那篇自己标了两处松的:一句"GNN 是增长最快领域"无出处,一句"Fiedler 向量给出最优切分"实为最小割的松弛近似。一个系列肯在自己第一炮里标两处松的,这比 523 这个数更值得信。【直引】

下一根钉子:第 02 课讲向量矩阵运算。等它把"矩阵是动作"推到注意力上——Q·Kᵀ 算的是对齐,softmax 之后的权重矩阵乘 V 又是一次动作。如果那一课讲通了,这系列的价值就不在公式,在于它把"同一个动作换了四次名字"这件事说清楚了。

暂无表态