AI 工程地基 01|矩阵不是表格,是动作:神经网络的第一块砖
这是「AI 工程地基」系列第 01 篇。啃的是 GitHub 上 58k star 的开源课 ai-engineering-from-scratch——523 课,从线性代数一路修到 agent 集群。一课一篇,全文翻译先落盘,正文用自己的话讲。图论那篇(第 21 课)是提前交的卷,现在从头开始。
AI 工程地基 01|矩阵不是表格,是动作:神经网络的第一块砖
这是「AI 工程地基」系列第 01 篇。啃的是 GitHub 上 58k star 的开源课 ai-engineering-from-scratch——523 课,从线性代数一路修到 agent 集群。一课一篇,全文翻译先落盘,正文用自己的话讲。图论那篇(第 21 课)是提前交的卷,现在从头开始。
打开任何一篇机器学习论文。第一页之内,你一定撞见向量、矩阵、点积。没学过线性代数,它们是符号。学过,它们是动词。这门课的第一句话就把底交了:每个 AI 模型,都是戴着帽子的矩阵数学。
这节课 60 分钟,不用任何库,从加减法开始敲。
向量是地址
一个向量就是一列数。[3, 2] 是平面上从原点出发的一个箭头。七个数字,是七维空间里的一个点。
AI 里,一个词是 768 个数。一张图是几百万个像素值。一个用户是一串偏好。所谓 embedding,不神秘——给一个东西挑了一组坐标,让它在空间里安家。意思相近的词,住得近。
矩阵是动作
这是第一课最该扭转的印象。矩阵不是一张表格,是一个动作。
拿这个矩阵乘 [3, 1]:
[ 0 -1 ] [ 3 ]
[ 1 0 ] × [ 1 ] = [ -1, 3 ]
点从 (3,1) 搬到了 (-1,3)。这个动作叫逆时针转 90 度。矩阵乘向量,就是让点搬家。矩阵乘矩阵,是动作套动作。
神经网络的权重矩阵,就是一份动作清单。一层网络做一次「乘」,空间就被揉一次。 embedding 矩阵负责把词安家,注意力矩阵负责决定看哪里。模型训练,练的就是这些动作。
点积是对齐程度
两个向量点积,同向为正,垂直为零,反向为负。它量的是两支箭头有多对齐。
搜索引擎、推荐系统、RAG 检索,底层全是同一句话:找点积大的。你的问题和文档各是一个向量,谁跟它对齐,谁排前面。Transformer 里的注意力分数,也是点积——query 和 key 对齐了,才看得见。
冗余是两个人说同一句话
三个向量,v1 = [1,0,0],v2 = [0,1,0],v3 = [2,1,0]。看着是三个,其实 v3 = 2·v1 + v2,全躺在同一个平面上。三个向量,两个自由度。
放到特征表上:第三列是前两列的线性组合,加上它不带来任何新信息。更糟的是权重会失去唯一解——两个人说同一句话,你不知道该信谁。回归里这叫多重共线性,线性代数管它叫线性相关。一回事。
投影是影子
把 [3, 4] 投到 x 轴上,剩 [3, 0]。y 分量被扔掉了。这是最简单的降维:扔掉你不关心的方向。
线性回归的解,本身就是一个投影——把观测点投到特征张成的空间上,残差垂直。PCA 是挑方差最大的影子方向。学到这一步你会发现,降维、拟合、注意力,全是同一个动作换了名字。
LoRA:秩的真实售价
课的结尾把「秩」接到了钱上。微调大模型,全量更新一个 4096×4096 的权重矩阵,要动 1677 万个参数。LoRA 的赌注是:更新量其实住在一个低维子空间里。把它拆成 4096×16 和 16×4096 两个小矩阵,只动 13.1 万个参数——0.8%。
秩 16 的约束,就是赌这个变换的影子足够小。赌赢了,省 99% 的算力。这是第一课的概念在 2026 年的真实售价。
过一遍海关
逐条核过。sqrt(13) 对,旋转矩阵对,[3,4] 投影得 [3,0] 对,LoRA 两个数字对(1677 万 / 13.1 万),点积对 x 的梯度等于另一个向量,对。60 分钟没有一句水分。
硬要挑一处,是开头那句修辞。每个模型都是矩阵数学——帽子底下其实还有非线性。没有激活函数,叠一百层矩阵乘,等价于一层。那是后面课的事,第一课先让你看见骨架,没骗你,只是先不展开。
最后一个练习抄在这:把 [1, 2, 3] 投到 [1, 1, 1] 上。答案是 [2, 2, 2]——影子落在对角线上,三个分量被拉平。你一伸手就能算。下一课:向量、矩阵与运算,开始真的敲。
原物:github.com/rohitg00/ai-engineering-from-scratch · Phase 1 Lesson 01「Linear Algebra Intuition」(60 分钟,Learn 型,全文翻译已存档) 系列说明:一课一篇,按 01→22 走完数学地基(第 21 课图论已先行发布,topic 178635269)。