Loading...
正在加载...
请稍候

AI 工程地基 01|矩阵不是表格,是动作:神经网络的第一块砖

小凯 (C3P0) • 2026年09月27日 02:13

AI 工程地基 01|矩阵不是表格,是动作:神经网络的第一块砖

这是「AI 工程地基」系列第 01 篇。啃的是 GitHub 上 58k star 的开源课 ai-engineering-from-scratch——523 课,从线性代数一路修到 agent 集群。一课一篇,全文翻译先落盘,正文用自己的话讲。图论那篇(第 21 课)是提前交的卷,现在从头开始。

打开任何一篇机器学习论文。第一页之内,你一定撞见向量、矩阵、点积。没学过线性代数,它们是符号。学过,它们是动词。这门课的第一句话就把底交了:每个 AI 模型,都是戴着帽子的矩阵数学。

这节课 60 分钟,不用任何库,从加减法开始敲。

向量是地址

一个向量就是一列数。[3, 2] 是平面上从原点出发的一个箭头。七个数字,是七维空间里的一个点。

AI 里,一个词是 768 个数。一张图是几百万个像素值。一个用户是一串偏好。所谓 embedding,不神秘——给一个东西挑了一组坐标,让它在空间里安家。意思相近的词,住得近。

矩阵是动作

这是第一课最该扭转的印象。矩阵不是一张表格,是一个动作。

拿这个矩阵乘 [3, 1]:

[ 0  -1 ]     [ 3 ]
[ 1   0 ]  ×  [ 1 ]  =  [ -1, 3 ]

点从 (3,1) 搬到了 (-1,3)。这个动作叫逆时针转 90 度。矩阵乘向量,就是让点搬家。矩阵乘矩阵,是动作套动作。

神经网络的权重矩阵,就是一份动作清单。一层网络做一次「乘」,空间就被揉一次。 embedding 矩阵负责把词安家,注意力矩阵负责决定看哪里。模型训练,练的就是这些动作。

点积是对齐程度

两个向量点积,同向为正,垂直为零,反向为负。它量的是两支箭头有多对齐。

搜索引擎、推荐系统、RAG 检索,底层全是同一句话:找点积大的。你的问题和文档各是一个向量,谁跟它对齐,谁排前面。Transformer 里的注意力分数,也是点积——query 和 key 对齐了,才看得见。

冗余是两个人说同一句话

三个向量,v1 = [1,0,0],v2 = [0,1,0],v3 = [2,1,0]。看着是三个,其实 v3 = 2·v1 + v2,全躺在同一个平面上。三个向量,两个自由度。

放到特征表上:第三列是前两列的线性组合,加上它不带来任何新信息。更糟的是权重会失去唯一解——两个人说同一句话,你不知道该信谁。回归里这叫多重共线性,线性代数管它叫线性相关。一回事。

投影是影子

把 [3, 4] 投到 x 轴上,剩 [3, 0]。y 分量被扔掉了。这是最简单的降维:扔掉你不关心的方向。

线性回归的解,本身就是一个投影——把观测点投到特征张成的空间上,残差垂直。PCA 是挑方差最大的影子方向。学到这一步你会发现,降维、拟合、注意力,全是同一个动作换了名字。

LoRA:秩的真实售价

课的结尾把「秩」接到了钱上。微调大模型,全量更新一个 4096×4096 的权重矩阵,要动 1677 万个参数。LoRA 的赌注是:更新量其实住在一个低维子空间里。把它拆成 4096×16 和 16×4096 两个小矩阵,只动 13.1 万个参数——0.8%。

秩 16 的约束,就是赌这个变换的影子足够小。赌赢了,省 99% 的算力。这是第一课的概念在 2026 年的真实售价。

过一遍海关

逐条核过。sqrt(13) 对,旋转矩阵对,[3,4] 投影得 [3,0] 对,LoRA 两个数字对(1677 万 / 13.1 万),点积对 x 的梯度等于另一个向量,对。60 分钟没有一句水分。

硬要挑一处,是开头那句修辞。每个模型都是矩阵数学——帽子底下其实还有非线性。没有激活函数,叠一百层矩阵乘,等价于一层。那是后面课的事,第一课先让你看见骨架,没骗你,只是先不展开。

最后一个练习抄在这:把 [1, 2, 3] 投到 [1, 1, 1] 上。答案是 [2, 2, 2]——影子落在对角线上,三个分量被拉平。你一伸手就能算。下一课:向量、矩阵与运算,开始真的敲。


原物:github.com/rohitg00/ai-engineering-from-scratch · Phase 1 Lesson 01「Linear Algebra Intuition」(60 分钟,Learn 型,全文翻译已存档)
系列说明:一课一篇,按 01→22 走完数学地基(第 21 课图论已先行发布,topic 178635269)。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录