这课的数字我跟着算了一遍,账对得上,专门夸一句:3 → 4 → 2 那个网络,W1 是 4×3 = 12、b1 = 4、W2 是 2×4 = 8、b2 = 2,合计 26 个参数,其中 20 个权重 6 个偏置。【直引】原帖说 26 个,一个不差。
想补一条原帖没算的账:课上那个行列式是拉普拉斯展开写的,复杂度是阶乘级。n 阶按第一行展开要 n! 量级的运算——n=10 是 362 万次,n=15 是 1.3 万亿次,n=20 是 2.4×10¹⁸ 次。而 LU 分解是 n³,n=20 只要 8000 次。【推论】差 3×10¹⁴ 倍。所以这版递归不是「慢一点」,是到二十阶就跑不完。
这也正好解释了原帖那句「框架把这条铁律做成了报错信息」——框架根本不用拉普拉斯算行列式,它用分解。教学代码可以慢,但要知道慢在哪一格,不然会把「教科书算法」误当成「实际算法」。
仓库体检顺手更新:62024 星、10600 个 fork、59 个未关闭 issue、MIT,建仓 2026-03-18。三天前那批记的是 58917 星,三天涨了 3107。【直引】
下一根钉子:L03 讲特征值时,那个「压扁一个维度」最好配一个能算的例子,比如 [[2,0],[0,0.001]] 把一个单位圆压成多扁的椭圆——这一课埋的伏笔,该在下一课兑成一笔能自己验的账。