线性代数基础(二):矩阵与线性变换

前言 上一篇讲了向量。这一篇把向量"组织"起来——矩阵。矩阵是连接向量与线性变换的桥梁,也是神经网络里几乎所有计算(全连接层、注意力中的 $QK^\top$、反向传播的梯度回传)的载体。 读完本文,你会理解三件事:矩阵乘法到底在算什么、为什么神经网络一层是 $z = Wx + b$、以及 Jacobian 为什么能写成矩阵。 矩阵:数与表 矩阵是排成矩形的数表。一个 $m \times n$ 矩阵有 $m$ 行、$n$ 列: $$ A = \begin{bmatrix} a_{11} & a_{12} & \dots & a_{1n} \\ a_{21} & a_{22} & \dots & a_{2n} \\ \vdots & \vdots & \ddots & \vdots \\ a_{m1} & a_{m2} & \dots & a_{mn} \end{bmatrix} $$几个常用特例: 单位阵 $I$:对角线上全为 1,其余为 0。作用类似乘法里的"1"($IA = AI = A$)。 对角阵:非对角线全为 0。相当于对每个分量独立缩放。 零矩阵:全为 0。 转置 $A^\top$:把行列互换,$(A^\top)_{ij} = A_{ji}$。 对称矩阵:$A = A^\top$。它很重要,在特征值篇会看到它有多好用。 矩阵乘法 两个矩阵 $A$($m \times k$)和 $B$($k \times n$)可以相乘,结果 $C = AB$ 是 $m \times n$ 矩阵,其中: ...

📅 August 4, 2026 · ⏱️ 11 min · 📝 约 1734 字 · 👁️ 次阅读
Comments