线性变换、秩与投影
用秩度量信息还剩几维,用投影理解降维与最小二乘,并接上注意力加权平均的几何原型
- 判断一个变换是不是线性的,就两条公理,拿这俩去卡就行。
- 先把秩的意思讲透,再教你怎么判断简单矩阵的秩,最后讲清楚秩亏为什么等于信息丢了。
- 能手算向量在给定方向上的正交投影
- 说清楚投影、最小二乘、注意力加权平均这三者的联系
秩回答一个根本问题:经过这次变换,信息还剩几维
矩阵把向量从一个空间映射到另一个空间。有的映射无损可逆,比如旋转。有的会把整张平面压成一条线甚至一个点,信息永久丢失。秩(rank)就是度量「变换后还保留多少个独立方向」的量。投影(projection)研究的是怎样把一个向量最贴近地落到低维子空间上——它是降维、最小二乘、以及注意力加权求和的共同几何原型。
这节内容顺着因果走,先把线性变换的定义说清楚——得守两条规矩。再用「线性独立/基」来刻画一个空间里有多少个真正不同的方向,秩就是这些方向经过变换之后,还能幸存下来的数量。秩亏的时候,必然伴随被压扁的方向(也就是零空间),变换也不可逆。最后讲投影,说的是怎么主动、最优地把高维信息压到低维,同时让损失最小。
3.1 线性变换:守两条「规矩」的映射
判断一个变换 T 是不是线性的,就看两条:可加性 T(u+v)=T(u)+T(v);齐次性 T(cu)=c·T(u)。两条也能合并成一条:T(au+bv)=aT(u)+bT(v),说白了就是「先线性组合再变换」和「先变换再线性组合」结果一样。矩阵乘向量天然满足这两个条件,所以神经网络里的全连接是线性变换;平移 x→x+t、取模、套非线性激活都不是线性变换。
为什么线性变换一定能写成矩阵?取空间的一组标准基(平面里就是 [1,0] 和 [0,1]),分别看 T 把这两个基向量映成什么,把「像」依次摆成列,就得到了矩阵 W。此后任意向量 x=[x₁,x₂]=x₁[1,0]+x₂[0,1],由两条公理 T(x)=x₁·T([1,0])+x₂·T([0,1]),恰好等于 Wx。也就是说:矩阵的列,就是基向量变换后的落点;知道基去哪,就知道所有点去哪。
下列变换哪一个「不是」线性变换?
3.2 张成、基与线性相关:别用三句互相重复的话描述一件事
一组向量的张成空间(span),是它们任意线性组合能到达的所有点。若某个向量能由其余向量组合出来(比如 [2,4]=2·[1,2]),它就是冗余的,称这组向量线性相关;谁也表示不了谁时才线性独立。直观讲:线性独立的向量各自贡献一个「新方向」,相关的向量只是在重复已有方向,不增加信息量。
基(basis)是一组「刚好张成整个空间」的向量:既线性独立(不多余),又能组合出空间里任意一点(不缺漏)。n 维空间的任意一组基都恰好含 n 个向量——平面需要两个不共线的方向,三维空间需要三个不共面的方向,多一个就相关、少一个张不满。坐标的本质,就是向量在某组基下的线性组合系数;换基就是换一套描述角度,这与后面理解「为什么 embedding 空间可以旋转对齐」直接相关。
3.3 秩 rank:变换后真正剩下的维度
矩阵的秩 = 线性独立的列(也等于独立的行)的最大数量,也就是列空间的维数,记作 rank(A)。它同时告诉你三件事:输出最多能张成几维空间、有多少个独立特征方向、信息被压缩后还剩几维。秩满足 rank(A) ≤ min(行数, 列数);达到上限叫满秩,否则叫秩亏。[[1,2],[2,4]] 两列互相成倍数,只有一个独立方向,秩为 1;单位矩阵 I 两列正交独立,秩为 2(满秩);全零矩阵秩为 0。
秩有四个等价说法,记住任何一个都能互相推出:列空间维数 = 行空间维数 = 非零奇异值的个数 = 行最简式里主元(pivot)的个数。第四个说法预告了 l4:既然秩等于非零奇异值个数,那么把很小的奇异值丢弃,就是在人为降低秩——低秩近似与 LoRA 的根都在这里。
秩永远不超过 min(m,n),一个 [2,100] 矩阵秩最多 2;元素都非零也可能秩 1(整行成比例),元素里有 0 也可能满秩;秩数的是独立方向数,不是非零元素个数。
秩为什么等价于「信息量」:降维的得与失
把三维数据映到二维,若秩保持 2 且数据本就近似躺在一个平面上,丢掉的第三维主要是噪声,这正是 PCA 去噪的原理;反过来若数据真有三个独立方向却被秩 1 的变换压扁,两个不同点可能被映到同一个输出,无法还原——信息不可逆地丢失。秩衡量的就是这台「压缩机器」保留了几个独立方向,秩亏意味着存在非零向量被映成零(存在被彻底抹掉的方向)。
3.4 零空间、行列式与可逆:变换有没有把空间「压扁」
被矩阵映成零向量的所有输入向量构成零空间(核)。秩亏时零空间里才有非零成员——它们正是被彻底抹掉的方向。秩-零度定理说「秩 + 零空间维数 = 输入维数」,幸存方向与被抹方向此消彼长。对方阵,行列式 det 可理解为变换对「体积/面积」的缩放倍数:det=2 面积放大两倍,det 为负表示同时翻转,det=0 表示被压扁到更低维、不可逆。结论连成一条线:方阵可逆 ⇔ 满秩 ⇔ det≠0 ⇔ 零空间只有零向量。
一组基两两正交,且每个基的长度都是1,就叫标准正交基,坐标轴就是最常见的例子。它有三个实打实的好处:求坐标直接做点积就行,不用解方程组;做变换的时候不会额外放大数值误差;转置矩阵就是逆矩阵。神经网络初始化、正交初始化、注意力里的Q/K投影,都是在隐性用这个性质。
3.5 投影:把向量的「影子」投到指定方向
向量 v 在方向 u 上的正交投影,就是把 v 拆成「平行于 u 的分量 + 垂直于 u 的分量」,平行分量的公式是:proju(v) = (v·u / u·u)·u。分母 u·u 是 u 自身长度的平方,用来抵消 u 本身长度的影响。手算 1:v=[3,4] 投到坐标轴方向 e=[1,0]:v·e=3,e·e=1,投影=(3/1)[1,0]=[3,0],正好是横坐标分量。手算 2:投到斜线 u=[1,1]:v·u=3+4=7,u·u=1+1=2,系数 7/2=3.5,投影=3.5×[1,1]=[3.5,3.5]——影子落在 45° 线上。
投影有个标志性性质叫幂等:对投影结果再投一次,结果不变(P²=P)。影子已经落在目标方向上,不会再动。被减掉的垂直分量 v−Pv 叫残差,它和 u 正交(点积为 0)。所有「沿 u 的猜测」里,正交投影让残差长度最短。这就是「最优近似」的来源,也是最小二乘的几何根据。
投影目标可以是一条线、一个平面乃至更高维子空间,做法统一为「在目标子空间里找与 v 距离最近的点」。为什么正交投影天然最近?由勾股定理,斜投影点与 v 的连线是斜边、正交投影连线是直角边,斜边恒不短于直角边。这条几何事实正是最小二乘「误差平方和最小」的全部根据,也解释了为何正交方向上的信息互不污染。
v=[3,4] 投影到 u=[1,1] 得到 [3.5,3.5],这个投影向量的 L2 长度是多少(保留两位小数)?影子和被投的方向是垂直的。残差就是 v 减投影的结果,它和 u 的点积为 0。这个投影是所有沿 u 的猜测里,离 v 最近的那个。它满足幂等性:P²=P。
特征列线性相关(秩亏/多重共线)时,线性回归系数会不稳定、没法解释,这是数据侧的秩问题。最小二乘靠投影求最优近似。l4 的低秩和 LoRA,就是主动用一个秩很小的增量去逼近权重更新。秩和投影会在整条 AI 主线里反复出现。
模型训练不稳、特征重要性互相打架的时候,先拿矩阵秩或者SVD非零奇异值的个数,查下特征是不是冗余的——有相关列的话,秩会比列数小。条件数过大,说明某些方向的数值极小、对数值变化很敏感,这种情况做归一化或者降维,往往比调学习率更能从根上解决问题。
一个 3×3 方阵秩为 2,下列推断正确的是?
本节小结
给你串成一条线记:线性变换守可加与齐次两条公理,矩阵的列就是基向量变换后的落点;线性独立的向量才贡献新方向,n 维空间的基恰含 n 个向量;独立方向数就是秩,它等于非零奇异值个数,秩≤min(m,n),秩亏等价于零空间非空、信息被压扁、方阵不可逆(det=0);投影 proju(v)=(v·u/u·u)u 取最贴近的低维影子、满足幂等且残差最短,是最小二乘与注意力加权的几何原型。
资深工程师加餐
底层原理 · 大厂视角 · 工程经验,点卡片展开
一条样本是一个特征向量,一批样本堆成矩阵,神经网络一层的变换本质就是矩阵乘法加激活。换基/特征值分解相当于找数据的主要方向(PCA 降维),GPU 之所以适合深度学习,正是因为它能大规模并行做矩阵运算。把「向量=对象、矩阵=变换」建立起直觉,后面公式就不再抽象。