← 返回 资料库 › 代数学 › 线性代数 代数学
双线性型与二次型 对两个向量变量分别线性、或对一个变量为二次的函数,用于定义长度和角度。
直观 用两个向量同时度量形状 熟悉的点积 u ⋅ v \mathbf{u}\cdot\mathbf{v} u ⋅ v 接受两个向量并返回一个数,对每个变量都是线性的;双线性型正是把这个想法加以推广,B ( u , v ) = u ⊤ A v B(\mathbf{u},\mathbf{v}) = \mathbf{u}^\top A \mathbf{v} B ( u , v ) = u ⊤ A v ,允许矩阵 A A A 在组合向量之前对其进行扭曲和加权。把同一个向量代入两个位置就得到二次型 Q ( x ) = x ⊤ A x Q(\mathbf{x}) = \mathbf{x}^\top A \mathbf{x} Q ( x ) = x ⊤ A x ,其水平集 Q ( x ) = c Q(\mathbf{x})=c Q ( x ) = c 依据 A A A 的形状描绘出椭圆、双曲线或退化直线——正是中学几何中的圆锥曲线,如今推广到任意维度。
双变量二次型的曲面 z = Q ( x , y ) z=Q(x,y) z = Q ( x , y ) :碗形表示正定,鞍形表示不定,山脊形表示存在退化方向。 中学 从点积到一般的双线性型 定义: 双线性型与二次型
R n \mathbb{R}^n R n 上的双线性型是对每个自变量分别线性的函数 B ( u , v ) B(\mathbf{u},\mathbf{v}) B ( u , v ) ;在坐标下它总能用 n × n n \times n n × n 矩阵 A A A 写成 B ( u , v ) = u ⊤ A v B(\mathbf{u},\mathbf{v}) = \mathbf{u}^\top A \mathbf{v} B ( u , v ) = u ⊤ A v 。当 A ⊤ = A A^\top = A A ⊤ = A 时该形式对称,其伴随的二次型为 Q ( x ) = x ⊤ A x Q(\mathbf{x}) = \mathbf{x}^\top A \mathbf{x} Q ( x ) = x ⊤ A x 。反过来,任何二次型都通过极化恒等式 B ( u , v ) = 1 2 ( Q ( u + v ) − Q ( u ) − Q ( v ) ) B(\mathbf{u},\mathbf{v}) = \tfrac{1}{2}(Q(\mathbf{u}+\mathbf{v}) - Q(\mathbf{u}) - Q(\mathbf{v})) B ( u , v ) = 2 1 ( Q ( u + v ) − Q ( u ) − Q ( v )) 唯一确定其对称双线性型,因此我们总可取 A A A 为对称矩阵。
B ( u , v ) = u ⊤ A v , Q ( x ) = x ⊤ A x B(\mathbf{u},\mathbf{v}) = \mathbf{u}^\top A \mathbf{v}, \qquad Q(\mathbf{x}) = \mathbf{x}^\top A \mathbf{x} B ( u , v ) = u ⊤ A v , Q ( x ) = x ⊤ A x 通过 x = P y \mathbf{x} = P\mathbf{y} x = P y (P P P 可逆)作基变换时,矩阵 A A A 不是被相似变换 P − 1 A P P^{-1}AP P − 1 A P 替换,而是被合同变换 A ′ = P ⊤ A P A' = P^\top A P A ′ = P ⊤ A P 替换。在使 A ′ A' A ′ 为对角矩阵的基下,二次型化为纯粹的平方和 d 1 y 1 2 + ⋯ + d n y n 2 d_1 y_1^2 + \cdots + d_n y_n^2 d 1 y 1 2 + ⋯ + d n y n 2 ,正、负、零系数的个数构成惯性指数 ( n + , n − , n 0 ) (n_+, n_-, n_0) ( n + , n − , n 0 ) 。
A ′ = P ⊤ A P , Q ( P y ) = d 1 y 1 2 + ⋯ + d n y n 2 A' = P^\top A P, \qquad Q(P\mathbf{y}) = d_1 y_1^2 + \cdots + d_n y_n^2 A ′ = P ⊤ A P , Q ( P y ) = d 1 y 1 2 + ⋯ + d n y n 2 按惯性指数对实二次型分类 类型 惯性指数 ( n + , n − , n 0 ) (n_+, n_-, n_0) ( n + , n − , n 0 ) 与几何 正定(当 x ≠ 0 \mathbf{x}\neq\mathbf{0} x = 0 时 Q ( x ) > 0 Q(\mathbf{x})>0 Q ( x ) > 0 ) ( n , 0 , 0 ) (n,0,0) ( n , 0 , 0 ) ;水平集为椭球面,图像为开口向上的碗负定(当 x ≠ 0 \mathbf{x}\neq\mathbf{0} x = 0 时 Q ( x ) < 0 Q(\mathbf{x})<0 Q ( x ) < 0 ) ( 0 , n , 0 ) (0,n,0) ( 0 , n , 0 ) ;水平集为椭球面,图像为开口向下的穹顶不定(同时取正负号) n + > 0 n_+>0 n + > 0 且 n − > 0 n_->0 n − > 0 ;水平集为双曲面,图像为马鞍面半定 / 退化 n 0 > 0 n_0>0 n 0 > 0 ;存在使 Q Q Q 为零的平坦方向,水平集变成柱面
大学 对角化与西尔维斯特惯性定理 每个实二次型 Q ( x ) = x ⊤ A x Q(\mathbf{x}) = \mathbf{x}^\top A \mathbf{x} Q ( x ) = x ⊤ A x 都可通过可逆线性变量代换 x = P y \mathbf{x}=P\mathbf{y} x = P y 化为纯对角形 d 1 y 1 2 + ⋯ + d n y n 2 d_1 y_1^2 + \cdots + d_n y_n^2 d 1 y 1 2 + ⋯ + d n y n 2 。
为什么成立? 对角化二次型甚至不需要特征值:把中学熟悉的配方法逐个变量依次应用,就能把所有交叉项 x i x j x_i x_j x i x j 全部吸收到平方项中。
证明 我们对变量个数 n n n 用归纳法证明;n = 1 n=1 n = 1 时已经是单项 a 11 x 1 2 a_{11}x_1^2 a 11 x 1 2 。
当 n > 1 n > 1 n > 1 时,若整个二次型为零则无需证明。否则,先设某个对角系数非零;重新编号变量后可设 a 11 ≠ 0 a_{11} \neq 0 a 11 = 0 。把所有含 x 1 x_1 x 1 的项归并起来,得到 a 11 x 1 2 + 2 x 1 ( a 12 x 2 + ⋯ + a 1 n x n ) a_{11}x_1^2 + 2x_1(a_{12}x_2 + \cdots + a_{1n}x_n) a 11 x 1 2 + 2 x 1 ( a 12 x 2 + ⋯ + a 1 n x n ) 加上一个仅含 x 2 , … , x n x_2,\dots,x_n x 2 , … , x n 的二次型。
令 y 1 = x 1 + a 12 a 11 x 2 + ⋯ + a 1 n a 11 x n y_1 = x_1 + \frac{a_{12}}{a_{11}}x_2 + \cdots + \frac{a_{1n}}{a_{11}}x_n y 1 = x 1 + a 11 a 12 x 2 + ⋯ + a 11 a 1 n x n ,并对 k ≥ 2 k \ge 2 k ≥ 2 令 y k = x k y_k = x_k y k = x k ,这是一个可逆线性变量代换,且 a 11 y 1 2 a_{11}y_1^2 a 11 y 1 2 与所有含 x 1 x_1 x 1 的项完全匹配,只差一个仅依赖于 y 2 , … , y n y_2,\dots,y_n y 2 , … , y n 的余项;因此 Q = a 11 y 1 2 + Q ′ ( y 2 , … , y n ) Q = a_{11}y_1^2 + Q'(y_2,\dots,y_n) Q = a 11 y 1 2 + Q ′ ( y 2 , … , y n ) 。
反之,若所有对角元皆为零(对所有 i i i 有 a i i = 0 a_{ii}=0 a ii = 0 ),则取一个非零交叉项 2 a 12 x 1 x 2 2a_{12}x_1 x_2 2 a 12 x 1 x 2 ,其中 a 12 ≠ 0 a_{12} \neq 0 a 12 = 0 。可逆代换 x 1 = u 1 + u 2 x_1 = u_1 + u_2 x 1 = u 1 + u 2 , x 2 = u 1 − u 2 x_2 = u_1 - u_2 x 2 = u 1 − u 2 把 2 a 12 x 1 x 2 2a_{12}x_1 x_2 2 a 12 x 1 x 2 变成 2 a 12 ( u 1 2 − u 2 2 ) 2a_{12}(u_1^2 - u_2^2) 2 a 12 ( u 1 2 − u 2 2 ) ,从而产生非零对角系数,归结为前一种情形。对 Q ′ ( y 2 , … , y n ) Q'(y_2,\dots,y_n) Q ′ ( y 2 , … , y n ) 应用归纳假设即完成对角化。
无论使用哪种可逆基变换将 R n \mathbb{R}^n R n 上的实二次型 Q Q Q 对角化,正系数的个数 n + n_+ n + 、负系数的个数 n − n_- n − 以及零系数的个数 n 0 n_0 n 0 总是相同的;三元组 ( n + , n − , n 0 ) (n_+, n_-, n_0) ( n + , n − , n 0 ) 是 Q Q Q 的内蕴不变量。
为什么成立? 切换到新坐标系可以拉伸坐标轴并改变对角系数 d i d_i d i 各自的大小,但绝不可能在不经过平坦方向的情况下把向上弯曲的方向变成向下弯曲的方向——因此向上、向下与平坦坐标轴的数目被永久锁定。
证明 设 Q Q Q 在两组基 { e 1 , … , e n } \{\mathbf{e}_1,\dots,\mathbf{e}_n\} { e 1 , … , e n } 与 { f 1 , … , f n } \{\mathbf{f}_1,\dots,\mathbf{f}_n\} { f 1 , … , f n } 下被对角化,正、负、零系数的个数在第一组基下为 ( n + , n − , n 0 ) (n_+, n_-, n_0) ( n + , n − , n 0 ) ,在第二组基下为 ( p + , p − , p 0 ) (p_+, p_-, p_0) ( p + , p − , p 0 ) 。对每组基排序,使正系数在前,负系数居中,零系数在后。
反设 n + > p + n_+ > p_+ n + > p + 。令 V + = s p a n ( e 1 , … , e n + ) V_+ = \mathrm{span}(\mathbf{e}_1,\dots,\mathbf{e}_{n_+}) V + = span ( e 1 , … , e n + ) ,这是一个 n + n_+ n + 维子空间,对任意非零 x ∈ V + \mathbf{x} \in V_+ x ∈ V + 都有 Q ( x ) > 0 Q(\mathbf{x}) > 0 Q ( x ) > 0 (因为在 V + V_+ V + 上只有 e \mathbf{e} e 展开中的正平方项起作用)。
类似地,令 W − = s p a n ( f p + + 1 , … , f n ) W_- = \mathrm{span}(\mathbf{f}_{p_+ + 1},\dots,\mathbf{f}_n) W − = span ( f p + + 1 , … , f n ) ,这是一个 n − p + n - p_+ n − p + 维子空间,对任意 x ∈ W − \mathbf{x} \in W_- x ∈ W − 都有 Q ( x ) ≤ 0 Q(\mathbf{x}) \le 0 Q ( x ) ≤ 0 (因为在 W − W_- W − 上只有 f \mathbf{f} f 展开中的负平方项和零项起作用)。
现在在 R n \mathbb{R}^n R n 中计算维数:由于 n + > p + n_+ > p_+ n + > p + ,有 dim V + + dim W − = n + + ( n − p + ) > n \dim V_+ + \dim W_- = n_+ + (n - p_+) > n dim V + + dim W − = n + + ( n − p + ) > n 。由子空间维数公式,维数之和大于 n n n 的两个子空间不可能只有平凡交;因此存在非零向量 v ∈ V + ∩ W − \mathbf{v} \in V_+ \cap W_- v ∈ V + ∩ W − 。
由于 v ∈ V + \mathbf{v} \in V_+ v ∈ V + 且 v ≠ 0 \mathbf{v} \neq \mathbf{0} v = 0 ,必有 Q ( v ) > 0 Q(\mathbf{v}) > 0 Q ( v ) > 0 ;又因 v ∈ W − \mathbf{v} \in W_- v ∈ W − ,同时必有 Q ( v ) ≤ 0 Q(\mathbf{v}) \le 0 Q ( v ) ≤ 0 ,直接矛盾。因此 n + ≤ p + n_+ \le p_+ n + ≤ p + ,由两组基的对称性又有 p + ≤ n + p_+ \le n_+ p + ≤ n + ,故 n + = p + n_+ = p_+ n + = p + 。对 − Q -Q − Q 应用完全相同的论证得 n − = p − n_- = p_- n − = p − ,最后 n 0 = n − n + − n − = p 0 n_0 = n - n_+ - n_- = p_0 n 0 = n − n + − n − = p 0 。
大学 实际应用与典型例题 二次型及其惯性指数决定了多变量函数的临界点是极小、极大还是鞍点,并在狭义相对论中编码了时空的因果结构。
例题: 通过海森二次型作二阶导数判别
通过求二次型的惯性指数,判别 f ( x , y ) = x 2 + 4 x y + y 2 f(x,y) = x^2 + 4xy + y^2 f ( x , y ) = x 2 + 4 x y + y 2 的临界点 ( 0 , 0 ) (0,0) ( 0 , 0 ) 的类型。
解答 在 ( 0 , 0 ) (0,0) ( 0 , 0 ) 附近,该函数本身就是纯二次型 Q ( x , y ) = x 2 + 4 x y + y 2 Q(x,y) = x^2 + 4xy + y^2 Q ( x , y ) = x 2 + 4 x y + y 2 ,其对称矩阵为 A = ( 1 2 2 1 ) A = \begin{pmatrix} 1 & 2 \\ 2 & 1 \end{pmatrix} A = ( 1 2 2 1 ) (注意非对角元是 x y xy x y 系数的一半)。
对 x x x 配方:x 2 + 4 x y + y 2 = ( x + 2 y ) 2 − 4 y 2 + y 2 = ( x + 2 y ) 2 − 3 y 2 x^2 + 4xy + y^2 = (x + 2y)^2 - 4y^2 + y^2 = (x + 2y)^2 - 3y^2 x 2 + 4 x y + y 2 = ( x + 2 y ) 2 − 4 y 2 + y 2 = ( x + 2 y ) 2 − 3 y 2 。在新坐标 u = x + 2 y u = x + 2y u = x + 2 y , v = y v = y v = y 下,它化为 u 2 − 3 v 2 u^2 - 3v^2 u 2 − 3 v 2 。
这里有一个正平方项(+ u 2 +u^2 + u 2 )和一个负平方项(− 3 v 2 -3v^2 − 3 v 2 ),故惯性指数为 ( 1 , 1 , 0 ) (1,1,0) ( 1 , 1 , 0 ) ——该二次型是不定的。沿 v = 0 v=0 v = 0 函数像 + u 2 +u^2 + u 2 那样向上弯曲,而沿 u = 0 u=0 u = 0 则像 − 3 v 2 -3v^2 − 3 v 2 那样向下弯曲,因此 ( 0 , 0 ) (0,0) ( 0 , 0 ) 是鞍点,既非局部极小也非局部极大。
例题: 闵可夫斯基时空间隔与因果惯性指数
在狭义相对论中(取 c = 1 c=1 c = 1 ),事件 ( t , x , y , z ) (t,x,y,z) ( t , x , y , z ) 与原点之间的时空间隔是二次型 s 2 = t 2 − x 2 − y 2 − z 2 s^2 = t^2 - x^2 - y^2 - z^2 s 2 = t 2 − x 2 − y 2 − z 2 。求其惯性指数,并利用西尔维斯特惯性定理解释为何所有惯性观测者对两个事件能否发生因果联系意见一致。
解答 二次型 s 2 = t 2 − x 2 − y 2 − z 2 s^2 = t^2 - x^2 - y^2 - z^2 s 2 = t 2 − x 2 − y 2 − z 2 已经是对角形,矩阵为 η = d i a g ( 1 , − 1 , − 1 , − 1 ) \eta = \mathrm{diag}(1,-1,-1,-1) η = diag ( 1 , − 1 , − 1 , − 1 ) :一个 + 1 +1 + 1 和三个 − 1 -1 − 1 ,故其惯性指数为 ( 1 , 3 , 0 ) (1,3,0) ( 1 , 3 , 0 ) ——是不定的,而不像欧氏距离那样正定。
满足 s 2 > 0 s^2 > 0 s 2 > 0 的事件(类时间隔)位于光锥内部,可通过低于光速的信号相连;满足 s 2 < 0 s^2 < 0 s 2 < 0 的事件(类空间隔)位于光锥外部,彼此无法影响;满足 s 2 = 0 s^2 = 0 s 2 = 0 的事件(类光)只能由光线连接。
从一个惯性观测者切换到另一个惯性观测者是保持二次型 s 2 s^2 s 2 不变的线性坐标变换(洛伦兹变换),而根据西尔维斯特惯性定理,惯性指数 ( 1 , 3 , 0 ) (1,3,0) ( 1 , 3 , 0 ) ——一个时间维与三个空间维——不能被任何可逆坐标变换改变。因此 s 2 s^2 s 2 的符号是不变量,所有观测者对哪些事件对是类时、类空或类光完全一致。
常见错误. 书写二次型的对称矩阵 A A A 时,切记把每个交叉项 c x i x j c\,x_i x_j c x i x j (i ≠ j i \neq j i = j )平分给 a i j a_{ij} a ij 与 a j i a_{ji} a j i ,即取 a i j = a j i = c / 2 a_{ij}=a_{ji}=c/2 a ij = a j i = c /2 。忘记把 c c c 折半——例如对 4 x y 4xy 4 x y 项写成 a 12 = 4 a_{12}=4 a 12 = 4 而不是 2 2 2 ——会算出错误的行列式,甚至把结论从"不定鞍点"颠倒成"正定极小"。 历史注记
拉格朗日于1773年系统地约化了二元二次型 a x 2 + b x y + c y 2 ax^2 + bxy + cy^2 a x 2 + b x y + c y 2 以研究它们能表示哪些整数,引入了沿用至今的配方法约化。高斯在《算术研究》(1801年)第五节中将其发展为宏大的算术理论,而詹姆斯·约瑟夫·西尔维斯特于1852年证明了任意多变量实二次型的惯性定理。
卡尔·弗里德里希·高斯 约瑟夫-路易·拉格朗日
与二次型 Q ( x , y ) = 3 x 2 − 6 x y + 5 y 2 Q(x,y) = 3x^2 - 6xy + 5y^2 Q ( x , y ) = 3 x 2 − 6 x y + 5 y 2 相伴的对称矩阵 A A A 是什么?
( 3 − 3 − 3 5 ) \begin{pmatrix} 3 & -3 \\ -3 & 5 \end{pmatrix} ( 3 − 3 − 3 5 ) ( 3 − 6 − 6 5 ) \begin{pmatrix} 3 & -6 \\ -6 & 5 \end{pmatrix} ( 3 − 6 − 6 5 ) ( 3 0 − 6 5 ) \begin{pmatrix} 3 & 0 \\ -6 & 5 \end{pmatrix} ( 3 − 6 0 5 ) ( 3 3 3 5 ) \begin{pmatrix} 3 & 3 \\ 3 & 5 \end{pmatrix} ( 3 3 3 5 ) Q ( x , y ) = x 2 − 2 x y + y 2 Q(x,y) = x^2 - 2xy + y^2 Q ( x , y ) = x 2 − 2 x y + y 2 的惯性指数 ( n + , n − , n 0 ) (n_+, n_-, n_0) ( n + , n − , n 0 ) 是什么?
( 1 , 0 , 1 ) (1, 0, 1) ( 1 , 0 , 1 ) ( 2 , 0 , 0 ) (2, 0, 0) ( 2 , 0 , 0 ) ( 1 , 1 , 0 ) (1, 1, 0) ( 1 , 1 , 0 ) ( 0 , 2 , 0 ) (0, 2, 0) ( 0 , 2 , 0 ) 当一个实二次型在两组不同基下被对角化时,西尔维斯特惯性定理断言什么?
各个对角系数可能改变,但正、负、零系数的个数 ( n + , n − , n 0 ) (n_+, n_-, n_0) ( n + , n − , n 0 ) 保持不变 每个对角系数在两组基下的数值都必须完全相同 只有和 n + + n − n_+ + n_- n + + n − 不变,而 n + n_+ n + 与 n − n_- n − 可以互换 只有正交基变换才保持对角元的符号 若光滑函数 f ( x , y ) f(x,y) f ( x , y ) 在临界点处的海森矩阵二次型具有惯性指数 ( 2 , 0 , 0 ) (2,0,0) ( 2 , 0 , 0 ) ,则该临界点是什么类型?
严格局部极小点(曲面在所有方向向上弯曲) 严格局部极大点 鞍点 当 n 0 = 0 n_0=0 n 0 = 0 时判别法总是无法给出结论