矩阵的迹是将方阵的主对角线元素相加得到的标量。这里的方阵是一种行数与列数相等的矩阵。迹通常记作 tr(A) 或 Tr(A),是线性代数中的一项基本运算。尽管迹是通过矩阵元素定义的,但它不随基的改变而改变,并且等于矩阵的所有特征值按代数重数计算后的总和。因此,迹描述的是矩阵所表示的线性算子的内在性质,而不仅仅是其坐标表示的性质。(learning.quantum.ibm.com)
定义与基本性质
对于一个 n×n 矩阵 A=(aij),
tr(A)=i=1∑naii.
例如,
A=(2−173)⟹tr(A)=2+3=5.
只有主对角线元素直接参与求和。这个定义适用于实数、复数以及更一般的域(数学)上的矩阵。(online.stat.psu.edu)
迹具有线性性:对于同型矩阵 A,B 和标量 α,β,
tr(αA+βB)=αtr(A)+βtr(B).
因此,迹是定义在方阵构成的向量空间上的标量值线性映射。单位矩阵 In 的迹为 n,零矩阵的迹为零。矩阵转置不改变迹:
tr(AT)=tr(A).
这些恒等式都可以直接通过对主对角线元素求和得到。(learning.quantum.ibm.com)
循环性与基无关性
一个特别有用的恒等式是
tr(AB)=tr(BA).
即使 A 为 m×n 矩阵、B 为 n×m 矩阵,这个恒等式仍然成立,因此两个乘积不必具有相同的大小。展开主对角线元素之和,即可直接证明:
tr(AB)=i=1∑mj=1∑naijbji=tr(BA).
更一般地,只要各因子的维数相容,就可以循环移动因子:
tr(ABC)=tr(BCA)=tr(CAB).
但这并不意味着可以任意改变因子的顺序;一般而言,tr(ABC)=tr(ACB)。(ericdarve.github.io)
对于任意可逆矩阵 S,由循环性可得
tr(S−1AS)=tr(ASS−1)=tr(A).
矩阵 A 与 S−1AS 是同一个线性变换在不同基(线性代数)下的表示。因此,有限维空间上算子的迹可以通过它的任意矩阵表示来定义。正是这种基无关性,使迹在不依赖坐标的表述中发挥重要作用。(ericdarve.github.io)
特征值与特征多项式
设 λ1,…,λn 是一个复方阵的特征值,每个特征值按其代数重数重复计入,则
tr(A)=λ1+⋯+λn.
对于实矩阵,也必须将非实特征值计入。行列式是这些特征值的乘积,而迹则是它们的和。当矩阵的阶数大于二时,这两个量中的任何一个都不能单独确定全部特征值。(math.mit.edu)
上述恒等式不要求矩阵能够进行矩阵对角化。采用约定
pA(t)=det(tI−A),
则特征多项式的前几项为
pA(t)=tn−tr(A)tn−1+⋯.
将它在复数域上分解为一次因子的乘积,就可以看出 tn−1 的系数是所有根之和的相反数。对于 2×2 矩阵,由此得到完整公式
pA(t)=t2−tr(A)t+det(A).
因此,迹与行列式共同确定了两个特征值及其重数。(math.mit.edu)
内积与微分
对于同型实矩阵 A,B,
⟨A,B⟩F=tr(ATB)=i,j∑aijbij.
这就是弗罗贝尼乌斯内积,其对应范数的平方为
∥A∥F2=tr(ATA).
对于复矩阵,将转置替换为共轭转置 A∗,即可得到 tr(A∗B)。因此,迹可以将逐元素求和写成简洁的矩阵表达式。(math.uwaterloo.ca)
在数学优化中,这种记法也能简化求导。对于实矩阵变量 X,采用逐元素定义梯度的约定,有
∇Xtr(CTX)=C,∇Xtr(XTX)=2X.
第二个恒等式是对矩阵误差平方项和二次惩罚项求导的基础。(math.uwaterloo.ca)
统计学与量子力学中的应用
对于协方差矩阵为 Σ 的实随机向量,Σ 的迹等于各分量的方差之和。若其均值为 μ,且二阶矩有限,则
E[∥X−μ∥2]=tr(Σ).
更一般地,对于固定的实对称矩阵 A,
E[XTAX]=tr(AΣ)+μTAμ.
这些公式将迹与二次表达式的期望值联系起来,而不要求随机向量服从正态分布。(math.uwaterloo.ca)
在有限维量子力学中,密度矩阵 ρ 是半正定矩阵,并满足归一化条件 tr(ρ)=1。对于用 O 表示的可观测量,其期望值为 tr(ρO)。与迹相关的偏迹运算会从复合系统的描述中消去一个子系统,得到剩余子系统的密度矩阵,而不是一个标量。(learning.quantum.ibm.com)
计算与估计
如果可以直接获取主对角线元素,计算迹只需将这些元素相加:对于 n×n 矩阵,需要 n−1 次加法。因此,没有必要仅为求迹而计算特征值。这一运算次数可以直接由定义得出。(online.stat.psu.edu)
对于主要通过矩阵与向量的乘积来访问的大型矩阵,随机估计提供了另一种方法。若实随机向量 z 满足 E[zzT]=I,则
E[zTAz]=tr(A).
对多次独立计算的结果取平均,就能得到迹的无偏估计。哈钦森型方法利用这样的二次型,避免显式构造矩阵,包括科学计算中出现的大型导数矩阵。(arxiv.org)