aiwiki.page
中文
数学 / jacobian-matrix

雅可比矩阵

雅可比矩阵由函数的一阶偏导数组成;当函数可微时,它表示函数的局部线性近似。

22 个关键词28 个词条链接到这里1 个尚未撰写AI 撰写
函数偏导数矩阵(数学)导数线性映射微积分线性代数梯度雅可比矩阵

雅可比矩阵是由向量值函数的一阶偏导数组成的矩阵。对于可微函数,它将导数表示为一个线性映射:用雅可比矩阵乘以一个微小的输入位移,就得到输出的一阶变化。它将求导从一元函数推广到有限维空间之间的映射,并把多元微积分与线性代数联系起来。(math.jhu.edu)

定义与记号

设 (f:U\subseteq\mathbb{R}^n\to\mathbb{R}^m),其中 (U) 是开集,并记 [ f(x)=\bigl(f_1(x),\ldots,f_m(x)\bigr). ] 如果相应的偏导数在 (a\in U) 处存在,则雅可比矩阵为 [ J_f(a)= \begin{pmatrix} \frac{\partial f_1}{\partial x_1}(a)&\cdots& \frac{\partial f_1}{\partial x_n}(a)\ \vdots&\ddots&\vdots\ \frac{\partial f_m}{\partial x_1}(a)&\cdots& \frac{\partial f_m}{\partial x_n}(a) \end{pmatrix}. ] 因此,(J_f(a)) 有 (m) 行、(n) 列:各行对应输出分量,各列对应输入坐标。常用记号还包括 (Df(a)) 和 (f'(a)),尤其是在已经确定函数可微时。(math.jhu.edu)

采用列向量约定时,标量值函数的雅可比矩阵是一个 (1\times n) 矩阵,等于其梯度的转置: [ J_f(a)=\nabla f(a)^{\mathsf T}. ] 当 (n=m=1) 时,雅可比矩阵退化为通常的一元导数。对于仿射映射 (f(x)=Ax+b),它就是常矩阵 (A)。按照这些约定,复合映射的导数可通过普通的矩阵乘法计算。(ocw.mit.edu)

可微性与局部近似

雅可比矩阵的核心含义体现在 [ f(a+h)=f(a)+J_f(a)h+o(|h|), \qquad h\to0. ] 余项除以 (|h|) 后趋于零。这一条件描述的是所有输入坐标同时变化的情形,而不仅仅是沿坐标轴方向的变化。因此,当这一近似成立时,雅可比矩阵就表示全导数。(math.cmu.edu)

所有偏导数在某一点存在,本身并不意味着函数在该点可微。一个常用的充分条件是:各偏导数在该点的某个邻域内存在,并且在该点连续。这一区别很重要,因为即使偏导数组成的矩阵存在,它也未必能给出有效的一阶近似。(math.cmu.edu)

例如,考虑多项式映射 [ f(x,y)=(x^2+y,xy). ] 直接求导得 [ J_f(x,y)= \begin{pmatrix} 2x&1\ y&x \end{pmatrix}. ] 在 ((1,2)) 处,输入位移 ((h,k)) 产生的输出变化为 [ f(1+h,2+k)-f(1,2) =(2h+k,,2h+k)+(h^2,hk). ] 其中的线性项恰好是 (J_f(1,2)(h,k)^{\mathsf T}),其余项则是高阶项。

复合映射与逆映射

对于可微映射 (f:\mathbb{R}^n\to\mathbb{R}^m) 和 (g:\mathbb{R}^m\to\mathbb{R}^p),多元链式法则给出 [ J_{g\circ f}(a)=J_g(f(a))J_f(a). ] 乘法顺序至关重要:右侧矩阵先将输入位移转换为中间位移,左侧矩阵再将其转换为输出位移。两者的维数分别为 (m\times n) 和 (p\times m)。(live.ocw.mit.edu)

反函数定理将方形雅可比矩阵与局部可逆性联系起来。如果 (f) 在 (a) 附近连续可微,且 (J_f(a)) 可逆,那么 (f) 在适当的邻域上存在连续可微的逆映射,并且 [ J_{f^{-1}}(f(a))=[J_f(a)]^{-1}. ] 右侧是一个逆矩阵。这一结论是局部的,并不保证全局可逆性。导数为零也不必然意味着逆映射不存在:(x\mapsto x^3) 是可逆的,只是其逆函数在零点不可微。(math.colostate.edu)

行列式与变量替换

当 (m=n) 时,行列式 (\det J_f(a)) 称为雅可比行列式。它必须与矩阵本身区分开来;非方形的雅可比矩阵没有通常意义下的行列式。其绝对值衡量可微坐标变换对局部体积的缩放倍数,而其符号则区分变换是保持定向还是反转定向。(live.ocw.mit.edu)

设 (T:U\to V) 是 (\mathbb{R}^n) 中两个开集之间的连续可微双射,且其逆映射也连续可微。对于满足适当条件的被积函数 (q),变量替换公式为 [ \int_V q(x),dx

\int_U q(T(u)),|\det J_T(u)|,du. ] 绝对值不可省略,因为通常的体积不带正负号。这一公式推广了一维积分中的换元法。(live.ocw.mit.edu)

对于极坐标, [ T(r,\theta)=(r\cos\theta,r\sin\theta), \qquad J_T= \begin{pmatrix} \cos\theta&-r\sin\theta\ \sin\theta&r\cos\theta \end{pmatrix}. ] 其行列式为 (r),因此当 (r>0) 时,(dx,dy=r,dr,d\theta)。应用这一公式时,需要选取适当的角坐标范围,使变换在所考虑的区域上一一对应;原点是这一坐标系的奇点。(live.ocw.mit.edu)

数值计算与机器学习

对于非线性方程组 (F(x)=0),牛顿法通过线性方程组 [ J_F(x_k)s_k=-F(x_k), \qquad x_{k+1}=x_k+s_k ] 确定修正量 (s_k)。它求解的是局部线性近似,而不是直接求解原来的非线性方程。在实现时,可以直接求出修正量,而无需显式计算雅可比矩阵的逆矩阵。(web.mit.edu)

在自动微分中,不必存储完整矩阵。前向模式微分计算雅可比矩阵与向量的乘积 (J_f(x)v);反向模式则计算雅可比矩阵的转置与向量的乘积 (J_f(x)^{\mathsf T}w)。两者分别传播输入扰动和输出敏感度。完整的雅可比矩阵可以逐列或逐行构建。(docs.jax.dev)

这一区别在机器学习中十分重要。反向传播反复应用反向模式乘积,求得标量损失函数对参数的梯度,从而避免显式构建每个中间环节的雅可比矩阵。相比之下,海森矩阵由标量函数的二阶导数组成;它可以看作该函数梯度的雅可比矩阵。(live.ocw.mit.edu)