方向导数衡量当输入沿指定方向移动时,函数在某一点的变化情况。在多元微积分中,它通过将函数限制在经过该点的一条直线上,推广了普通导数的概念。对于实值函数,方向导数是一个标量变化率;当方向向量的长度为一时,它衡量的是每单位距离的变化量。沿坐标轴方向的方向导数就是熟悉的偏导数。(ocw.mit.edu)
定义与约定
设 f:U→R,其中 U 是欧几里得空间 Rn 中的一个开集。在点 a∈U 处,沿向量 v 的方向导数定义为以下极限:
Dvf(a)=t→0limtf(a+tv)−f(a),
前提是该极限存在且为有限数。等价地,定义 g(t)=f(a+tv),就可以将问题归结为单变量导数 g′(0) 是否存在。此定义只涉及函数在这条特定直线上的取值。(math.ucdavis.edu)
常见的约定有两种。初等几何讨论通常要求使用单位向量 u,这样参数就表示有向距离。更一般的讨论则允许使用任意向量,其长度决定参数化的速度。对于非零向量 v,令 u=v/∥v∥,则只要其中任一方向导数存在,就有
Dvf(a)=∥v∥Duf(a).
因此,归一化虽然不改变移动方向,却会改变变化率的数值。这里的 ∥v∥ 表示欧几里得范数。(ocw.mit.edu)
与可微性及梯度的关系
如果 f 在 a 处可微,则它具有一阶近似:
f(a+h)=f(a)+Df(a)[h]+o(∥h∥),
其中 Df(a) 是一个线性映射。代入 h=tv,可得 Dvf(a)=Df(a)[v]。对于标量值函数,梯度通过欧几里得内积表示这一映射:
Dvf(a)=∇f(a)⋅v=i=1∑n∂xi∂f(a)vi.
特别地,选取一个标准坐标向量,就能得到相应的偏导数。可微性是这一通用公式成立的必要前提:仅有各坐标方向的偏导数存在,并不能保证存在一个对所有方向都有效的线性近似。(ocw.mit.edu)
这一公式也可以由链式法则推导出来。更一般地,如果可微曲线 γ 满足 γ(0)=a,则
dtdf(γ(t))t=0=∇f(a)⋅γ′(0).
因此,沿曲线路径的瞬时变化取决于该路径在这一点的速度,而非它之后的走向。(ocw.mit.edu)
几何解释与示例
对于二元函数,用沿方向 u 的竖直平面截取其图像,可得到一条截面曲线。方向导数就是该曲线的切线斜率。当 ∇f(a)=0 时,在所有单位向量方向上,方向导数的最大值为 ∥∇f(a)∥,在梯度方向上取得;最小值则为其相反数,在梯度的反方向上取得。与梯度垂直的方向,其一阶变化为零。这些方向与正则等值曲线或等值曲面相切。(ocw.mit.edu)
例如,考虑多项式
f(x,y)=x2+3y2.
在 a=(1,2) 处,其梯度为 (2,12)。沿单位向量 u=(3/5,4/5),直接代入梯度公式可得
Duf(1,2)=253+1254=554.
沿未经归一化的向量 v=(3,4),方向导数为 54。两者相差五倍,是因为 a+tv 的移动速度是 a+tu 的五倍。这一计算说明了每单位距离的变化率与每单位参数增量的变化率之间的区别。(ocw.mit.edu)
不可微时的方向导数
每个方向上的方向导数都存在,并不意味着函数可微,甚至不意味着函数连续。一个反例是
f(x,y)=⎩⎨⎧x2+y6xy3,0,(x,y)=(0,0),(x,y)=(0,0).
对于固定方向 v=(p,q),若 p=0,则
tf(tp,tq)=p2+t4q6tpq3⟶0.
若 p=0,该差商恒为零。因此,原点处所有方向导数都为零。然而,沿曲线路径 (x,y)=(s3,s),当 s=0 时,函数值为 1/2,所以它在原点处并不是连续函数。因此,逐个方向求得的极限未必能描述整个邻域内的行为。(math.ucdavis.edu)
优化与计算
在数学优化中,若可微的目标函数沿某个向量的方向导数为负,则沿该向量取足够小的正步长,必然会使函数值下降。这是梯度下降的基础:当梯度非零时,
D−∇f(a)f(a)=−∥∇f(a)∥2<0.
步长由线搜索另行选取;仅凭局部导数信息,无法确定一步应当走多远。(cs.cornell.edu)
对于可微的向量值函数 F:Rn→Rm,相应的方向导数为
DvF(a)=JF(a)v,
其中 JF(a) 是它的雅可比矩阵。前向模式自动微分通过在一系列运算中逐步传播方向上的变化,计算这类雅可比矩阵与向量的乘积。这样就能在不显式构造整个雅可比矩阵的情况下,求出沿指定方向的变化,包括在涉及机器学习模型的计算中。(docs.jax.dev)