← 返回 资料库 › 分析学 › 多元微积分 分析学
偏导数与梯度 多元函数沿各坐标方向的变化率,汇总起来构成梯度向量。
直观 弯曲地形上同时存在的两个坡度 想象站在一个山坡上,高度由二元函数 z = f ( x , y ) z = f(x,y) z = f ( x , y ) 给出,其中 x x x 指向正东,y y y 指向正北。与一元曲线不同,脚下并没有唯一的斜率:向正东迈步时高度按一种速率变化,向正北迈步时按另一种速率变化,而斜向迈步则会把两者结合起来。固定 y y y 、只让 x x x 变化,相当于用一个东西向的竖直平面切开山坡,把问题化归为熟悉的一元导数。
交互式三维曲面 z = f ( x , y ) z = f(x,y) z = f ( x , y ) :沿固定的 y y y 切开会看到斜率为 ∂ f ∂ x \frac{\partial f}{\partial x} ∂ x ∂ f 的曲线,沿固定的 x x x 切开则得到 ∂ f ∂ y \frac{\partial f}{\partial y} ∂ y ∂ f 。 大学 严格定义:偏导数、切平面与梯度 定义: 偏导数与梯度向量
设 f : U ⊆ R n → R f : U \subseteq \mathbb{R}^n \to \mathbb{R} f : U ⊆ R n → R 定义在开集 U U U 上。f f f 在点 a ∈ U a \in U a ∈ U 处关于 x i x_i x i 的偏导数记作 ∂ f ∂ x i ( a ) \frac{\partial f}{\partial x_i}(a) ∂ x i ∂ f ( a ) 或 f x i ( a ) f_{x_i}(a) f x i ( a ) ,是保持其余所有坐标 x j x_j x j (j ≠ i j \ne i j = i ) 不变时的极限。将全部 n n n 个偏导数合为一个向量,就得到梯度 ∇ f ( a ) = ( ∂ f ∂ x 1 ( a ) , … , ∂ f ∂ x n ( a ) ) \nabla f(a) = \left(\frac{\partial f}{\partial x_1}(a), \dots, \frac{\partial f}{\partial x_n}(a)\right) ∇ f ( a ) = ( ∂ x 1 ∂ f ( a ) , … , ∂ x n ∂ f ( a ) ) 。
∂ f ∂ x i ( a ) = lim h → 0 f ( a 1 , … , a i + h , … , a n ) − f ( a 1 , … , a n ) h \frac{\partial f}{\partial x_i}(a) = \lim_{h \to 0} \frac{f(a_1, \dots, a_i + h, \dots, a_n) - f(a_1, \dots, a_n)}{h} ∂ x i ∂ f ( a ) = h → 0 lim h f ( a 1 , … , a i + h , … , a n ) − f ( a 1 , … , a n ) 在 ( x 0 , y 0 ) (x_0,y_0) ( x 0 , y 0 ) 处仅仅存在偏导数比全微分可微性要弱。若当 ( h , k ) → ( 0 , 0 ) (h,k) \to (0,0) ( h , k ) → ( 0 , 0 ) 时,增量 Δ f = f ( x 0 + h , y 0 + k ) − f ( x 0 , y 0 ) \Delta f = f(x_0+h, y_0+k) - f(x_0,y_0) Δ f = f ( x 0 + h , y 0 + k ) − f ( x 0 , y 0 ) 可以写成 f x ( x 0 , y 0 ) h + f y ( x 0 , y 0 ) k + o ( h 2 + k 2 ) f_x(x_0,y_0)h + f_y(x_0,y_0)k + o\left(\sqrt{h^2+k^2}\right) f x ( x 0 , y 0 ) h + f y ( x 0 , y 0 ) k + o ( h 2 + k 2 ) ,则称函数 f ( x , y ) f(x,y) f ( x , y ) 在 ( x 0 , y 0 ) (x_0,y_0) ( x 0 , y 0 ) 处可微。当 f f f 可微时,图像 z = f ( x , y ) z = f(x,y) z = f ( x , y ) 在 ( x 0 , y 0 ) (x_0,y_0) ( x 0 , y 0 ) 处有良定义的切平面,且沿任意满足 ∥ u ∥ = 1 \|\mathbf{u}\| = 1 ∥ u ∥ = 1 的单位向量 u = ( u 1 , u 2 ) \mathbf{u} = (u_1, u_2) u = ( u 1 , u 2 ) 的方向导数由点积 D u f = ∇ f ⋅ u D_{\mathbf{u}}f = \nabla f \cdot \mathbf{u} D u f = ∇ f ⋅ u 给出。
z = f ( x 0 , y 0 ) + ∂ f ∂ x ( x 0 , y 0 ) ( x − x 0 ) + ∂ f ∂ y ( x 0 , y 0 ) ( y − y 0 ) , D u f ( x 0 , y 0 ) = ∇ f ( x 0 , y 0 ) ⋅ u z = f(x_0,y_0) + \frac{\partial f}{\partial x}(x_0,y_0)(x - x_0) + \frac{\partial f}{\partial y}(x_0,y_0)(y - y_0), \qquad D_{\mathbf{u}}f(x_0,y_0) = \nabla f(x_0,y_0) \cdot \mathbf{u} z = f ( x 0 , y 0 ) + ∂ x ∂ f ( x 0 , y 0 ) ( x − x 0 ) + ∂ y ∂ f ( x 0 , y 0 ) ( y − y 0 ) , D u f ( x 0 , y 0 ) = ∇ f ( x 0 , y 0 ) ⋅ u 多元微分算子与二阶量汇总 对象 公式 几何 / 物理意义 偏导数 ∂ f ∂ x i \frac{\partial f}{\partial x_i} ∂ x i ∂ f 沿坐标轴 x i x_i x i 截面的斜率。 梯度向量 ∇ f = ( f x 1 , … , f x n ) \nabla f = (f_{x_1}, \dots, f_{x_n}) ∇ f = ( f x 1 , … , f x n ) 垂直于等值集并指向最陡上升方向;范数 ∥ ∇ f ∥ \|\nabla f\| ∥∇ f ∥ 为最大变化率。 方向导数 D u f = ∇ f ⋅ u D_{\mathbf{u}}f = \nabla f \cdot \mathbf{u} D u f = ∇ f ⋅ u 以单位速度向量 u \mathbf{u} u 移动时的瞬时变化率。 海森矩阵与判别式 D = f x x f y y − f x y 2 D = f_{xx}f_{yy} - f_{xy}^2 D = f xx f y y − f x y 2 度量局部曲率,将驻点分类为极值点或鞍点。
大学 核心定理:最陡上升、施瓦茨对称性与海森判别法 若 f f f 在点 a a a 可微且 ∇ f ( a ) ≠ 0 \nabla f(a) \ne \mathbf{0} ∇ f ( a ) = 0 ,则对任意单位向量 u \mathbf{u} u (满足 ∥ u ∥ = 1 \|\mathbf{u}\| = 1 ∥ u ∥ = 1 ),方向导数满足 D u f ( a ) = ∇ f ( a ) ⋅ u = ∥ ∇ f ( a ) ∥ cos θ D_{\mathbf{u}}f(a) = \nabla f(a) \cdot \mathbf{u} = \|\nabla f(a)\| \cos\theta D u f ( a ) = ∇ f ( a ) ⋅ u = ∥∇ f ( a ) ∥ cos θ ,其中 θ \theta θ 是 ∇ f ( a ) \nabla f(a) ∇ f ( a ) 与 u \mathbf{u} u 之间的夹角。因此,当 u = ∇ f ( a ) ∥ ∇ f ( a ) ∥ \mathbf{u} = \frac{\nabla f(a)}{\|\nabla f(a)\|} u = ∥∇ f ( a ) ∥ ∇ f ( a ) 时,D u f ( a ) D_{\mathbf{u}}f(a) D u f ( a ) 取得最大值 ∥ ∇ f ( a ) ∥ \|\nabla f(a)\| ∥∇ f ( a ) ∥ ,在相反方向上取得最小值 − ∥ ∇ f ( a ) ∥ -\|\nabla f(a)\| − ∥∇ f ( a ) ∥ 。
为什么成立? 点积将梯度投影到所选的行进方向上:只有完全与梯度同向时才能获得梯度的全部模长,而垂直于梯度沿等高线行走时变化率为零。
证明 定义一元函数 g ( t ) = f ( a + t u ) g(t) = f(a + t\mathbf{u}) g ( t ) = f ( a + t u ) 。由方向导数的定义知 D u f ( a ) = g ′ ( 0 ) D_{\mathbf{u}}f(a) = g'(0) D u f ( a ) = g ′ ( 0 ) 。因为 f f f 在点 a a a 可微,当 t → 0 t \to 0 t → 0 时有 f ( a + t u ) − f ( a ) = ∇ f ( a ) ⋅ ( t u ) + o ( ∣ t ∣ ) f(a + t\mathbf{u}) - f(a) = \nabla f(a) \cdot (t\mathbf{u}) + o(|t|) f ( a + t u ) − f ( a ) = ∇ f ( a ) ⋅ ( t u ) + o ( ∣ t ∣ ) 。两边除以 t t t 并取 t → 0 t \to 0 t → 0 的极限,即得 D u f ( a ) = ∇ f ( a ) ⋅ u D_{\mathbf{u}}f(a) = \nabla f(a) \cdot \mathbf{u} D u f ( a ) = ∇ f ( a ) ⋅ u 。
由欧几里得内积的几何公式以及单位长度条件 ∥ u ∥ = 1 \|\mathbf{u}\| = 1 ∥ u ∥ = 1 ,可得 ∇ f ( a ) ⋅ u = ∥ ∇ f ( a ) ∥ ∥ u ∥ cos θ = ∥ ∇ f ( a ) ∥ cos θ \nabla f(a) \cdot \mathbf{u} = \|\nabla f(a)\|\,\|\mathbf{u}\|\cos\theta = \|\nabla f(a)\|\cos\theta ∇ f ( a ) ⋅ u = ∥∇ f ( a ) ∥ ∥ u ∥ cos θ = ∥∇ f ( a ) ∥ cos θ 。由于 − 1 ≤ cos θ ≤ 1 -1 \le \cos\theta \le 1 − 1 ≤ cos θ ≤ 1 ,最大值 ∥ ∇ f ( a ) ∥ \|\nabla f(a)\| ∥∇ f ( a ) ∥ 唯一地在 θ = 0 \theta = 0 θ = 0 即 u = ∇ f ( a ) ∥ ∇ f ( a ) ∥ \mathbf{u} = \frac{\nabla f(a)}{\|\nabla f(a)\|} u = ∥∇ f ( a ) ∥ ∇ f ( a ) 处取得,最小值 − ∥ ∇ f ( a ) ∥ -\|\nabla f(a)\| − ∥∇ f ( a ) ∥ 在 θ = π \theta = \pi θ = π 处取得。
若 f ( x , y ) f(x,y) f ( x , y ) 在 ( x 0 , y 0 ) (x_0,y_0) ( x 0 , y 0 ) 的某邻域内具有连续二阶偏导数,则 ∂ 2 f ∂ x ∂ y ( x 0 , y 0 ) = ∂ 2 f ∂ y ∂ x ( x 0 , y 0 ) \frac{\partial^2 f}{\partial x\partial y}(x_0,y_0) = \frac{\partial^2 f}{\partial y\partial x}(x_0,y_0) ∂ x ∂ y ∂ 2 f ( x 0 , y 0 ) = ∂ y ∂ x ∂ 2 f ( x 0 , y 0 ) 。此外,若 ∇ f ( x 0 , y 0 ) = 0 \nabla f(x_0,y_0) = \mathbf{0} ∇ f ( x 0 , y 0 ) = 0 且记 D = f x x ( x 0 , y 0 ) f y y ( x 0 , y 0 ) − f x y ( x 0 , y 0 ) 2 D = f_{xx}(x_0,y_0)f_{yy}(x_0,y_0) - f_{xy}(x_0,y_0)^2 D = f xx ( x 0 , y 0 ) f y y ( x 0 , y 0 ) − f x y ( x 0 , y 0 ) 2 ,则当 D > 0 D > 0 D > 0 且 f x x > 0 f_{xx} > 0 f xx > 0 时 ( x 0 , y 0 ) (x_0,y_0) ( x 0 , y 0 ) 为严格局部极小值点;当 D > 0 D > 0 D > 0 且 f x x < 0 f_{xx} < 0 f xx < 0 时为严格局部极大值点;当 D < 0 D < 0 D < 0 时为鞍点。
为什么成立? 混合偏导数的对称性保证了海森矩阵是对称矩阵,对其二次型配方即可看出曲面在水平切平面附近是向上凹陷如碗、向下拱起如穹顶,还是像马鞍一样扭曲。
证明 对非零小量 h , k h, k h , k ,考虑二阶差分 Δ ( h , k ) = f ( x 0 + h , y 0 + k ) − f ( x 0 + h , y 0 ) − f ( x 0 , y 0 + k ) + f ( x 0 , y 0 ) \Delta(h,k) = f(x_0+h,y_0+k) - f(x_0+h,y_0) - f(x_0,y_0+k) + f(x_0,y_0) Δ ( h , k ) = f ( x 0 + h , y 0 + k ) − f ( x 0 + h , y 0 ) − f ( x 0 , y 0 + k ) + f ( x 0 , y 0 ) 。先对 [ x 0 , x 0 + h ] [x_0, x_0+h] [ x 0 , x 0 + h ] 上的 g ( x ) = f ( x , y 0 + k ) − f ( x , y 0 ) g(x) = f(x,y_0+k) - f(x,y_0) g ( x ) = f ( x , y 0 + k ) − f ( x , y 0 ) 应用一元中值定理,再沿 y y y 对 f x f_x f x 应用中值定理,得 Δ ( h , k ) = h k f y x ( c 1 , d 1 ) \Delta(h,k) = hk\,f_{yx}(c_1, d_1) Δ ( h , k ) = hk f y x ( c 1 , d 1 ) ;按相反顺序应用则得 Δ ( h , k ) = h k f x y ( c 2 , d 2 ) \Delta(h,k) = hk\,f_{xy}(c_2, d_2) Δ ( h , k ) = hk f x y ( c 2 , d 2 ) ,其中各中间点均收敛于 ( x 0 , y 0 ) (x_0,y_0) ( x 0 , y 0 ) 。令两者相等并利用连续性取极限 ( h , k ) → ( 0 , 0 ) (h,k) \to (0,0) ( h , k ) → ( 0 , 0 ) ,即证得 ∂ 2 f ∂ x ∂ y ( x 0 , y 0 ) = ∂ 2 f ∂ y ∂ x ( x 0 , y 0 ) \frac{\partial^2 f}{\partial x\partial y}(x_0,y_0) = \frac{\partial^2 f}{\partial y\partial x}(x_0,y_0) ∂ x ∂ y ∂ 2 f ( x 0 , y 0 ) = ∂ y ∂ x ∂ 2 f ( x 0 , y 0 ) 。
在满足 ∇ f ( x 0 , y 0 ) = 0 \nabla f(x_0,y_0) = \mathbf{0} ∇ f ( x 0 , y 0 ) = 0 的驻点处,泰勒公式给出 f ( x 0 + h , y 0 + k ) − f ( x 0 , y 0 ) = 1 2 Q ( h , k ) + o ( h 2 + k 2 ) f(x_0+h,y_0+k) - f(x_0,y_0) = \frac{1}{2}Q(h,k) + o(h^2+k^2) f ( x 0 + h , y 0 + k ) − f ( x 0 , y 0 ) = 2 1 Q ( h , k ) + o ( h 2 + k 2 ) ,其中 Q ( h , k ) = f x x h 2 + 2 f x y h k + f y y k 2 Q(h,k) = f_{xx}h^2 + 2f_{xy}hk + f_{yy}k^2 Q ( h , k ) = f xx h 2 + 2 f x y hk + f y y k 2 。当 f x x ≠ 0 f_{xx} \ne 0 f xx = 0 时,配方可得 Q ( h , k ) = 1 f x x [ ( f x x h + f x y k ) 2 + D k 2 ] Q(h,k) = \frac{1}{f_{xx}}\left[(f_{xx}h + f_{xy}k)^2 + Dk^2\right] Q ( h , k ) = f xx 1 [ ( f xx h + f x y k ) 2 + D k 2 ] ,其中 D = f x x f y y − f x y 2 D = f_{xx}f_{yy} - f_{xy}^2 D = f xx f y y − f x y 2 。若 D > 0 D > 0 D > 0 ,方括号内的和在任意 ( h , k ) ≠ ( 0 , 0 ) (h,k) \ne (0,0) ( h , k ) = ( 0 , 0 ) 处严格为正,故 Q ( h , k ) Q(h,k) Q ( h , k ) 的符号与 f x x f_{xx} f xx 一致(f x x > 0 f_{xx} > 0 f xx > 0 时为严格极小,f x x < 0 f_{xx} < 0 f xx < 0 时为严格极大)。若 D < 0 D < 0 D < 0 ,则 Q ( h , k ) Q(h,k) Q ( h , k ) 沿过原点的不同直线可正可负,从而形成鞍点。
大学 实际应用与典型例题 偏导数与梯度驱动着现代科学与工程:在物理学中,傅里叶热传导定律指出热流密度正比于负温度梯度 − ∇ T -\nabla T − ∇ T ;在机器学习中,训练神经网络通过不断沿负梯度 − ∇ L ( θ ) -\nabla L(\theta) − ∇ L ( θ ) 迈步来最小化损失函数 L ( θ ) L(\theta) L ( θ ) (梯度下降法);而在经济学与力学中,海森判别法用于区分稳定平衡态(势能的局部极小值)与不稳定的鞍点。
例题: 温度场的方向导数与最陡上升方向
一块金属板在坐标 ( x , y ) (x,y) ( x , y ) (单位:米)处的温度为 T ( x , y ) = x 2 + 3 x y + y 3 T(x,y) = x^2 + 3xy + y^3 T ( x , y ) = x 2 + 3 x y + y 3 (单位:摄氏度)。求点 ( 1 , 2 ) (1,2) ( 1 , 2 ) 处的梯度 ∇ T ( 1 , 2 ) \nabla T(1,2) ∇ T ( 1 , 2 ) 、沿向量 v = ( 3 , 4 ) \mathbf{v} = (3,4) v = ( 3 , 4 ) 方向的方向导数,以及点 ( 1 , 2 ) (1,2) ( 1 , 2 ) 处温度的最大增长率。
解答 首先,固定一个变量对另一个变量求导,计算偏导数:T x ( x , y ) = 2 x + 3 y T_x(x,y) = 2x + 3y T x ( x , y ) = 2 x + 3 y 和 T y ( x , y ) = 3 x + 3 y 2 T_y(x,y) = 3x + 3y^2 T y ( x , y ) = 3 x + 3 y 2 。代入点 ( 1 , 2 ) (1,2) ( 1 , 2 ) 得 T x ( 1 , 2 ) = 2 ( 1 ) + 3 ( 2 ) = 8 T_x(1,2) = 2(1) + 3(2) = 8 T x ( 1 , 2 ) = 2 ( 1 ) + 3 ( 2 ) = 8 及 T y ( 1 , 2 ) = 3 ( 1 ) + 3 ( 2 ) 2 = 15 T_y(1,2) = 3(1) + 3(2)^2 = 15 T y ( 1 , 2 ) = 3 ( 1 ) + 3 ( 2 ) 2 = 15 ,因此梯度向量为 ∇ T ( 1 , 2 ) = ( 8 , 15 ) \nabla T(1,2) = (8, 15) ∇ T ( 1 , 2 ) = ( 8 , 15 ) 。
接着,由于 ∥ v ∥ = 3 2 + 4 2 = 5 \|\mathbf{v}\| = \sqrt{3^2+4^2} = 5 ∥ v ∥ = 3 2 + 4 2 = 5 ,将 v = ( 3 , 4 ) \mathbf{v} = (3,4) v = ( 3 , 4 ) 单位化得到单位方向向量 u = v ∥ v ∥ = ( 3 5 , 4 5 ) \mathbf{u} = \frac{\mathbf{v}}{\|\mathbf{v}\|} = \left(\frac{3}{5}, \frac{4}{5}\right) u = ∥ v ∥ v = ( 5 3 , 5 4 ) 。方向导数为 D u T ( 1 , 2 ) = ∇ T ( 1 , 2 ) ⋅ u = 8 ⋅ 3 5 + 15 ⋅ 4 5 = 84 5 = 16.8 D_{\mathbf{u}}T(1,2) = \nabla T(1,2) \cdot \mathbf{u} = 8 \cdot \frac{3}{5} + 15 \cdot \frac{4}{5} = \frac{84}{5} = 16.8 D u T ( 1 , 2 ) = ∇ T ( 1 , 2 ) ⋅ u = 8 ⋅ 5 3 + 15 ⋅ 5 4 = 5 84 = 16.8 。点 ( 1 , 2 ) (1,2) ( 1 , 2 ) 处的最大增长率沿 ∇ T ( 1 , 2 ) \nabla T(1,2) ∇ T ( 1 , 2 ) 方向取得,等于 ∥ ∇ T ( 1 , 2 ) ∥ = 8 2 + 15 2 = 289 = 17 \|\nabla T(1,2)\| = \sqrt{8^2 + 15^2} = \sqrt{289} = 17 ∥∇ T ( 1 , 2 ) ∥ = 8 2 + 1 5 2 = 289 = 17 摄氏度每米。
例题: 用海森行列式分类驻点
利用二阶导数海森判别法求出并分类函数 f ( x , y ) = x 3 + y 3 − 3 x y f(x,y) = x^3 + y^3 - 3xy f ( x , y ) = x 3 + y 3 − 3 x y 的所有驻点。
解答 令两个一阶偏导数同时为零:f x ( x , y ) = 3 x 2 − 3 y = 0 f_x(x,y) = 3x^2 - 3y = 0 f x ( x , y ) = 3 x 2 − 3 y = 0 且 f y ( x , y ) = 3 y 2 − 3 x = 0 f_y(x,y) = 3y^2 - 3x = 0 f y ( x , y ) = 3 y 2 − 3 x = 0 。由第一式得 y = x 2 y = x^2 y = x 2 ,代入第二式得 3 ( x 2 ) 2 − 3 x = 3 x ( x 3 − 1 ) = 0 3(x^2)^2 - 3x = 3x(x^3 - 1) = 0 3 ( x 2 ) 2 − 3 x = 3 x ( x 3 − 1 ) = 0 ,实数解为 x = 0 x = 0 x = 0 和 x = 1 x = 1 x = 1 。因此两个驻点为 ( 0 , 0 ) (0,0) ( 0 , 0 ) 和 ( 1 , 1 ) (1,1) ( 1 , 1 ) 。
接着计算二阶偏导数:f x x = 6 x f_{xx} = 6x f xx = 6 x ,f y y = 6 y f_{yy} = 6y f y y = 6 y ,f x y = − 3 f_{xy} = -3 f x y = − 3 ,从而海森判别式为 D ( x , y ) = f x x f y y − f x y 2 = 36 x y − 9 D(x,y) = f_{xx}f_{yy} - f_{xy}^2 = 36xy - 9 D ( x , y ) = f xx f y y − f x y 2 = 36 x y − 9 。在 ( 0 , 0 ) (0,0) ( 0 , 0 ) 处,D ( 0 , 0 ) = − 9 < 0 D(0,0) = -9 < 0 D ( 0 , 0 ) = − 9 < 0 ,故 ( 0 , 0 ) (0,0) ( 0 , 0 ) 是鞍点。在 ( 1 , 1 ) (1,1) ( 1 , 1 ) 处,D ( 1 , 1 ) = 36 − 9 = 27 > 0 D(1,1) = 36 - 9 = 27 > 0 D ( 1 , 1 ) = 36 − 9 = 27 > 0 且 f x x ( 1 , 1 ) = 6 > 0 f_{xx}(1,1) = 6 > 0 f xx ( 1 , 1 ) = 6 > 0 ,故 ( 1 , 1 ) (1,1) ( 1 , 1 ) 是严格局部极小值点,极小值为 f ( 1 , 1 ) = − 1 f(1,1) = -1 f ( 1 , 1 ) = − 1 。
常见错误. 两个常见误区:(1) 在计算 D u f = ∇ f ⋅ u D_{\mathbf{u}}f = \nabla f \cdot \mathbf{u} D u f = ∇ f ⋅ u 之前,务必先将方向向量 u \mathbf{u} u 单位化使其满足 ∥ u ∥ = 1 \|\mathbf{u}\| = 1 ∥ u ∥ = 1 ;直接与未单位化的向量做点积会使结果被乘上因子 ∥ u ∥ \|\mathbf{u}\| ∥ u ∥ 。(2) 某点处 f x f_x f x 和 f y f_y f y 存在并不意味着 f f f 在该点连续或可微——例如 f ( x , y ) = x y x 2 + y 2 f(x,y) = \frac{xy}{x^2+y^2} f ( x , y ) = x 2 + y 2 x y (规定 f ( 0 , 0 ) = 0 f(0,0)=0 f ( 0 , 0 ) = 0 )满足 f x ( 0 , 0 ) = f y ( 0 , 0 ) = 0 f_x(0,0) = f_y(0,0) = 0 f x ( 0 , 0 ) = f y ( 0 , 0 ) = 0 ,但在 ( 0 , 0 ) (0,0) ( 0 , 0 ) 处并不连续。 历史注记
偏导数诞生于18世纪40至50年代,当时莱昂哈德·欧拉与克莱罗在研究弦振动与流体运动时发现了对称条件 ∂ 2 f ∂ x ∂ y = ∂ 2 f ∂ y ∂ x \frac{\partial^2 f}{\partial x\partial y} = \frac{\partial^2 f}{\partial y\partial x} ∂ x ∂ y ∂ 2 f = ∂ y ∂ x ∂ 2 f 。约瑟夫-路易·拉格朗日在《分析力学》(1788年)中系统化了多元极值理论,而奥古斯丁-路易·柯西则在1847年为求解天文学方程提出了最速下降法。
莱昂哈德·欧拉 约瑟夫-路易·拉格朗日 奥古斯丁-路易·柯西
设函数 f ( x , y ) = x 3 y 2 − 4 x + 5 y f(x,y) = x^3 y^2 - 4x + 5y f ( x , y ) = x 3 y 2 − 4 x + 5 y ,求梯度向量 ∇ f ( 1 , 2 ) \nabla f(1, 2) ∇ f ( 1 , 2 ) 。
( 8 , 9 ) (8, 9) ( 8 , 9 ) ( 12 , 9 ) (12, 9) ( 12 , 9 ) ( 8 , 4 ) (8, 4) ( 8 , 4 ) ( 9 , 8 ) (9, 8) ( 9 , 8 ) 若 ∇ f ( x 0 , y 0 ) = ( 6 , − 8 ) \nabla f(x_0, y_0) = (6, -8) ∇ f ( x 0 , y 0 ) = ( 6 , − 8 ) ,则在所有单位向量 u \mathbf{u} u 上方向导数 D u f ( x 0 , y 0 ) D_{\mathbf{u}}f(x_0, y_0) D u f ( x 0 , y 0 ) 的可能最大值是多少?
− 2 -2 − 2 10 10 10 14 14 14 100 100 100 在机器学习中,梯度下降法通过更新参数 θ \theta θ 来最小化可微损失函数 L ( θ ) L(\theta) L ( θ ) 。下列哪个更新公式使 θ \theta θ 沿 L L L 局部下降最快的方向移动?
θ new = θ − η ∇ L ( θ ) \theta_{\text{new}} = \theta - \eta \nabla L(\theta) θ new = θ − η ∇ L ( θ ) ,其中学习率 η > 0 \eta > 0 η > 0 θ new = θ + η ∇ L ( θ ) \theta_{\text{new}} = \theta + \eta \nabla L(\theta) θ new = θ + η ∇ L ( θ ) ,其中学习率 η > 0 \eta > 0 η > 0 θ new = ∇ L ( θ ) \theta_{\text{new}} = \nabla L(\theta) θ new = ∇ L ( θ ) ,其中学习率 η > 0 \eta > 0 η > 0 θ new = θ / ∥ ∇ L ( θ ) ∥ \theta_{\text{new}} = \theta / \|\nabla L(\theta)\| θ new = θ /∥∇ L ( θ ) ∥ ,其中学习率 η > 0 \eta > 0 η > 0 设 ( x 0 , y 0 ) (x_0, y_0) ( x 0 , y 0 ) 是光滑函数 f ( x , y ) f(x,y) f ( x , y ) 的驻点,且 f x x ( x 0 , y 0 ) = − 4 f_{xx}(x_0,y_0) = -4 f xx ( x 0 , y 0 ) = − 4 ,f y y ( x 0 , y 0 ) = − 3 f_{yy}(x_0,y_0) = -3 f y y ( x 0 , y 0 ) = − 3 ,f x y ( x 0 , y 0 ) = 2 f_{xy}(x_0,y_0) = 2 f x y ( x 0 , y 0 ) = 2 。点 ( x 0 , y 0 ) (x_0, y_0) ( x 0 , y 0 ) 应如何分类?
严格局部极小值点 严格局部极大值点 鞍点 二阶导数判别法无法判定