00 · Global map
先把四个对象彻底分开:变换、微分、矩阵、行列式
许多“雅可比很乱”的根源,不在计算,而在于把不同层次的对象混成了一个词。只要先分层,后面的几何意义和公式都会自然归位。
层次一完整变换 \(T\)
它回答“一个点最后被送到哪里”。这是全局、非线性的对象;不同位置可以有完全不同的弯曲和伸缩。
层次二微分 \(\mathrm dT_P\)
它回答“从点 \(P\) 出发的一小步,会被变成怎样的一小步”。这是与坐标无关的局部线性映射。
层次三雅可比矩阵 \(J_T(P)\)
给输入、输出空间选定坐标基底后,\(\mathrm dT_P\) 便写成一个矩阵。矩阵数字会随坐标改变,几何线性映射本身不变。
层次四雅可比行列式 \(\det J_T(P)\)
只有输入、输出维数相同且矩阵为方阵时才能取普通行列式。它只记录有向面积或体积倍率。
符号警告“雅可比”在教材里常有歧义
考研教材常把 \(\dfrac{\partial(x,y)}{\partial(u,v)}\) 专指行列式;高位视角下应主动区分“雅可比矩阵”和“雅可比行列式”。
最高层真正根本的是“变化关系”
矩阵只是把变化关系编码下来;行列式又是矩阵的一个标量摘要。不要倒过来把行列式误当成全部雅可比。
∴
本页的母句
若 \(\boldsymbol y=T(\boldsymbol x)\),则在点 \(P\) 附近:\[T(P+\Delta\boldsymbol x)-T(P)=J_T(P)\,\Delta\boldsymbol x+o(\|\Delta\boldsymbol x\|).\]这不是一个“便于计算的近似公式”,而是多元可微的定义性结构:非线性世界在一点的第一层真相是线性的。
01 · Local linearization
局部线性化:把非线性变换放到显微镜下
整体网格可能弯曲,但围绕某一点取越来越小的方块,其像会越来越接近一个平行四边形。那个把小方块线性地送到平行四边形的变换,就是该点的雅可比矩阵。
互动实验 1:真实非线性像 vs. 雅可比线性像
拖动输入平面中的点,缩小局部方块。右侧实线是非线性变换的真实像,虚线是雅可比给出的线性近似。
可拖动 · 可切换退化点
1. “线性化”到底线性在哪里
设二维变换为
\[T(u,v)=\begin{pmatrix}x(u,v)\\y(u,v)\end{pmatrix}.\]
在 \(P=(u_0,v_0)\) 处作小位移 \(\Delta\boldsymbol q=(\Delta u,\Delta v)^{\mathsf T}\)。若变换在此可微,则
\[\Delta\boldsymbol p=\begin{pmatrix}\Delta x\\\Delta y\end{pmatrix}=J_T(P)\begin{pmatrix}\Delta u\\\Delta v\end{pmatrix}+\boldsymbol r(\Delta\boldsymbol q),\qquad \frac{\|\boldsymbol r(\Delta\boldsymbol q)\|}{\|\Delta\boldsymbol q\|}\to0.\]
雅可比并不是宣称真实变换等于线性变换,而是说:当观察尺度缩小时,非线性余项相对于位移长度越来越不重要。上方实验里的“最大余项 / ε”正是在数值观察这个比值。
可微的统一性
同一个矩阵必须同时近似所有足够小的位移方向。不是每条射线各有一个自己的线性规则,而是整个小邻域共享一个线性规则。
只看几条方向不够
若只沿若干固定方向观察,很可能错过曲线路径或方向随尺度变化的情况。多元可微要求对全部小位移统一控制。
为什么说“真正的对象是微分,矩阵只是坐标表达”
在欧氏空间里,我们习惯把一个小位移写成坐标列向量。但如果换了输入基底或输出基底,同一个几何小位移的坐标会改变,于是表示 \(\mathrm dT_P\) 的矩阵数字也会改变。
若输入向量满足“旧坐标 \(=B\cdot\) 新坐标”,输出向量满足“旧坐标 \(=C\cdot\) 新坐标”,则同一个线性映射的新矩阵为
\[J_{\text{new}}=C^{-1}J_{\text{old}}B.\]
因此不要把某一组矩阵数字当成绝对几何实体。绝对的是“哪一个输入切向量被送成哪一个输出切向量”。矩阵是把这件事写在当前坐标纸上的方式。
必须保留的高位结论在欧氏空间中,点附近的微小位移空间可视为该点的切空间。微分 \(\mathrm dT_P\) 把输入切空间映到输出切空间;雅可比矩阵是这张切空间之间的线性地图。
02 · Matrix anatomy
怎样读一张雅可比矩阵:列看“方向被送到哪”,行看“输出受谁影响”
同一张矩阵有两种互补的读法。列是几何读法,行是灵敏度读法。只会逐项算偏导而不会读行列,就很难真正理解矩阵为何长成这样。
互动实验 2:矩阵如何作用于基向量与单位方块
调节四个元素。右侧平行四边形的两条边,正是矩阵的两列。
矩阵全信息
第一列 \(J\boldsymbol e_1\)第二列 \(J\boldsymbol e_2\)单位方块的像
1. 按列读:一个输入坐标方向会造成怎样的整体输出变化
\[J_T=\begin{pmatrix}\dfrac{\partial x}{\partial u}&\dfrac{\partial x}{\partial v}\\[6pt]\dfrac{\partial y}{\partial u}&\dfrac{\partial y}{\partial v}\end{pmatrix}.\]
输入空间的第一基向量是 \(\boldsymbol e_1=(1,0)^{\mathsf T}\)。矩阵作用后
\[J_T\boldsymbol e_1=\begin{pmatrix}\dfrac{\partial x}{\partial u}\\[4pt]\dfrac{\partial y}{\partial u}\end{pmatrix}.\]
这正是雅可比的第一列。它表示固定 \(v\)、只让 \(u\) 增加一小步时,输出点在 \((x,y)\) 平面中的切向变化。第二列同理。
为什么单位小方块会变成以两列为边的平行四边形单位方块中的任意向量可写成 \(s\boldsymbol e_1+t\boldsymbol e_2\)。线性性给出 \(J(s\boldsymbol e_1+t\boldsymbol e_2)=sJ\boldsymbol e_1+tJ\boldsymbol e_2\)。因此整个方块由两列张成。
2. 按行读:一个输出分量怎样响应全部输入变量
第一行
\[\left(\frac{\partial x}{\partial u},\frac{\partial x}{\partial v}\right)\]
把输入小位移 \((\mathrm du,\mathrm dv)^{\mathsf T}\) 映成标量 \(\mathrm dx\):
\[\mathrm dx=\frac{\partial x}{\partial u}\,\mathrm du+\frac{\partial x}{\partial v}\,\mathrm dv.\]
所以行向量体现的是一个输出通道的全部灵敏度;列向量体现的是一个输入方向触发的全部输出响应。
| 视角 | 看什么 | 一句话读法 |
| 列视角 | 固定其他输入,改变某一个输入 | 第 \(j\) 列是第 \(j\) 个输入基方向的像 |
| 行视角 | 固定某一个输出分量,汇总全部输入影响 | 第 \(i\) 行是第 \(i\) 个输出分量的微分系数 |
| 整体视角 | 任意小位移 | 矩阵把输入变化向量一次性变成输出变化向量 |
新手最容易写反矩阵的根源若约定输出分量排成列向量,则“行按输出、列按输入”。例如 \(T:(u,v)\mapsto(x,y)\),第一行必须是 \(x\) 对 \(u,v\) 的偏导,第一列必须是 \(x,y\) 对 \(u\) 的偏导。先写输出列向量,再写输入列向量,方向就不容易反。
03 · Determinant
雅可比行列式:局部面积密度、方向信息与一阶退化
行列式很重要,但它不是雅可比矩阵的同义词。它把一整张矩阵压缩成一个数,因此只保留“总体有向面积倍率”这一类信息。
互动实验 3:相同行列式,完全不同的局部形变
两个矩阵的行列式始终都是 1,但一个各向异性拉伸,另一个剪切。面积不变,不代表形状与方向不变。
det 只是摘要
\(A=\operatorname{diag}(s,1/s)\)\(B=\begin{pmatrix}1&k\\0&1\end{pmatrix}\)
1. 为什么二维行列式就是有向面积倍率
设矩阵两列为 \(\boldsymbol a,\boldsymbol b\)。单位方块的像是这两列张成的平行四边形,其有向面积为
\[\det J=\begin{vmatrix}a_1&b_1\\a_2&b_2\end{vmatrix}=a_1b_2-a_2b_1.\]
绝对值给真实面积倍率;符号记录定向:
\(\det J>0\):保持局部手性\(\det J<0\):局部翻面\(\det J=0\):一阶面积被压成零
积分换元里使用绝对值,是因为普通面积、体积不带方向;在有向几何或微分形式中,符号本身有意义。
2. 行列式为零:不是“算不了”,而是独立方向被压扁
当 \(\det J=0\) 时,两列线性相关。原来两个独立的输入方向,在输出空间的一阶像只剩一个方向,甚至全部变为零。局部小方块的一阶面积因此消失。
不要过度推论\(\det J(P)=0\) 只说明该点的线性化退化,逆函数定理不能在此直接使用;它不必然说明原变换在集合意义上不一一。例:\(T(u,v)=(u^3,v)\) 仍是一一映射,但在 \(u=0\) 时行列式为零,反变换的一阶光滑性失效。
从“面积倍率”升到“奇异值”:矩阵究竟还多保存了什么
任意实矩阵都可以从几何上理解为“先旋转,沿若干正交方向分别拉伸,再旋转”。各方向拉伸倍数叫奇异值 \(\sigma_1,\sigma_2\)。二维方阵满足
\[|\det J|=\sigma_1\sigma_2.\]
所以行列式只知道两个方向倍率的乘积,不知道它们如何分配。上方的 \(A=\operatorname{diag}(s,1/s)\) 无论把一个方向拉得多长、另一个方向压得多窄,乘积都仍为 1。
这也解释了为什么“行列式不小”与“每个方向都稳定”不是完全同一句话;高维中尤其要看全部奇异值,而不仅是其乘积。
04 · Chain rule
链式法则不是“分数约分”,而是局部线性变换依次复合
每一层非线性变换在当前点先被线性化;小位移依次穿过这些线性映射,所以雅可比矩阵按实际发生顺序相乘。矩阵乘法正是在编码“沿路相乘、路径相加”。
互动实验 4:先旋转后剪切,与先剪切后旋转
交换顺序会改变结果。若输入先经 \(A\),再经 \(B\),总矩阵是 \(BA\),不是 \(AB\)。
顺序不可交换
1. 从微小位移推导矩阵链式法则
设
\[\boldsymbol u=T(\boldsymbol x),\qquad \boldsymbol z=S(\boldsymbol u).\]
第一层将输入小位移变为
\[\mathrm d\boldsymbol u=J_T(\boldsymbol x)\,\mathrm d\boldsymbol x.\]
第二层继续变换:
\[\mathrm d\boldsymbol z=J_S(\boldsymbol u)\,\mathrm d\boldsymbol u.\]
代入:
\[\boxed{J_{S\circ T}(\boldsymbol x)=J_S(T(\boldsymbol x))\,J_T(\boldsymbol x).}\]
注意外层雅可比要在中间点 \(T(\boldsymbol x)\) 取值;这是抽象函数复合题中“外层、内层取值点不同”的矩阵版本。
2. “路径相加”就在矩阵乘法的一个元素里
若
\[J_T=\begin{pmatrix}\dfrac{\partial u}{\partial x}&\dfrac{\partial u}{\partial y}\\[4pt]\dfrac{\partial v}{\partial x}&\dfrac{\partial v}{\partial y}\end{pmatrix},\qquad J_S=\begin{pmatrix}\dfrac{\partial p}{\partial u}&\dfrac{\partial p}{\partial v}\\[4pt]\dfrac{\partial q}{\partial u}&\dfrac{\partial q}{\partial v}\end{pmatrix},\]
那么总矩阵左上角是
\[\frac{\partial p}{\partial x}=\frac{\partial p}{\partial u}\frac{\partial u}{\partial x}+\frac{\partial p}{\partial v}\frac{\partial v}{\partial x}.\]
第一项对应 \(x\to u\to p\),第二项对应 \(x\to v\to p\)。矩阵乘法不是形式上的凑合,而是把所有中间通道逐一汇总。
为什么不能把偏导符号当普通分数约掉同一个输出变化通常有多条中间路径;此外“固定谁”是偏导的一部分。矩阵链式法则保留了通道与固定变量结构,机械约分会把这些信息抹掉。
05 · Inverse function
逆函数:真正取逆的是整张雅可比矩阵,不是每个偏导单独倒数
一元情形只有一个变化方向,所以“矩阵求逆”退化为一个数取倒数。多元情形中,各方向彼此混合,必须把整张线性变化关系一起反解。
互动实验 5:接近退化时,逆变换会放大微小误差
矩阵始终可逆,但当 \(\varepsilon\) 很小时,两列几乎共线;输出中极小的噪声,反解回输入时会被大幅放大。
可逆 ≠ 稳定
1. 反函数导数的正确矩阵形式
若 \(T\) 在点 \(P\) 附近有可微局部逆,且 \(J_T(P)\) 可逆,则
\[\boxed{J_{T^{-1}}(T(P))=[J_T(P)]^{-1}.}\]
证明只需对恒等关系
\[T^{-1}\circ T=I\]
使用链式法则:
\[J_{T^{-1}}(T(P))J_T(P)=I.\]
2. 为什么单个偏导通常不能互为倒数
考虑
\[x=u+v,\qquad y=u-v.\]
固定 \(v\) 时,\(\partial x/\partial u=1\)。反解为
\[u=\frac{x+y}{2},\qquad v=\frac{x-y}{2}.\]
固定 \(y\) 时,\(\partial u/\partial x=1/2\),并不是 1。两次偏导固定的另一个变量不同。
真正成立的是
\[\begin{pmatrix}\dfrac{\partial u}{\partial x}&\dfrac{\partial u}{\partial y}\\[6pt]\dfrac{\partial v}{\partial x}&\dfrac{\partial v}{\partial y}\end{pmatrix}=\left[\begin{pmatrix}\dfrac{\partial x}{\partial u}&\dfrac{\partial x}{\partial v}\\[6pt]\dfrac{\partial y}{\partial u}&\dfrac{\partial y}{\partial v}\end{pmatrix}\right]^{-1}.\]
非零与“离零很远”是两个层次逆函数定理只要求行列式非零,保证局部可逆;数值稳定性还关心最小奇异值是否太小。行列式很小往往预示压扁,但在高维中最好看条件数或全部奇异值。
06 · Implicit function
隐函数:不是“套负分式”,而是为了维持约束而发生的补偿变化
显函数直接告诉你谁随谁变;隐函数只给出一个约束。求导的本质是:自由变量稍微动了以后,依赖变量必须怎样补偿,才能让约束仍然为零。
互动实验 6A:同一条曲线需要不同的局部坐标图
观察 \(F(x,y)=0\) 的梯度、切向量,以及什么时候可以写成 \(y=y(x)\) 或 \(x=x(y)\)。
分母是几何选择
1. 单个约束的微分方程
若约束为
\[F(x,y)=0,\]
沿曲线的允许微小位移必须满足
\[\mathrm dF=\frac{\partial F}{\partial x}\,\mathrm dx+\frac{\partial F}{\partial y}\,\mathrm dy=0.\]
如果 \(\partial F/\partial y\ne0\),就能把 \(\mathrm dy\) 用 \(\mathrm dx\) 唯一解出:
\[\boxed{\frac{\mathrm dy}{\mathrm dx}=-\frac{\partial F/\partial x}{\partial F/\partial y}.}\]
这里分母非零不只是“允许做除法”,而是在说:改变 \(y\) 确实能在一阶上改变约束值,因此可以用 \(y\) 的调整抵消 \(x\) 的扰动。
如果 \(\partial F/\partial y=0\) 但 \(\partial F/\partial x\ne0\),则不应硬算 \(\mathrm dy/\mathrm dx\),而应改写为
\[\frac{\mathrm dx}{\mathrm dy}=-\frac{\partial F/\partial y}{\partial F/\partial x}.\]
这就是在约束曲线上换一张局部“坐标图”。圆不能全局写成单个 \(y=y(x)\),却可以在不同位置用不同局部表达覆盖。
互动实验 6B:两个约束如何共同决定两个补偿变量
改变自由变量 \((x,y)\),观察 \((u,v)\) 为维持 \(F=G=0\) 所需的一阶补偿。比较线性预测与真实有限变化。
四维问题,二维显示
2. 两个约束的母公式:先分块,再解线性方程
设
\[H(x,y,u,v)=\begin{pmatrix}F(x,y,u,v)\\G(x,y,u,v)\end{pmatrix}=\boldsymbol0.\]
把自由变量记为 \(\boldsymbol x=(x,y)^{\mathsf T}\),依赖变量记为 \(\boldsymbol u=(u,v)^{\mathsf T}\)。对约束求微分:
\[D_{\boldsymbol x}H\,\mathrm d\boldsymbol x+D_{\boldsymbol u}H\,\mathrm d\boldsymbol u=\boldsymbol0.\]
若关于待解变量的矩阵 \(D_{\boldsymbol u}H\) 可逆,则
\[\boxed{\mathrm d\boldsymbol u=-[D_{\boldsymbol u}H]^{-1}D_{\boldsymbol x}H\,\mathrm d\boldsymbol x.}\]
因此隐函数 \(\boldsymbol u=\boldsymbol u(\boldsymbol x)\) 的整张雅可比矩阵是
\[\boxed{D\boldsymbol u=-[D_{\boldsymbol u}H]^{-1}D_{\boldsymbol x}H.}\]
考研中的雅可比行列式比值,只是把这个矩阵方程用克拉默法则逐个分量写开。
把克拉默法则与“替换列”口诀逐步对齐
固定 \(y\),只求 \(\partial u/\partial x,\partial v/\partial x\),得到
\[\begin{pmatrix}\dfrac{\partial F}{\partial u}&\dfrac{\partial F}{\partial v}\\[6pt]\dfrac{\partial G}{\partial u}&\dfrac{\partial G}{\partial v}\end{pmatrix}\begin{pmatrix}\dfrac{\partial u}{\partial x}\\[6pt]\dfrac{\partial v}{\partial x}\end{pmatrix}=-\begin{pmatrix}\dfrac{\partial F}{\partial x}\\[6pt]\dfrac{\partial G}{\partial x}\end{pmatrix}.\]
分母是系数行列式
\[\frac{\partial(F,G)}{\partial(u,v)}.\]
求 \(\partial u/\partial x\) 时替换“\(u\) 所在第一列”,但位置不能换,于是分子为 \(\partial(F,G)/\partial(x,v)\),并保留右端负号:
\[\frac{\partial u}{\partial x}=-\frac{\dfrac{\partial(F,G)}{\partial(x,v)}}{\dfrac{\partial(F,G)}{\partial(u,v)}}.\]
求 \(\partial v/\partial x\) 时替换第二列,得到
\[\frac{\partial v}{\partial x}=-\frac{\dfrac{\partial(F,G)}{\partial(u,x)}}{\dfrac{\partial(F,G)}{\partial(u,v)}}.\]
所谓“口诀”,其实是线性方程组求解的压缩记忆;一旦忘记符号,退回矩阵方程便不会迷路。
最重要的固定变量规则在填写 \(D_{\boldsymbol u}H\) 与 \(D_{\boldsymbol x}H\) 时,先把 \(x,y,u,v\) 全部当作独立坐标。比如 \(\partial F/\partial x\) 要固定 \(y,u,v\)。只有在对复合约束 \(H(x,y,u(x,y),v(x,y))\equiv0\) 求导时,才让 \(u,v\) 跟着变化。
07 · Rank & tangent space
秩、零空间、切空间:雅可比究竟保留了多少独立变化方向
行列式只适合方阵;更根本的概念是秩。秩告诉你变换在该点的一阶层面保留了多少个独立方向。对约束而言,零空间给允许移动方向,行空间给法方向。
互动实验 7:约束切线、零空间与拉格朗日条件
在直线约束上移动候选点。只有当目标函数梯度没有切向分量时,一阶上才可能是条件极值。
kernel / row space
约束法向 / 雅可比行空间允许切向 / 雅可比零空间目标梯度
1. 约束的切空间就是雅可比的零空间
把所有变量合成 \(\boldsymbol q\),约束写成
\[H(\boldsymbol q)=\boldsymbol0.\]
允许的小位移必须在一阶上保持约束:
\[\boxed{D H(\boldsymbol q)\,\delta\boldsymbol q=\boldsymbol0.}\]
所以
\[\boxed{T_{\boldsymbol q}(H^{-1}(0))=\ker D H(\boldsymbol q).}\]
在欧氏空间里,这句话可以直译为:雅可比把哪些方向送成零,哪些方向就是沿约束面滑动而不改变约束值的切方向。
2. 行空间为什么是法方向
若只有一个约束 \(F=0\),雅可比是一行:
\[D F=\begin{pmatrix}\dfrac{\partial F}{\partial x}&\dfrac{\partial F}{\partial y}&\dfrac{\partial F}{\partial z}\end{pmatrix}.\]
这一行对应梯度的转置。所有切向量都与梯度正交,所以雅可比的行空间由法方向张成。
有多个独立约束时,每一行都是一个约束的法向灵敏度;它们张成整个法空间。
3. 拉格朗日乘数为什么自然出现
条件极值点要求目标函数对每一个允许切向量的一阶变化都为零:
\[\nabla f\cdot\delta\boldsymbol q=0\qquad \forall\,\delta\boldsymbol q\in\ker D H.\]
因此 \(\nabla f\) 必须属于零空间的正交补,而线性代数告诉我们:
\[(\ker D H)^\perp=\operatorname{Row}(D H).\]
于是
\[\boxed{\nabla f=(D H)^{\mathsf T}\boldsymbol\lambda=\lambda_1\nabla F_1+\cdots+\lambda_m\nabla F_m.}\]
这就是拉格朗日乘数法。它不是凭空加一个 \(\lambda\),而是说“目标梯度必须落在约束法空间里”。
变量数减方程数为什么有时成立若 \(H:\mathbb R^n\to\mathbb R^m\) 的雅可比在该点满行秩 \(m\),则切空间维数为 \(n-m\)。所以“自由变量数 = 变量数 − 独立约束数”不是机械数方程,而是秩—零度定理的几何结果。
08 · Coordinate change
坐标变换:不是函数变了,而是用另一套网格描述同一几何对象
主动变换把点真的移动;被动坐标变换让点不动,只改变记录它的坐标。数学上二者都由映射和雅可比描述。偏导算子、梯度、Hessian 与偏微分方程系数都会随坐标关系重新组合。
互动实验 8:线性坐标 \(\xi=x+ay,\ \eta=x+by\)
两族等坐标线越接近平行,坐标系越接近退化。载入特征根后,原二阶算子的两个纯二阶项恰好消失。
坐标网格 + PDE
\(\xi=\text{常数}\)\(\eta=\text{常数}\)
1. 坐标变换的雅可比,怎样变换一阶微分算子
设原函数改写为
\[u(x,y)=U(\xi(x,y),\eta(x,y)).\]
链式法则给出
\[\begin{pmatrix}\dfrac{\partial u}{\partial x}\\[6pt]\dfrac{\partial u}{\partial y}\end{pmatrix}=\begin{pmatrix}\dfrac{\partial\xi}{\partial x}&\dfrac{\partial\eta}{\partial x}\\[7pt]\dfrac{\partial\xi}{\partial y}&\dfrac{\partial\eta}{\partial y}\end{pmatrix}\begin{pmatrix}\dfrac{\partial U}{\partial\xi}\\[6pt]\dfrac{\partial U}{\partial\eta}\end{pmatrix}.\]
这个矩阵正是坐标雅可比的转置。等价地,微分算子本身变为
\[\frac{\partial}{\partial x}=\frac{\partial\xi}{\partial x}\frac{\partial}{\partial\xi}+\frac{\partial\eta}{\partial x}\frac{\partial}{\partial\eta},\qquad \frac{\partial}{\partial y}=\frac{\partial\xi}{\partial y}\frac{\partial}{\partial\xi}+\frac{\partial\eta}{\partial y}\frac{\partial}{\partial\eta}.\]
对当前线性变换,有
\[\boxed{\frac{\partial}{\partial x}=\frac{\partial}{\partial\xi}+\frac{\partial}{\partial\eta},\qquad \frac{\partial}{\partial y}=a\frac{\partial}{\partial\xi}+b\frac{\partial}{\partial\eta}.}\]
这不是“把字母替换进去”,而是在说明原坐标方向由两条新坐标方向怎样线性组合。
2. 为什么要检查 \(b-a\ne0\)
\[\frac{\partial(\xi,\eta)}{\partial(x,y)}=\begin{vmatrix}1&a\\1&b\end{vmatrix}=b-a.\]
若 \(a=b\),则 \(\xi=\eta\),两条新坐标其实是同一个量。网格的两族线重合,二维信息被压成一维,不能作为真正的坐标变换。
3. 二阶算子为什么可以通过“选坐标方向”被化简
考虑主部
\[4\frac{\partial^2u}{\partial x^2}+12\frac{\partial^2u}{\partial x\partial y}+5\frac{\partial^2u}{\partial y^2}.\]
它对应对称矩阵
\[A=\begin{pmatrix}4&6\\6&5\end{pmatrix}.\]
新坐标 \(\xi=x+ay\) 的梯度是 \((1,a)^{\mathsf T}\)。新方程里 \(\partial^2U/\partial\xi^2\) 的系数就是
\[\begin{pmatrix}1&a\end{pmatrix}A\begin{pmatrix}1\\a\end{pmatrix}=4+12a+5a^2.\]
令它为零,不是盲目消项,而是在寻找这个二阶型的零方向。两个根
\[a=-2,\qquad a=-\frac25\]
给出两条不同的特征坐标方向。分别取作 \(a,b\),便可把算子主部化成纯混合导数。
线性与非线性坐标变换:为什么后者会产生额外一阶项
一般有
\[H_{x,y}(u)=J^{\mathsf T}H_{\xi,\eta}(U)J+\frac{\partial U}{\partial\xi}H_{x,y}(\xi)+\frac{\partial U}{\partial\eta}H_{x,y}(\eta).\]
若 \(\xi,\eta\) 是线性的,它们的 Hessian 为零,只剩第一项。若变换非线性,后两项不能丢。
例如 \(\xi=x^2,\eta=y\),则
\[\frac{\partial^2u}{\partial x^2}=4x^2\frac{\partial^2U}{\partial\xi^2}+2\frac{\partial U}{\partial\xi}.\]
最后的 \(2\partial U/\partial\xi\) 正是由 \(\partial^2\xi/\partial x^2=2\) 产生。二阶链式法则中的“外层一阶导数 × 内层二阶导数”不能消失。
09 · Change of variables
积分换元:雅可比行列式是坐标网格的局部面积密度
积分换元里出现的雅可比绝不是额外补上的“修正因子”。它就是新坐标中的小矩形映到原平面以后,真实面积发生了多少倍变化。
互动实验 9:极坐标小矩形为何带出一个 r
\((r,\theta)\) 平面中的小矩形 \(\mathrm dr\,\mathrm d\theta\),在 \((x,y)\) 平面中变成一个小环扇形。减小 \(\mathrm dr\),精确面积与 \(r\,\mathrm dr\,\mathrm d\theta\) 越来越接近。
面积密度可视化
1. 从雅可比的两列看极坐标
极坐标变换为
\[T(r,\theta)=(r\cos\theta,r\sin\theta).\]
雅可比两列是
\[\frac{\partial T}{\partial r}=\begin{pmatrix}\cos\theta\\\sin\theta\end{pmatrix},\qquad \frac{\partial T}{\partial\theta}=\begin{pmatrix}-r\sin\theta\\r\cos\theta\end{pmatrix}.\]
第一列是长度 1 的径向单位向量;第二列是长度 \(r\) 的角向切向量,且二者垂直。因此小矩形两边 \(\mathrm dr,\mathrm d\theta\) 映成长度近似为
\[\mathrm dr,\qquad r\,\mathrm d\theta\]
的两条垂直边,面积自然是 \(r\,\mathrm dr\,\mathrm d\theta\)。
2. 为什么变元换元公式要取绝对值
\[\iint_D f(x,y)\,\mathrm dx\,\mathrm dy=\iint_G f(x(u,v),y(u,v))\left|\frac{\partial(x,y)}{\partial(u,v)}\right|\,\mathrm du\,\mathrm dv.\]
普通二重积分中的面积元必须非负,所以取绝对值。若不取绝对值,负行列式会因坐标方向翻转而给出负的有向面积。
极坐标原点为何特殊在 \(r=0\) 时,所有角度都表示同一个点,角方向完全坍缩;因此 \(\det J=r=0\)。这不是公式的偶然缺陷,而是极坐标本身在原点不能提供唯一角度坐标。
10 · Exam workflow
从高位视角回到考研手算:每一种题都先认“变化关系”
高位理解的目的不是绕开手算,而是让你不再依赖脆弱口诀。下列模板都从同一条线性变化关系出发,符号忘了可以现场重建。
一、坐标变换求偏导
先写函数依赖例如 \(u(x,y)=U(\xi(x,y),\eta(x,y))\)。明确原自变量与新自变量,避免把同一个字母在两层中混用。
写坐标雅可比行按新坐标分量 \(\xi,\eta\),列按原变量 \(x,y\):\(D(\xi,\eta)/D(x,y)\)。
用链式法则或算子形式\(\partial/\partial x=(\partial\xi/\partial x)\partial/\partial\xi+(\partial\eta/\partial x)\partial/\partial\eta\)。
二阶时再求一次若坐标变换非线性,必须保留新坐标自身的二阶导数所产生的一阶项。
二、两个方程确定两个隐函数
统一移到左边写成 \(F(x,y,u,v)=0,\ G(x,y,u,v)=0\)。此时四个字母先全部视为独立坐标。
明确自由变量与依赖变量若要求 \(u=u(x,y),v=v(x,y)\),则分母矩阵必然是关于 \((u,v)\) 的偏导块。
先写矩阵方程\(D_{(u,v)}H\,D(u,v)/D(x,y)=-D_{(x,y)}H\)。这一步是母体。
需要单个分量时再用克拉默法则替换对应列,保持列顺序,别漏整体负号。
三、常见符号陷阱
| 陷阱 | 错误想法 | 正确校准 |
| 把矩阵与行列式混用 | “雅可比就是一个数” | 矩阵保存全部一阶方向信息;行列式只是方阵的有向体积摘要 |
| 填写隐函数雅可比时让依赖变量跟着动 | 算 \(\partial F/\partial x\) 时又带出 \(\partial u/\partial x\) | 填矩阵时所有坐标先独立;对复合恒等式求导时才让依赖变量联动 |
| 偏导逐个取倒数 | \(\partial u/\partial x=1/(\partial x/\partial u)\) | 真正成立的是整张反变换雅可比等于原雅可比的逆矩阵 |
| 忘记矩阵乘法顺序 | 先 A 后 B 写成 AB | 列向量约定下,先 A 后 B 的总矩阵为 BA |
| det=0 就断言一定不一一 | 把逆函数定理的充分条件当必要条件 | det=0 说明线性化退化;高阶项仍可能维持集合意义的一一性 |
| det 非零就认为数值稳定 | 只要能求逆就“没有问题” | 接近退化时逆矩阵可能巨大;稳定性还要看最小奇异值或条件数 |
| 线性坐标变换经验套到非线性变换 | 二阶求导只写 \(J^{\mathsf T}HJ\) | 非线性坐标还会产生由坐标函数 Hessian 带来的额外一阶项 |
雅可比行列式的手写展开:逐个位置不含糊
若
\[J=\frac{\partial(F,G)}{\partial(u,v)}=\begin{vmatrix}\dfrac{\partial F}{\partial u}&\dfrac{\partial F}{\partial v}\\[7pt]\dfrac{\partial G}{\partial u}&\dfrac{\partial G}{\partial v}\end{vmatrix},\]
则
\[J=\frac{\partial F}{\partial u}\frac{\partial G}{\partial v}-\frac{\partial F}{\partial v}\frac{\partial G}{\partial u}.\]
“第一行”永远来自第一个函数 \(F\);“第二行”来自第二个函数 \(G\)。“第一列”永远对第一个变量 \(u\) 求偏导;“第二列”对第二个变量 \(v\) 求偏导。改变函数顺序或变量顺序都会改变行列式符号。
真正可靠的考场退路任何雅可比行列式公式一旦记不清,都回到“对约束求全微分 → 收集未知导数 → 解线性方程组”。高位结构不是额外负担,而是忘记口诀时仍能自救的母路径。
11 · Synthesis
最终统一:所有现象都在研究“微小变化怎样被线性传递”
把整章压到最底层,始终只有一个对象:某个映射在某点的微分。其余名词是在不同问题中读取这张线性地图的不同部分。
链式法则变化先后传递
每一层先局部线性化,再把小位移送入下一层;因此矩阵按变换发生顺序相乘。
反函数把变化关系整体反解
输入方向被混合以后,不能逐项倒数;要对整个线性映射求逆。
隐函数约束要求依赖量补偿
自由变量造成的约束扰动,必须由依赖变量的一阶调整抵消。
积分换元坐标网格有自己的密度
同样大小的新坐标小格,在原空间中的真实面积随位置而变,倍率就是绝对行列式。
秩与退化独立方向可能被压缩
秩描述有多少个方向在一阶上仍能被区分;满秩是局部稳定坐标与隐函数的核心。
拉格朗日目标梯度落入约束法空间
所有允许切向变化的一阶增量为零,等价于目标梯度由约束梯度线性表示。
J
最准确的一句话
雅可比矩阵不是整个非线性变换,却是这个变换在每一点最真实的一阶面貌:它把不同变量系统之间的微小变化关系完整编码下来;雅可比行列式则从中提取局部有向体积倍率与退化信息。
今后遇到任何雅可比题,先问三个问题① 输入变化向量是谁?② 输出或约束变化向量是谁?③ 当前是在直接传播变化、反解变化,还是只提取面积倍率?这三个问题一旦明确,矩阵方向、行列式位置与负号通常会自己归位。