LOADING

加载过慢请开启缓存 浏览器默认开启

Logic の 博客

一小块凝固的时间

8.常微分方程 II

2026/4/19

解的唯一性和存在性

一阶常微分方程的初值问题

$$ \frac{dy}{dx} = f(x, y), \quad y(x_0) = y_0 $$

已知条件

  1. 函数 $f(x, y)$在某个包含点$(x_0, y_0)$ 的闭矩形区域

$$ R = \{ (x, y) \in \mathbb{R}^2 : |x - x_0| \leq a, |y - y_0| \leq b \} $$

上连续。因此,根据闭区间上连续函数的性质,$f$在$R$上有界,即存在常数$M > 0$,使得对所有 $(x, y) \in R$,有 $|f(x, y)| \leq M$。

  1. 函数 $f(x, y)$在$R$上关于变量$y$满足 Lipschitz 条件:存在常数$L > 0$,使得对于任意 $(x, y_1) \in R$和$(x, y_2) \in R$,都有

$$ |f(x, y_1) - f(x, y_2)| \leq L |y_1 - y_2| $$

在上述条件下,存在唯一的函数 $y = \phi(x)$,定义在某个包含 $x_0$的区间$I$ 上,满足该微分方程及初始条件。

证明

朴素地,我们考虑两边积分,得到:

$$ y=y_0+\int_{x_0}^x f(t,y)dt $$

这就转化为一个所谓积分方程,如何进一步求解呢?利用 Neumann 方法的思想,想到通过迭代或许可以逼近解。先随便猜一个解,例如常值函数 $\phi_0(x)\equiv y_0$ ,这是唯一确定的值,尽管不满足微分方程,我们可以用方程修正结果,我们考虑这样的迭代:

$$ \phi_{n+1}(x) = y_0 + \int_{x_0}^{x} f(t, \phi_n(t)) \, dt, \quad n = 0, 1, 2, \dots $$

这样,如果序列 $\phi_n$ 收敛,那么这个极限也就满足积分方程,从而满足微分方程,这样就可做了。

确保良定义

那么首先,我们知道的约束是 $|x-x_0|\le a$,以及$|\phi_n(x)-y_0|\le b$,那么通过归纳法寻找$h$。假设对$n$ 及之前都满足约束,下一步:

$$ |\phi_{n+1}(x)-y_0|=| \int_{x_0}^x f(t,\phi_n(x))dt | \le \int_{x_0}^x|f(t,\phi_n(x))|dt\le M|x-x_0| $$

那么,为了让 $\phi_{n+1}(x)-y_0\le b$,只要$M|x-x_0|\le b$即可,那么只要选择$Mh\le b$,也就是$h\le b/M$。同时$h$也要满足$h\le a$,那么综合就得到$h=min(a,\frac{b}{M})$。从而在$[x_0-h,x_0+h]$ 上定义都是良的,且图像保持在矩形区域内。

估计相邻迭代

从 $n=1$ 开始:

$$ |\phi_1(x) - \phi_0(x)| = \left| \int_{x_0}^{x} f(t, y_0) \, dt \right| \leq M |x - x_0| $$

对于一般的 $n \geq 1$,利用迭代定义和 Lipschitz 条件,

$$ \begin{aligned} |\phi_{n+1}(x) - \phi_n(x)| &= \left| \int_{x_0}^{x} [f(t, \phi_n(t)) - f(t, \phi_{n-1}(t))] \, dt \right| \\ &\leq \int_{x_0}^{x} |f(t, \phi_n(t)) - f(t, \phi_{n-1}(t))| \, dt \end{aligned} $$

利用 Lipschitz 条件:

$$ \leq L \left| \int_{x_0}^{x} |\phi_n(t) - \phi_{n-1}(t)| \, dt \right| $$

推导
让我们尝试计算前几项来寻找规律。

  • 已知:$|\phi_1(x) - \phi_0(x)| \leq M |x - x_0|$- 计算$|\phi_2(x) - \phi_1(x)|$:

$$ |\phi_2(x) - \phi_1(x)| \leq L \left| \int_{x_0}^{x} M |t - x_0| \, dt \right| = M L \frac{|x - x_0|^2}{2} $$

  • 计算 $|\phi_3(x) - \phi_2(x)|$:

$$ |\phi_3(x) - \phi_2(x)| \leq L \left| \int_{x_0}^{x} M L \frac{|t - x_0|^2}{2} \, dt \right| = M L^2 \frac{|x - x_0|^3}{3!} $$

对于所有 $n \geq 1$和$x \in I$,有以下估计成立:

$$ |\phi_n(x) - \phi_{n-1}(x)| \leq \frac{M L^{n-1}}{n!} |x - x_0|^n \leq \frac{M L^{n-1}}{n!} h^n $$

证明存在性

考虑级数

$$ \sum_{n=1}^{\infty} \max_{x \in I} |\phi_n(x) - \phi_{n-1}(x)| $$

根据估计,这个级数的每一项都被 $\frac{M L^{n-1}}{n!} h^n$ 所控制。

考虑数值级数 $\sum_{n=1}^{\infty} \frac{M L^{n-1}}{n!} h^n$。我们可以用比值判别法来检验其收敛性:

$$ \lim_{n \to \infty} \frac{\frac{M L^n}{(n+1)!} h^{n+1}}{\frac{M L^{n-1}}{n!} h^n} = \lim_{n \to \infty} \frac{L h}{n+1} = 0 $$

由于极限为 0(小于 1),该数值级数收敛。

根据 Weierstrass M-判别法,由于函数项级数的每一项在区间 $I$上的绝对值都被一个收敛的正项级数的对应项所控制,因此该函数项级数在$I$ 上一致收敛

结论
这意味着 Picard 迭代序列 ${\phi_n(x)}$在区间$I$上一致收敛于一个极限函数,记作$\phi(x)$。由于每个 $\phi_n$都是连续的,且收敛是一致的,极限函数$\phi(x)$ 也是连续的。

回忆迭代公式:

$$ \phi_{n+1}(x) = y_0 + \int_{x_0}^{x} f(t, \phi_n(t)) \, dt $$

对等式两边取极限 $n \to \infty$。
左边直接趋于 $\phi(x)$。
对于右边,将极限号移入积分号内,即:

$$ \lim_{n \to \infty} \int_{x_0}^{x} f(t, \phi_n(t)) \, dt = \int_{x_0}^{x} \lim_{n \to \infty} f(t, \phi_n(t)) \, dt = \int_{x_0}^{x} f(t, \phi(t)) \, dt $$

这说明 $\phi(x)$ 满足积分方程,从而是初值问题的一个解。存在性得证。

证明唯一性

推导
假设存在另一个函数 $\psi(x)$ 也满足积分方程:

$$ \psi(x) = y_0 + \int_{x_0}^{x} f(t, \psi(t)) \, dt $$

考虑两个解之差的绝对值 $u(x) = |\phi(x) - \psi(x)|$。将两者满足的积分方程相减并取绝对值:

$$ u(x) = \left| \int_{x_0}^{x} [f(t, \phi(t)) - f(t, \psi(t))] \, dt \right| \leq \left| \int_{x_0}^{x} |f(t, \phi(t)) - f(t, \psi(t))| \, dt \right| $$

再次应用 Lipschitz 条件:

$$ u(x) \leq L \left| \int_{x_0}^{x} |\phi(t) - \psi(t)| \, dt \right| = L \left| \int_{x_0}^{x} u(t) \, dt \right| $$

现在我需要从这个积分不等式推导出 $u(x) \equiv 0$。不失一般性,考虑 $x \geq x_0$的情况。定义$U(x) = \int_{x_0}^{x} u(t) , dt$。那么 $U’(x) = u(x)$。上述不等式变为:

$$ U'(x) \leq L \cdot U(x) $$

移项得 $U’(x) - L U(x) \leq 0$。两边乘以积分因子 $e^{-Lx}$:

$$ \frac{d}{dx} \left( e^{-Lx} U(x) \right) \leq 0 $$

这说明函数 $e^{-Lx} U(x)$在$x \geq x_0$上是单调不增的。在$x = x_0$ 处,$U(x_0) = \int_{x_0}^{x_0} u(t) , dt = 0$。因此,对于所有 $x \geq x_0$,有 $e^{-Lx} U(x) \leq 0$。但由于 $e^{-Lx} > 0$且$U(x) = \int_{x_0}^{x} u(t) , dt \geq 0$,我们得出 $U(x) \leq 0$且$U(x) \geq 0$,故 $U(x) = 0$。

由于 $U(x) = 0$,其导数 $u(x) = U’(x)$也必然为 0(此处$u$是连续的)。所以$u(x) \equiv 0$,即 $\phi(x) = \psi(x)$对所有$x \geq x_0$成立。对于$x \leq x_0$ 的情况,论证类似。

结论:唯一性得证。

如果从高阶的视角来看,我们可以采用所谓 $Banach$ 不动点定理,简单理解就是一个压缩映射在所谓完备度量空间存在唯一不动点。压缩映射指的是映射值的差小于原来的差,也就是映射后两个点距离变小了。完备度量空间是什么且不管。这样的话,也可以清楚地梳理整个证明。

先转化为积分方程,选取合适的区间长度(足够小),让积分方程对应的映射是一个压缩映射(就如上面选一个 $h$ ),然后就可以应用不动点定理。

n 阶线性常微分方程的解结构

这部分确立了线性方程解的基本框架。

  • n 阶线性齐次 ODE:指出若存在 $n$个线性无关的特解$\psi_1, \dots, \psi_n$,则通解可表示为它们的线性组合 $y = C_1\psi_1 + \dots + C_n\psi_n$。此类方程无奇解

  • n 阶非齐次线性 ODE:其通解结构为 $y = \psi^* + C_1\psi_1 + \dots + C_n\psi_n$,其中 $\psi^*$ 是非齐次方程的一个特解。

  • 核心工具预告Wronski 行列式 (Wronskian),用于判定函数组的线性相关性。

二阶线性 ODE 与存在唯一性定理

将讨论具体化到二阶情形。

  • 标准形式

    • 非齐次:$y’’ + p(x)y’ + q(x)y = f(x)$

    • 齐次:$y’’ + p(x)y’ + q(x)y = 0$

  • 解的存在唯一性定理

    若系数 $p(x), q(x)$及$f(x)$在区间$[a, b]$ 上连续,则对于初值问题($x_0 \in [a, b]$),方程在区间上存在且仅有一个唯一的解。

Wronski 行列式的定义与判定

开始推导判定解是否线性无关的数学判据。

  • 定义:对于两个解 $\psi_1, \psi_2$,定义其 Wronski 行列式为:

$$ W(x) = \begin{vmatrix} \psi_1 & \psi_2 \\ \psi_1' & \psi_2' \end{vmatrix} $$

  • 定理核心:$\psi_1, \psi_2$在$(a, b)$上线性无关的充要条件是$W(x) \neq 0$(对于区间内任意 $x$)。

线性相关性的逻辑证明

板书展示了必要性与充分性的证明思路。

  • 反证法/直接推导

    • 若 $\psi_1, \psi_2$线性相关,则存在不全为零的常数$k_1, k_2$使得$k_1\psi_1 + k_2\psi_2 \equiv 0$。

    • 求导得到方程组,由线性代数基础可知,其系数行列式 $W(x)$ 必然恒等于 0。

  • 引申:探讨了 $W(x) \equiv 0$ 与解的线性相关性之间的必然联系。

结论的收束与验证

利用初值问题的唯一性完成最后的逻辑闭环。

  • 唯一性应用

    • 构造一个函数 $Y(x) = C_1\psi_1(x) + C_2\psi_2(x)$。

    • 若 $W(x_0) = 0$,则可以找到一组不全为零的 $C_1, C_2$使得在某点$x_0$ 处的初值为 0。

    • 根据唯一性定理,如果初值为 0 且满足齐次方程,该解在整个区间内必然恒等于 0($Y(x) \equiv 0$)。

  • 最终判定:由此证明了在 ODE 框架下,只要在一点处 $W(x_0) = 0$,则解组必然线性相关;反之若线性无关,则 $W(x)$ 在区间内处处不为 0。

上面的推导中,我们发现只是假定一个点 $W(x)$为$0$就会得到处处为$0$ ,这实际上对线性微分方程都成立。

Wronskian行列式

1. 核心背景

设有一个二阶齐次线性微分方程:

$$ y'' + P(x)y' + Q(x)y = 0 $$

假设 $\varphi_1, \varphi_2$ 是该方程的两个解。

2. 推导逻辑拆解

  • 朗斯基行列式的定义

    首先定义 $W(x)$ 为这两个解的行列式:

$$ W(x) = \begin{vmatrix} \varphi_1 & \varphi_2 \\ \varphi_1' & \varphi_2' \end{vmatrix} = \varphi_1 \varphi_2' - \varphi_2 \varphi_1' $$

  • 对 $W(x)$ 求导

    利用导数的乘法法则(或行列式求导法则):

$$ W'(x) = (\varphi_1 \varphi_2'' + \varphi_1' \varphi_2') - (\varphi_2 \varphi_1'' + \varphi_2' \varphi_1') = \varphi_1 \varphi_2'' - \varphi_2 \varphi_1'' $$

  • 利用原方程进行代换

    因为 $\varphi_1, \varphi_2$满足原方程,可以提取出二阶导数项:$\varphi_i’’ = -P(x)\varphi_i’ - Q(x)\varphi_i$代入后,包含$Q(x)$ 的项会互相抵消,剩下:

$$ W'(x) = \varphi_1 (-P \varphi_2' - Q \varphi_2) - \varphi_2 (-P \varphi_1' - Q \varphi_1) = -P(x) (\varphi_1 \varphi_2' - \varphi_2 \varphi_1') $$

即:

$$ W'(x) = -P(x)W(x) $$

  • 求解一阶线性方程

    这是一个典型的一阶可分离变量微分方程,整理得 $W’(x) + P(x)W(x) = 0$。

    通过积分因子法或分离变量法得到通解:

$$ W(x) = C e^{-\int P(x) dx} $$

若给定初始点 $x_0$,则表达式为:

$$ W(x) = W(x_0) e^{-\int_{x_0}^x P(t) dt} $$


3. 关键结论与直觉

$W$ 不变号”是这个理论在定性分析上的核心价值。

  • 定号性: 由于指数函数 $e^{f(x)}$永远大于零,因此$W(x)$的正负完全取决于初始值$W(x_0)$。

  • 线性无关性的保持: 只要在某一点 $x_0$处两个解线性无关(即$W(x_0) \neq 0$),那么在 $P(x)$ 连续的区间内,它们在任何点都线性无关。反之,如果一点为零,则处处为零。

通解结构定理

  • 核心结论: 若 $\varphi_1, \varphi_2$线性无关,则它们的线性组合$y = C_1\varphi_1 + C_2\varphi_2$ 包含所有解

  • 这意味着这组解构成了解空间的一组基,方程的通解空间是一个二维向量空间。


逻辑推导

为什么上述线性组合能覆盖所有解:

  1. 构造初值问题: 假设方程 $(\star)$有一个任意解$u(x)$。在某点 $x_0$,它满足初值 $y(x_0) = u(x_0)$和$y’(x_0) = u’(x_0)$。

  2. 确定系数: 考虑线性代数方程组:

$$ \begin{cases} C_1\varphi_1(x_0) + C_2\varphi_2(x_0) = u(x_0) \\ C_1\varphi_1'(x_0) + C_2\varphi_2'(x_0) = u'(x_0) \end{cases} $$

因为 $\varphi_1, \varphi_2$线性无关,所以该方程组的行列式(即$W(x_0)$)不为零。根据克莱姆法则,必然存在唯一的一组解 $(C_1^, C_2^)$。

  1. 唯一性收网: * 令 $y(x) = C_1^\varphi_1(x) + C_2^\varphi_2(x)$,它显然也是原方程的解。

    • 由于 $y(x)$和$u(x)$在$x_0$ 点的初值完全相同,根据微分方程解的唯一性定理,必然有 $u(x) \equiv y(x)$
阅读全文

7.常微分方程 I

2026/4/19

微分方程实际上对学过物理的人而言,是相当熟悉的事情,但如何严格化则还应归属于数学,尽管就应用而言,直觉可以解决大部分问题(

从场论到微分方程

在场论中,我们讨论了所谓散度无旋,旋度无源:

$$ \nabla\times(\nabla u)=0,\ \nabla \cdot (\nabla \times G)=0 $$

以及一个函数可以漂亮地分解成某个散度和某个旋度:

$$ F=\nabla u+\nabla \times G $$

Maxwell 方程

如雷贯耳的$Maxwell$方程组的微分形式,实际上就是用$\nabla$ 的语言写成的。这也在场论中提到过。

$$ \begin{cases} \nabla \cdot E = \rho \\ \nabla \cdot B = 0 \\ \nabla \times E = -B_t \\ \nabla \times B = J + E_t \end{cases} $$

正如上面所说,我们可以试着把 $E$ 拆解:

$$ E = \nabla (-U) + \nabla \times\int B\, dt $$

物理上,大概就是静电场和涡旋电场,分别由电势的梯度和变化的磁场产生。
能不能消掉 $B$,得到一个只含$E$ 的方程呢?

波动方程的推导 (Derivation of Wave Equation)

1. 基础方程

推导始于真空(或无源项 $J=0, \rho=0$)中的麦克斯韦方程组:

  • 法拉第感应定律: $\nabla \times E = -B_t$- 安培-麦克斯韦定律:$\nabla \times B = E_t$(注:此处简化了系数,并假设无源$J=0$)
2. 数学推导步骤

对法拉第定律两边同时取旋度(Curl)

$$ \nabla \times (\nabla \times E) = -(\nabla \times B)_t $$

左侧(利用矢量算子恒等式):

$$ \nabla \times (\nabla \times E) = \nabla(\nabla \cdot E) - \Delta E $$

关键点: 在无源区域(真空),由于 $\nabla \cdot E = 0$(由高斯定律得出),左侧简化为 $-\Delta E$

右侧(代入安培定律):

$$ -(\nabla \times B)_t = -(E_t)_t = -E_{tt} $$

3. 最终结论:波动方程

将左右两项合并并消去负号,得到电磁波在空间的演化规律:

$$ E_{tt} = \Delta E $$

展开即为:

$$ E_{tt} = E_{xx} + E_{yy} + E_{zz} $$

物理意义: 这正是一个典型的波动方程(Wave Equation)。它表明电场(和磁场)不需要介质,可以通过自身场的变化在空间中以波的形式传播。

可以看到,这样一个方程全是 $E$ 的导数所满足的方程,也就是物理直觉上的微分方程。数学上如何描述呢,我们先从简单的情形开始——常微分方程,即不带偏导数的微分方程。

常微分方程 (ODE)

基本定义

设定 $x$ 为一个自变量,$y$为因变量,以及$y$的各阶导数$y’, y’’, \dots, y^{(n)}$。

定义($n$ 阶 ODE):

$$ F(x, y, y', \dots, y^{(n)}) = 0 \quad (\star) $$

满足该等式的方程称为一个 $n$ 阶常微分方程

定义(解):

若函数 $y(x)$在区间$[a, b]$上满足方程$(\star)$,则称 $y(x)$为该方程在区间$[a, b]$ 上的一个


2. 示例

一阶模型:指数衰减

$$ m'(t) = -a m(t) $$

  • 解的形式: $m(t) = C e^{-at} \quad (\forall C \in \mathbb{R})$- 特性: 解存在且不唯一(取决于常数$C$)。

二阶模型:简谐振动

$$ x''(t) = -k x(t) $$

  • 也许可以注意到的解: $x(t) = \sin(t)$或$x(t) = \cos(t)$- 注意到方程的线性,于是找到比较一般的解:$x(t) = C_1 \cos(t) + C_2 \sin(t) \quad (\forall C_1, C_2 \in \mathbb{R})$

这个比较一般的解,我们称为通解。

通解 (General Solution) 的定义

对于含有 $n$个相互独立的任意常数$C_1, C_2, \dots, C_n$的解函数组$y(x; C_1, C_2, \dots, C_n)$,若满足以下两个条件:

  1. 独立性: 常数 $C_1, C_2, \dots, C_n$在区间$x \in [a, b]$ 上是相互独立的。

  2. 有效性: 对于每一组固定的 $C_1, \dots, C_n$,函数 $y(x, C_1, \dots, C_n)$在$[a, b]$上均满足方程$(\star)$。

则称 $y(x; C_1, \dots, C_n)$为方程$(\star)$ 的一个 通解
固定常数后的函数也就被称为特解,例如简谐振动示例中的 $\sin(t)$就是取常数为$0,1$ 。


常数独立性 (Wronskian 行列式)

为了判断一组解是否能构成通解,需要引入线性无关性的判定:

定义(常数独立性):

对于函数组 $\psi(x, C_1, C_2, \dots, C_n)$,若 $C_1, \dots, C_n$在$x \in [a, b]$ 上线性独立,其充要条件通常涉及 Wronskian 行列式不为零:

$$ \left| \frac{\partial(\psi, \psi', \psi'', \dots, \psi^{(n-1)})}{\partial(C_1, C_2, C_3, \dots, C_n)} \right| \neq 0, \quad x \in [a, b] $$

逻辑闭环:

  • 一阶方程有一个待定常数 $C$。

  • 二阶方程有两个相互独立的待定常数 $C_1, C_2$。

  • n 阶方程则需要 $n$ 个线性独立的解来构造通解。

我们可以验证一下简谐振动的解是不是符合常数独立性。

验证:通解中常数的独立性

1. 设定函数形式

已知二阶方程的解函数族为:

$$ x(t, C_1, C_2) = C_1 \cos(t) + C_2 \sin(t), \quad \forall C_1, C_2 \in \mathbb{R} $$

对其求一阶导数(关于时间 $t$):

$$ x'(t, C_1, C_2) = -C_1 \sin(t) + C_2 \cos(t) $$

2. 构造行列式 (Wronskian 思想的变形)

为了验证 $C_1, C_2$ 的独立性,计算函数向量对常数向量的偏导数行列式:

$$ \left| \frac{D(x, x')}{D(C_1, C_2)} \right| = \begin{vmatrix} \frac{\partial x}{\partial C_1} & \frac{\partial x}{\partial C_2} \\ \frac{\partial x'}{\partial C_1} & \frac{\partial x'}{\partial C_2} \end{vmatrix} $$

3. 代入计算

将偏导数结果代入矩阵:

$$ = \begin{vmatrix} \cos(t) & \sin(t) \\ -\sin(t) & \cos(t) \end{vmatrix} $$

利用行列式计算规则 $ad - bc$:

$$ = \cos^2(t) - (-\sin^2(t)) $$

$$ = \cos^2(t) + \sin^2(t) $$

$$ = 1 \neq 0 $$


结论

由于该行列式的值为 1(恒不为零),根据判定准则,常数 $C_1$与$C_2$ 在解空间中是相互独立的。

这证明了 $x(t) = C_1 \cos(t) + C_2 \sin(t)$ 确实是该二阶微分方程的通解


一般的方程的解,我们也可以看成函数,那么也就有所谓隐函数,相应的,这里有所谓通积分。

通积分 (General Integral)

1. 定义

对于 $n$阶常微分方程$F(x, y, y’, \dots, y^{(n)}) = 0 \quad (\star)$,如果其通解是由一个隐函数方程给出的:

$$ \Phi(x, y; C_1, C_2, \dots, C_n) = 0 $$

若该等式在满足常数独立性的前提下,能够通过对 $x$求导等代数运算还原为原方程$(\star)$,则称该隐式方程为原方程的 通积分

核心区别:

  • 通解:通常指显式函数形式 $y = f(x, C_1, \dots, C_n)$。

  • 通积分:指隐式方程形式,不一定能轻易解出显式的 $y$。

实际上,也就是消除了 $y$ 的导数的影响,也就是解掉了微分。


2. 案例演示:圆族与微分方程

板书通过一个几何例子展示了通积分与微分方程的转换逻辑:

  • 微分方程: $x + y \cdot y’ = 0$- 通积分猜测:$x^2 + y^2 = C$ (这是一个以原点为圆心的圆族)

验证过程:

对隐式方程 $x^2 + y^2 = C$关于$x$ 求导:

  1. $\frac{d}{dx}(x^2) + \frac{d}{dx}(y^2) = \frac{d}{dx}(C)$2.$2x + 2y \cdot y’ = 0$

  2. 化简得:$x + y \cdot y’ = 0$

结论:

隐式方程 $x^2 + y^2 = C$是微分方程$x + y \cdot y’ = 0$ 的通积分。如果写成显式通解,则为:

$$ y = \pm \sqrt{C - x^2} $$


3. 几何直观

在坐标系中,这个通积分代表了一系列同心圆。微分方程 $y’ = -\frac{x}{y}$ 实际上描述了圆上任意一点的切线斜率必须与该点到原点的连线(半径)垂直。


会不会有解落在通解之外呢,或者说遍历通解中的常数也取不到某个解?

定义:奇解 (Singular Solution)

若函数 $y(x)$满足原方程$(\star)$,但它不包含在通解中(即无法通过给通解中的任意常数 $C$ 赋值来得到),则称其为方程的一个奇解

典型案例分析:$y^2 + (y’)^2 = 1$

1. 通解及其验证

给定微分方程:

$$ y(x)^2 + (y'(x))^2 = 1 $$

通解形式为:

$$ y(x) = \sin(x-c), \quad c \in \mathbb{R} $$

常数独立性验证:

通过对常数 $c$ 求偏导来判断其是否提供了一个有效的自由度:

$$ \partial_c y = -\cos(x-c) \not\equiv 0 $$

核心逻辑: 虽然在某些特定点该偏导数为零,但在区间内它不恒等于零,因此常数 $c$ 是独立的。


2. 奇解 (Singular Solutions)

观察方程结构,可以发现两个不包含在上述通解族中的特殊恒等解:

  • $y(x) \equiv 1$

  • $y(x) \equiv -1$

验证: 若 $y = \pm 1$,则 $y’ = 0$。代入原方程:$(\pm 1)^2 + 0^2 = 1$,等式成立。

由于这两个解无法通过给通解中的 $c$ 赋值得到($\sin$ 函数无法恒等于 1),它们被定义为该方程的奇解


包络与奇解 (Envelope and Singular Solution)

核心定义

针对 一阶常微分方程 (1st Order ODE)

若某个函数 $y(x)$ 在其曲线上:

  • 每一点 都与该方程通解族中的 某一个解 相切;

  • 且 $y(x)$ 本身也满足该微分方程。

则 $y(x)$ 为该方程的一个 奇解


为什么“相切”意味着“唯一性失效”?

从几何角度来看,包络线具有一种奇特的“重合”属性:

  1. 坐标相同: 在切点处,包络线与通解曲线的 $y$ 值一致。

  2. 斜率相同: 由于相切,它们的导数 $y’$ 也完全一致。

推论:

对于同一个初值点 $(x_0, y_0)$,现在出现了两条不同的积分曲线(包络线本身和穿过该点的通解曲线),它们在该点具有相同的斜率。这说明在该轨迹上,微分方程解的存在唯一性定理 遭到了破坏。


判别逻辑
  • 通解族: $\Phi(x, y, C) = 0$- 包络线方程: 通常通过联立以下方程组并消去参数$C$ 获得:

$$ \begin{cases} \Phi(x, y, C) = 0 \\ \frac{\partial \Phi}{\partial C} = 0 \end{cases} $$

  • 验证: 求出的包络线方程如果代入原 ODE 成立,且无法通过给 $C$ 赋值得到,则它就是奇解。

实际上奇解有无穷多个,就上面的例子而言,我们可以在 $y=-1$走一段,然后沿着三角函数走到$y=1$ ,然后再随便走……也许正如,当你看到一只蟑螂,屋子里已经满是蟑螂了(?)从另一个视角来看,通解甚至只是解的一小部分(


初值问题 (Cauchy 问题)

对于一个 $n$ 阶常微分方程,如何通过初始条件锁定唯一轨迹。

定义

对于 $n$ 阶 ODE:$F(x, y, y’, \dots, y^{(n)}) = 0$,寻找一个特解 $y(x)$使其满足如下$n$ 个初始条件:

$$ \begin{cases} y(0) = y_0 \\ y'(0) = y_1 \\ \dots \\ y^{(n-1)}(0) = y_{n-1} \end{cases} $$

其中 $y_0, y_1, \dots, y_{n-1}$ 为给定的初值

研究核心

对于 Cauchy 问题,数学家和物理学家最关心的三个维度:

  1. 存在性 (Existence): 是否真的能找到这样一个解?

  2. 唯一性 (Uniqueness): 是否有且仅有一个解?(对应了刚才讨论的“包络线/奇解”是否会破坏唯一性)。

  3. 长期行为 (Long-term Behavior): 随着自变量 $x$(通常是时间 $t$)的增加,解是趋于稳定、发散还是进入混沌状态?

怎么看存在性呢?

通解常数的独立性与逆映射 (Independence & Inverse Mapping)

1. 初值条件的方程组形式

对于一个包含 $n$个待定常数$C_1, \dots, C_n$的通解$y(x, C_1, \dots, C_n)$,给定初值 $(y_0, y_1, \dots, y_{n-1})$,我们可以建立如下方程组:

$$ \begin{cases} y(0, C_1, \dots, C_n) = y_0 \\ y'(0, C_1, \dots, C_n) = y_1 \\ \dots \\ y^{(n-1)}(0, C_1, \dots, C_n) = y_{n-1} \end{cases} $$

2. 核心判定:Jacobi 行列式

要使上述初值能够唯一地锁定一组常数 $(C_1, \dots, C_n)$,必须保证该映射在局部是可逆的。其判定条件为 Jacobi 行列式不为零:

$$ \left| \frac{D(y, y', \dots, y^{(n-1)})}{D(C_1, C_2, \dots, C_n)} \right| \neq 0 $$

  • 数学含义: 这一条件等价于常数的 独立性 (Independence)

  • 几何直观: 它保证了从“常数空间”到“初值空间”的映射是一个局部微分同胚。即对于每一组合理的初值,我们都能反向找到唯一对应的常数解。

3. 逆映射定理的视角

更抽象的映射描述:

  • 设映射 $g(\vec{C}) = \vec{u}$,其中 $\vec{C}$ 是常数向量,$\vec{u}$ 是初值向量。

  • 若 Jacobi 行列式非零,则根据 逆映射定理 (Inverse Function Theorem),存在逆映射:

$$ \vec{C} = g^{-1}(\vec{u}) $$

  • 这意味着:通解之所以能通过初值确定特解,本质上是因为常数的独立性保证了映射的可逆性。

通解的局限性

通解只是我们预期的一般的规律,除了上述的奇解之外,我们可以考虑:

$$ F(x,y,y')=0和G(x,y,y')=0 $$

我们把两个方程相乘就得到一个新的微分方程,这两个方程可以风马牛不相及,但是他们的通解都是新的方程通解,有两个通解?!

具体计算

变量分离法 (Separable Variables)

1. 基本形式

对于一阶常微分方程(First-order ODE),若其形式如下:

$$ y'(x) = f(x) \cdot g(y) $$

2. 解题步骤

  • 寻找常数解(平衡解):

    观察 $g(y)$是否有零点。即若存在常数$c_0$使得$g(c_0) = 0$,则 $y(x) = c_0$ 是原方程的一个解

  • 变量分离:

    若在某个区间上 $g(y) \neq 0$,则可将方程改写为:

$$ \frac{y'}{g(y)} = f(x) $$

3. 原理解析

设 $F’(x) = f(x)$,$G’(y) = \frac{1}{g(y)}$(假设 $g(y) \neq 0$)。

对上述分离后的方程两边关于 $x$ 求导/积分,可得隐式解:

$$ G(y(x)) = F(x) + C $$

若 $G$ 存在逆函数,则显式解为:

$$ y(x) = G^{-1}(F(x) + C) $$

验证:

利用复合函数求导法则:

$$ y'(x) = (G^{-1})'(F(x) + C) \cdot F'(x) = \frac{1}{G'(G^{-1}(F(x)+C))} \cdot f(x) = g(y) \cdot f(x) $$


例题演示

方程: $y’ = -xy$这里$f(x) = -x$,$g(y) = y$。

  1. 检查零点:

    令 $g(y) = y = 0$,得到 $y \equiv 0$ 是方程的一个特解

  2. 分离变量(假设 $y \neq 0$):

$$ \frac{y'}{y} = -x $$

  1. 两边积分:

$$ \int \frac{1}{y} dy = \int -x dx $$

$$ \ln|y| = -\frac{1}{2}x^2 + C $$

为了解出 $y$,对等式两边取指数:

$$ |y| = e^{-\frac{1}{2}x^2 + C} = e^C \cdot e^{-\frac{1}{2}x^2} $$

令 $\tilde{C} = e^C$(由于 $e^C > 0$,故 $\tilde{C} > 0$),则有:

$$ |y| = \tilde{C} e^{-\frac{1}{2}x^2} $$

去掉左边的绝对值符号,右边引入正负号:

$$ y = \pm \tilde{C} e^{-\frac{1}{2}x^2} $$

此时,系数 $\pm \tilde{C}$ 可以取遍所有非零实数。

注意到我们在步骤 ① 中发现的常数解 $y \equiv 0$

  • 如果我们允许上述式子中的系数取 0,那么这个式子就能涵盖 $y \equiv 0$。

  • 重新定义一个新的任意常数 $\hat{C}$,使其包含正数、负数以及零($\hat{C} \in \mathbb{R}$)。

最终,方程的**通解(General Solution)**写为:

$$ \mathbf{y(x) = \hat{C} e^{-\frac{1}{2}x^2}} $$

变量替换(Variable Substitution)

基本模型:

对于形如 $y’ = f(ax + by + c)$ 的微分方程:

  1. 令: $z = ax + by + c$2. 求导:$z’ = a + b \cdot y’ = a + b \cdot f(z)$3. 转化: 得到关于$z$ 的可分离变量方程:$z’ = a + b f(z)$

典型例题

方程: $y’ = \sin(x + y + 1)$

1. 变量替换

令 $z = x + y + 1$,则有 $z’ = 1 + y’$。

代入原方程得:

$$ z' = 1 + \sin(z) $$

2. 寻找奇异解(Equilibrium Solutions)

考察 $1 + \sin(z) = 0$ 的情况:

当 $z = 2k\pi + \frac{3}{2}\pi$ ($k \in \mathbb{Z}$) 时,$z’ = 0$。

反代回原变量,得到一组直线解

$y(x) = 2k\pi + \frac{3}{2}\pi - x - 1$

3. 通解计算(分离变量法)

当 $1 + \sin(z) \neq 0$ 时,进行积分:

$$ \int \frac{dz}{1 + \sin(z)} = \int 1 dx $$

  • 左侧积分推导:

    利用三角恒等式变换,积分为:

$$ -\frac{\cos(z)}{1 + \sin(z)} = \tan\left(\frac{z}{2} - \frac{\pi}{4}\right) $$

(注:利用了半角公式进行简化)

  • 得出结果:

$$ \tan\left(\frac{x + y + 1}{2} - \frac{\pi}{4}\right) = x + C $$

进一步整理得:

**$y = 2 \arctan(x + C) + \frac{\pi}{2} - x - 1$**

注意到,$y$可以加上$2k\pi$ 而不影响方程成立,所以实际上的通解为:

$$ y = 2 \arctan(x + C) + \frac{\pi}{2} - x - 1+2k\pi $$


关于解

该方程解的族群分布:

  • 特征: 解曲线被一系列斜率为 $-1$的平行直线(即奇异解$y = -x - 1 + 2k\pi + \frac{3}{2}\pi$)所分割。

  • 趋势: 在这些“隔离带”之间,通解曲线呈现出周期性的波动形态。当 $x \to \infty$ 时,解会无限趋近于这些特定的直线。


二,齐次

1. 识别模型

当微分方程可以表示为自变量与因变量比值的函数时:

$$ y' = f(x, y) = h\left(\frac{y}{x}\right) $$

2. 引入中间变量

令:

$$ u = \frac{y}{x} \implies y = x \cdot u $$

3. 求导变换

对 $y = xu$关于$x$ 求导(应用乘积法则):

$$ y' = (xu)' = x \cdot u' + u $$

4. 建立新方程

将上述结果代入原方程 $y’ = h(u)$:

$$ xu' + u = h(u) $$

整理得:

$$ u' = \frac{h(u) - u}{x} $$


逻辑拆解

  • 本质: 这种变换的精髓在于通过“比例化”将一个二元函数 $f(x, y)$塌缩为一元函数$h(u)$,从而将方程转化为可分离变量的形式:

$$ \frac{du}{h(u) - u} = \frac{dx}{x} $$

  • 适用场景: 如果方程中 $x$和$y$的每一项次数相同(齐次),那么它一定能化为$h(y/x)$ 的形式。

  • 潜在风险: 在后续积分过程中,需额外注意分母 $h(u) - u = 0$ 的情况,这通常对应于解空间中的射线(即平衡解)。


三,分式线性组合

一、 核心模型

方程形式为:

$$ y' = f\left( \frac{a_1 x + b_1 y + c_1}{a_2 x + b_2 y + c_2} \right) $$

这种方程的处理方式取决于分子、分母所代表的两条直线的几何关系,即行列式 $D = \begin{vmatrix} a_1 & b_1 \ a_2 & b_2 \end{vmatrix}$ 是否为零。


二、 情况 (a):相交直线($D \neq 0$)

当两条直线相交时,可以通过平移坐标原点到交点来消除常数项 $c_1$和$c_2$。

  1. 求交点: 解线性方程组 $\begin{cases} a_1 x + b_1 y + c_1 = 0 \ a_2 x + b_2 y + c_2 = 0 \end{cases}$,得到唯一解 $(x_0, y_0)$。

  2. 坐标平移: 令 $u = x - x_0, v = y - y_0$。

  3. 方程转化: 代入原方程后,常数项消失,方程变为:

$$ v'(u) = f\left( \frac{a_1 u + b_1 v}{a_2 u + b_2 v} \right) = f\left( \frac{a_1 + b_1(v/u)}{a_2 + b_2(v/u)} \right) $$

此时,方程转化为了标准的齐次方程,可用 $w = v/u$ 进一步求解。


三、 情况 (b):平行直线($D = 0$)

当两条直线平行时,意味着系数成比例:$(a_1, b_1) = \lambda(a_2, b_2)$。

  1. 比例简化: 此时分子和分母的线性部分是相关的。

$$ y' = f\left( \frac{(a x + b y) + c_1}{\lambda(a x + b y) + c_2} \right) = g(ax + by) $$

  1. 变量替换: 此时回到最简单的模式,令 $z = ax + by$

  2. 结果: 转化为可分离变量的方程进行计算。


总结与观察

这展示了数学处理中“化归”的思想:

  • 如果有交点,就通过“平移”消除常数项,化归为齐次方程

  • 如果无交点(平行),就通过“整体替换”化归为一元函数方程

至此,我们已经完整收集了一阶微分方程变量替换法的三大招式:

  1. $y’ = f(ax+by+c)$(整体替换)

  2. $y’ = h(y/x)$(齐次化替换)

  3. $y’ = f(\frac{L_1}{L_2})$(坐标平移/平行替换)

一阶线性 ODE(关于 $y, y’$ 线性)

1. 基本定义与分类

方程的标准形式为:

  • 非齐次方程: $y’ + P(x)y = Q(x)$—— 记作$(*)$- 齐次方程:$y’ + P(x)y = 0$—— 记作$(**)$

2. 解的结构理论

线性方程最迷人的地方在于其解的可叠加性:

  • 齐次解的线性性质: 若 $y_1, y_2$为$()$的两个解,则其线性组合$C_1y_1 + C_2y_2$亦为解。其通解具有$C\varphi(x)$ 的形式,且没有奇异解**。这不难验证,代入即可。

  • 通解结构公式:

    若 $\hat{y}$是非齐次方程$()$ 的一个*特解,$\varphi$是对应齐次方程$()$的一个非零解**,则$(*)$ 的通解可表示为:

$$ y = \hat{y} + C\varphi $$

直观理解: 这与线性代数中“非齐次线性方程组的通解 = 特解 + 齐次方程组通解”的逻辑完全一致。


齐次方程 $(**)$ 的求解推导

利用积分因子法求解齐次方程的过程:

  1. 构造原函数: 令 $F(x)$满足$F’(x) = P(x)$,即 $F(x) = \int P(x)dx$。

  2. 引入积分因子: 在方程 $(**)$两端同时乘以$e^{F(x)}$(显然 $e^{F(x)} \neq 0$):

$$ y'e^F + yF'e^F = 0 $$

  1. 逆用乘积导数法则:

$$ (ye^F)' = 0 $$

  1. 积分得出结论:

$$ ye^F = C \implies y(x) = Ce^{-F(x)} $$

即齐次方程的通解为:$y(x) = C e^{-\int P(x)dx}$

这实际上很符合直觉,正如 $y’+y=0$我们会猜解$y=e^{-x}$ 。 我们利用了指数求导不变来构造微分。又由于实际上每一步都是等价变换,所以没有奇解。

非齐次方程的求解——常数变易法 (Variation of Parameters)

1. 核心思想

对于齐次方程 $(**)$的通解$y = Ce^{-F(x)}$,我们大胆假设非齐次方程 $(*)$的通解具有相同的形式,但将常数$C$替换为待定函数$C(x)$:

$$ y = C(x)e^{-F(x)} $$

2. 求解过程

继续沿用积分因子 $e^{F(x)}$

  • 原方程: $y’ + P(x)y = Q(x)$——$(*)$- 乘积分因子: 左右同乘$e^{F(x)}$,其中 $F’(x) = P(x)$:

$$ y'e^F + yP(x)e^F = Q(x)e^F $$

  • 合并左端: 根据导数乘积法则的逆过程:

$$ (ye^F)' = Q(x)e^F $$

  • 两端积分:

$$ ye^{F(x)} = \int_{x_0}^x Q(\tilde{x})e^{F(\tilde{x})}d\tilde{x} + C $$


二、 一阶线性 ODE 的通用公式

通过上述推导,也就得到了最终的通解公式

$$ y(x) = \left( \int_{x_0}^x Q(\tilde{x})e^{F(\tilde{x})} d\tilde{x} + C \right) e^{-F(x)} $$

结构拆解:

  1. 特解部分: $e^{-F(x)} \int Q(x)e^{F(x)}dx$2. 齐次解部分:$Ce^{-F(x)}$

这同样步步等价,所以这并没有奇解,这是线性方程的优良性质。


示例:RL电路

1. 电路构成

  • 电源电动势: $E$- 电感:$L$- 电阻:$R$

2. 建立方程

根据基尔霍夫电压定律(KVL),电路的电压平衡方程为:

$$ L \cdot I'(t) + R \cdot I(t) = E $$

设定初始条件:$I(0) = 0$(即电路在 $t=0$ 时刻接通,初始电流为零)。


数学转化与求解

1. 标准化处理

为了套用一阶线性 ODE 的公式,将方程两端同除以 $L$:

$$ I' + \frac{R}{L}I = \frac{E}{L} $$

令常数 $P = \frac{R}{L}$,$Q = \frac{E}{L}$,方程简化为标准型:

$$ I' + PI = Q $$

2. 积分因子法求解

  • 积分因子: $e^{Pt}$- 变换:$(I \cdot e^{Pt})’ = Q e^{Pt}$- 积分:$I \cdot e^{Pt} = \frac{Q}{P} e^{Pt} + C$- 通解公式:$I(t) = \frac{Q}{P} + C e^{-Pt}$

带入物理量与初始条件

1. 代回物理参数

由于 $\frac{Q}{P} = \frac{E/L}{R/L} = \frac{E}{R}$,通解写为:

$$ I(t) = \frac{E}{R} + C e^{-\frac{R}{L}t} $$

2. 确定待定常数

代入初始条件 $I(0) = 0$:

$$ 0 = \frac{E}{R} + C \implies C = -\frac{E}{R} $$

3. 最终特解

$$ I(t) = \frac{E}{R} \left( 1 - e^{-\frac{R}{L}t} \right) $$


物理意义评估

  • 暂态响应: 指数项 $e^{-\frac{R}{L}t}$描述了电流从零开始增长的过程。电感$L$ 的存在产生了“反电动势”,阻碍了电流的突变。

  • 稳态电流: 当 $t \to \infty$时,指数项趋于$0$,电流趋于稳定值:

$$ I_{\text{steady}} = \frac{E}{R} $$

此时电感相当于短路,遵循基本的欧姆定律。


积分因子

一、 问题的引入:全微分方程

1. 基本形式

将微分方程写成对称形式:

$$ P(x, y)dx + Q(x, y)dy = 0 $$

2. 判定条件(恰当性检验)

如果存在一个函数 $u(x, y)$使得$du = P dx + Q dy = 0$,那么该方程称为全微分方程(或恰当方程)。其通解直接为:

$$ u(x, y) = C $$

根据全微分的性质,这要求满足:

$$ Q_x = P_y $$

(即 $\frac{\partial Q}{\partial x} = \frac{\partial P}{\partial y}$)


二、 非全微分方程与积分因子

如果 $N_x \neq M_y$,方程就不是全微分的。此时,我们寻找一个非零函数 $\mu(x, y)$,使得乘以它之后方程变得“恰当”:

$$ \mu M dx + \mu N dy = 0 \implies (\mu N)_x = (\mu M)_y $$

这里的 $\mu$ 被称为积分因子


三、 积分因子的求解推导(以一元因子为例)

寻找通用的 $\mu(x, y)$通常涉及偏微分方程,非常困难。寻找一元积分因子(仅与$x$或$y$ 有关)的捷径:

1. 展开判定式:

根据乘积求导法则,$(\mu N)_x = (\mu M)_y$ 展开为:

$$ \mu N_x + \mu_x N = \mu M_y + \mu_y M $$

整理得:

$$ \mu(N_x - M_y) = -\mu_x N + \mu_y M $$

2. 假设 $\mu = \mu(x)$:

此时 $\mu_y = 0$,方程简化为:

$$ \mu(N_x - M_y) = -\mu_x N $$

变形得到关于 $\mu$ 的可分离变量方程:

$$ \frac{\mu_x}{\mu} = -\frac{N_x - M_y}{N} $$

3. 求解结论:

如果右端项 $\frac{M_y - N_x}{N}$仅是$x$的函数,记为$F(x)$,那么积分因子为:

$$ \mu(x) = e^{\int F(x) dx} $$


补充情况:$\mu = \mu(y)$ 的判定

如果积分因子仅是 $y$的函数,推导过程与$x$ 对称:

  1. 判定条件: 考察表达式 $\frac{N_x - M_y}{M}$。

  2. 结论: 若该式仅与 $y$有关,记为$G(y)$,则有:

$$ \frac{\mu_y}{\mu} = \frac{N_x - M_y}{M} = G(y) $$

  1. 积分因子公式:

$$ \mu(y) = e^{\int G(y) dy} $$


二、 综合例题演练

方程: $(2xy^2 - y)dx + (x + 3y^3)dy = 0$其中$M = 2xy^2 - y$,$N = x + 3y^3$。

1. 恰当性检查

  • $M_y = 4xy - 1$-$N_x = 1$显然$M_y \neq N_x$,方程不是全微分方程。

2. 寻找积分因子(试错过程)

  • 尝试 $\mu(x)$:

    计算 $\frac{N_x - M_y}{N} = \frac{1 - (4xy - 1)}{x + 3y^3} = \frac{2 - 4xy}{x + 3y^3}$。

    结果含有 $y$,说明不存在仅与 $x$ 有关的积分因子。

  • 尝试 $\mu(y)$:

    计算 $\frac{N_x - M_y}{M} = \frac{1 - (4xy - 1)}{2xy^2 - y} = \frac{2(1 - 2xy)}{y(2xy - 1)} = -\frac{2}{y}$。

    结果仅与 $y$有关!满足条件,令$G(y) = -\frac{2}{y}$。

3. 计算积分因子

$$ \mu(y) = e^{\int -\frac{2}{y} dy} = e^{-2\ln|y|} = \frac{1}{y^2} $$

4. 转化与求解

方程两端同乘 $\frac{1}{y^2}$,得到新方程:

$$ \frac{2xy^2 - y}{y^2}dx + \frac{x + 3y^3}{y^2}dy = 0 $$

简化为:

$$ \left( 2x - \frac{1}{y} \right)dx + \left( \frac{x}{y^2} + 3y \right)dy = 0 $$

验证可知,此时 $P_y = \frac{1}{y^2}$,$Q_x = \frac{1}{y^2}$,已变为全微分方程。

5. 最终通解

对 $P$关于$x$积分,对$Q$关于$y$ 积分并合并(注意去重):

$$ u(x, y) = x^2 - \frac{x}{y} + \frac{3}{2}y^2 = C $$

另外,注意到 $y \equiv 0$ 时,$M=0$同时$dy=0$ ,那么这时候方程也成立。

齐次方程的特殊积分因子

核心定理:

对于齐次微分方程 $M(x, y)dx + N(x, y)dy = 0$(即 $M, N$为同次数的齐次函数),如果$xM + yN \neq 0$,则该方程的一个积分因子为:

$$ \mu(x, y) = \frac{1}{xM + yN} $$

证明:

1. 核心工具:欧拉齐次函数定理

根据齐次函数的性质,若 $f(x, y)$是$n$ 次齐次的,则满足:

$$ x \frac{\partial f}{\partial x} + y \frac{\partial f}{\partial y} = n f $$

具体到我们的函数:

  • (1) $x M_x + y M_y = n M$- (2)$x N_x + y N_y = n N$

2. 判定目标

我们需要证明,乘以 $\mu$后的方程$\frac{M}{xM+yN}dx + \frac{N}{xM+yN}dy = 0$ 满足全微分条件:

$$ \frac{\partial}{\partial y} \left( \frac{M}{xM + yN} \right) = \frac{\partial}{\partial x} \left( \frac{N}{xM + yN} \right) $$


3. 分步求偏导

左侧(对 $y$ 求偏导):

应用商法则 $\left(\frac{u}{v}\right)’ = \frac{u’v - uv’}{v^2}$,设分母 $D = xM + yN$:

$$ \frac{\partial}{\partial y} \left( \frac{M}{D} \right) = \frac{M_y (xM + yN) - M \frac{\partial}{\partial y}(xM + yN)}{D^2} $$

展开分母的偏导项 $\frac{\partial D}{\partial y} = x M_y + N + y N_y$:

$$ \text{分子} = M_y(xM + yN) - M(x M_y + N + y N_y) $$

$$ = x M M_y + y M_y N - x M M_y - MN - y M N_y $$

消去 $x M M_y$,得到:

$$ \text{分子}_L = y M_y N - MN - y M N_y \quad \dots (\alpha) $$

右侧(对 $x$ 求偏导):

同样应用商法则:

$$ \frac{\partial}{\partial x} \left( \frac{N}{D} \right) = \frac{N_x (xM + yN) - N \frac{\partial}{\partial x}(xM + yN)}{D^2} $$

展开分母的偏导项 $\frac{\partial D}{\partial x} = M + x M_x + y N_x$:

$$ \text{分子} = N_x(xM + yN) - N(M + x M_x + y N_x) $$

$$ = x M N_x + y N N_x - MN - x N M_x - y N N_x $$

消去 $y N N_x$:

$$ \text{分子}_R = x M N_x - MN - x N M_x \quad \dots (\beta) $$


4. 利用欧拉定理进行等价变换

现在我们要证明 $(\alpha) = (\beta)$。将两式写在一起观察:

$$ y M_y N - MN - y M N_y \overset{?}{=} x M N_x - MN - x N M_x $$

消去两边的 $-MN$,整理得:

$$ N(y M_y + x M_x) \overset{?}{=} M(y N_y + x N_x) $$

此时,代入欧拉齐次函数定理

  • 左边 $= N \cdot (n M) = n MN$- 右边$= M \cdot (n N) = n MN$

左右相等!


二、 典型例题演练

方程: $(x - y)dx + (x + y)dy = 0$其中$M = x - y, N = x + y$,均为一阶齐次函数。

1. 恰当性检查

$N_x = 1, M_y = -1$。由于 $N_x \neq M_y$,方程不是全微分方程。

2. 解法视角一:齐次化替换(回顾)

可以将方程写为:

$$ \frac{dy}{dx} = -\frac{x - y}{x + y} = -\frac{1 - y/x}{1 + y/x} $$

这是典型的 $h(y/x)$形式,可用$u = y/x$ 求解。

3. 解法视角二:构造特殊积分因子

利用板书右侧的公式:

  • 分母计算: $xM + yN = x(x - y) + y(x + y) = x^2 - xy + xy + y^2 = x^2 + y^2$

  • 锁定因子: $\mu = \frac{1}{x^2 + y^2}$

4. 转化与积分

将 $\mu$ 乘回原方程:

$$ \frac{x - y}{x^2 + y^2}dx + \frac{x + y}{x^2 + y^2}dy = 0 $$

拆分项:

$$ \left( \frac{x}{x^2 + y^2}dx + \frac{y}{x^2 + y^2}dy \right) + \left( \frac{x dy - y dx}{x^2 + y^2} \right) = 0 $$

5. 最终通解

  • 第一部分是 $\frac{1}{2}d(\ln(x^2 + y^2))$- 第二部分是$d(\arctan\frac{y}{x})$

    合并得出:

$$ u(x, y) = \frac{1}{2}\ln(x^2 + y^2) + \arctan\frac{y}{x} = C $$

阅读全文

9.常微分方程 III

2026/4/19

线性常系数微分方程

1. 算子多项式的映射

当我们面对一个 $n$ 阶常系数齐次线性微分方程:

$$ a_n y^{(n)} + a_{n-1} y^{(n-1)} + \dots + a_1 y' + a_0 y = 0 $$

其实是在讨论微分算子 $D = \frac{d}{dx}$的一个多项式$P(D) = \sum_{i=0}^n a_i D^i$。

所谓的特征方程 $P(\lambda) = 0$,本质上是将算子 $D$ 视为一个变量,把微分方程抽象为了算子空间的代数方程:$P(D)y = 0$。

2. 根子空间与核空间(Kernel)的分解

根据代数基本定理,多项式 $P(\lambda)$ 可以在复数域内唯一分解为线性因子的乘积:

$$ P(\lambda) = \prod_{j=1}^k (\lambda - \lambda_j)^{m_j} $$

对应到微分算子,就有 $P(D) = \prod_{j=1}^k (D - \lambda_j)^{m_j}$。

由于这些算子因子 $(D - \lambda_j)^{m_j}$之间是两两可交换的,根据核空间分解定理(或称循环子空间分解),微分方程的解空间$V = \ker(P(D))$ 可以分解为若干个互不相干的子空间的直和:

$$ V = \ker((D - \lambda_1)^{m_1}) \oplus \ker((D - \lambda_2)^{m_2}) \oplus \dots \oplus \ker((D - \lambda_k)^{m_k}) $$

这里的每一个子空间 $\ker((D - \lambda_j)^{m_j})$,正是根子空间在函数空间中的体现。

3. 基向量的生成机制

在每个根子空间 $\ker((D - \lambda_j)^{m_j})$中,我们要寻找的是能够被$(D - \lambda_j)^{m_j}$ 湮灭(Annihilated)的所有函数。

  • 当 $m_j = 1$(单根)时,子空间由特征向量 $e^{\lambda_j x}$ 张成。

  • 当 $m_j > 1$(重根)时,单纯的特征向量不足以填满维度,于是产生了广义特征向量

通过平移公式 $D - \lambda = e^{\lambda x} D e^{-\lambda x}$可以证明,这个子空间的基底正好是${e^{\lambda_j x}, x e^{\lambda_j x}, \dots, x^{m_j-1} e^{\lambda_j x}}$。这与线性代数中 Jordan 标准型处理重特征值的逻辑完全一致。

所以实际上,常系数线性微分方程要做的也就只有做多项式分解,多项式分解能搞定,微分方程也就解决了。

例如 $f’’’-3f’+2f=0$,也就是考虑$D^3-3D+2$的分解,分解成$(D-1)^2(D-2)$,于是就有$f\in Ker(D-1)^2 \oplus Ker(D+2)$,那么$Ker(D-1)^2$是$c_1e^x+c_2xe^x$ ,$Ker(D+2)$是$c_3e^{-2x}$,和也就是$c_1e^x+c_2xe^x+c_3e^{-2x}$ ,也就是通解了。

特解

这个一方面是猜,如果要一般地做,也可以如下考虑:
“套娃”式地定义中间变量:

  • 令 $z_{n-1} = (D - \lambda_2)\dots(D - \lambda_n)y$

  • 则第一步求解:$(D - \lambda_1)z_{n-1} = f(x)$- 得到$z_{n-1}$后,再解$(D - \lambda_2)z_{n-2} = z_{n-1}$- 依此类推,直到解出$y$。

不过积分的话,就未必算的出了(

猜解

实际上也就是直觉经验。

1. $f(x)$为$n$次多项式$P_n(x)$当$f(x) = a_n x^n + \dots + a_1 x + a_0$ 时:

  • 若 $0$不是特征根(即$q \neq 0$):设特解 $\varphi^* = Q_n(x)$(同阶多项式)。

  • 若 $0$是单特征根(即$q = 0, p \neq 0$):设特解 $\varphi^* = x Q_n(x)$。

  • 若 $0$是二重特征根(即$q = p = 0$):设特解 $\varphi^* = x^2 Q_n(x)$。

2. $f(x)$为指数函数$e^{\alpha x}$当$f(x) = A e^{\alpha x}$ 时:

  • 若 $\alpha$不是特征根:设$\varphi^* = B e^{\alpha x}$。

  • 若 $\alpha$是单特征根:设$\varphi^* = B x e^{\alpha x}$。

  • 若 $\alpha$是二重特征根:设$\varphi^* = B x^2 e^{\alpha x}$。

3. $f(x)$ 为正余弦函数组合

当 $f(x) = D_1 \cos(\beta x) + D_2 \sin(\beta x)$ 时:

  • 若 $\pm i\beta$不是特征根:设$\varphi^* = A \cos(\beta x) + B \sin(\beta x)$。

  • 若 $\pm i\beta$是特征根:设$\varphi^* = x [A \cos(\beta x) + B \sin(\beta x)]$。

4. 复合形式

当 $f(x) = e^{\alpha x} [P_n(x) \cos(\beta x) + Q_m(x) \sin(\beta x)]$ 时:

这是最复杂的情况。设 $k = \max(n, m)$,若 $\alpha \pm i\beta$是特征方程的$s$ 重根(对于二阶方程,$s$取$0$或$1$),则:

$$ \varphi^* = x^s e^{\alpha x} [R_k(x) \cos(\beta x) + S_k(x) \sin(\beta x)] $$

另一种理解

我们之前从线性代数的角度思考了线性常系数微分方程的解,实际上可以考虑所谓的特征方程,而不考虑线性代数,虽然实际上几乎是一个东西,但是可以换种角度理解。

考虑二阶线性递推方程:

$$ a_{n+2}+c_1a_{n+1}+c_2a_n=0 $$

我们不会解,但是我们会解等比的递推,于是想到构造 $b_n=a_{n+1}+ka_n$ ,我们希望的是:

$$ b_{n+1}=qb_n $$

或者也就是

$$ a_{n+2}+xa_{n+1}=y(a_{n+1}+a_n) $$

这样,我们与原来的方程比较就能解出 $x,y$,从而解出$b_n$的通项,然后反求$a_n$ 。
对微分方程我们是不是也可以类似地转换呢:

$$ y''+c_1y'+c_2y=0 $$

二阶不会,一阶还是会的,于是构造 $h=y’-ky$ ,我们希望得到:

$$ h'-qh=0 $$

也就是

$$ (y'-ky)'-q(y'-ky)=0 $$

同样,与原式对比就可以解出 $k,q$,从而得到$y’+ky$ 的形式,然后再解一个一阶方程就好了。
我们具体算算,利用

$$ k+q=-c_1, qk=c_2 $$

可知 $q,k$也就是对应方程$x^2+c_1x+c_2$即所谓特征方程的两根$\lambda_1,\lambda_2$ 。
先考虑两根不同。
对这样的方程,当然想到直接分离变量积分:

$$ \frac{(y'-ky)'}{y'-ky}=q $$

积分并化简得到

$$ y'-ky=Ce^{qx} $$

然后乘上因子 $e^{-kx}$ :

$$ (e^{-kx}y)'=Ce^{(q-k)x} $$

积分得到

$$ e^{-kx}y=C_1e^{(q-k)x}+C_2' $$

也就有

$$ y=C_1e^{qx}+C_2e^{kx} $$

不难解出特征方程两根,于是 $y$ 的通解:

$$ y=C_1e^{-\lambda_1x}+C_2e^{-\lambda_2x} $$

如果两根相同,那么记为 $\lambda$ 。

$$ (y'-\lambda y)'-\lambda(y'-\lambda y)=0 $$

同样有

$$ y'-\lambda y=Ce^{\lambda x} $$

同样作用 $e^{-\lambda x}$ :

$$ (e^{-\lambda x}y)'=C $$

于是得到

$$ y=Cxe^{\lambda x} $$

这与我们考虑线性算子时得到的结果一致。

特解

在线性算子中,我们具体考虑特解的一般性计算,将考虑微分算子的逆,笨人并未研究。
这里我们则可以比较形式化地直接得到特解,考虑:

$$ y''+c_1y'+c_2y=f(x) $$

我们故技重施,写成:

$$ (y'-\lambda_1y)'-\lambda_2(y'-\lambda_1y)=f(x) $$

这就降成了一阶微分方程,这样乘上积分因子 $e^{-\lambda_2x}$,记$u=y’-\lambda_1 y$ :

$$ (e^{-\lambda_2x}u)'=f(x)e^{-\lambda_2x} $$

积分得到:

$$ y'-\lambda_1y=e^{\lambda_2x}(\int f(x)e^{-\lambda_2x}dx+C) $$

再来一次:

$$ (e^{-\lambda_1x}y)'=RHS\cdot e^{-\lambda_1x} $$

如果两根不同,则积分:

$$ y=e^{\lambda_1x}(\int(e^{(\lambda_2-\lambda_1)x}\int f(x)e^{-\lambda_2x}dx+C)dx+C') $$

把常数分离一下就得到:

$$ y = e^{\lambda_1x} \left( \int e^{(\lambda_2-\lambda_1)x} \left( \int f(x)e^{-\lambda_2x} dx \right) dx + C_1 \int e^{(\lambda_2-\lambda_1)x} dx + C_2 \right) $$

也就得到了解的一般形式,但是一般猜解还是舒服一点。
如果两根相同,那么第二项积分就变成 $C_1x$ 了。

第一项积分看起来有点丑陋,而且并不对称,但实际上可以通过运算化简,我们写成定积分:

$$ \int_{a}^{x} \left( \int_{a}^{t} f(s) e^{-\lambda_1 s} ds \right) e^{(\lambda_1 - \lambda_2)t} dt \cdot e^{\lambda_2 x} $$

分部积分:

$$ = \left( \left. \int_{a}^{s} f(s) e^{-\lambda_1 s} ds \cdot \frac{e^{(\lambda_1 - \lambda_2)t}}{\lambda_1 - \lambda_2} \right|_{t=a}^{t=x} - \int_{a}^{x} f(t) e^{-\lambda_1 t} \cdot \frac{e^{(\lambda_1 - \lambda_2)t}}{\lambda_1 - \lambda_2} dt \right) e^{\lambda_2 x} $$

$$ = \left( \int_{a}^{x} f(s) e^{-\lambda_1 s} ds \cdot \frac{e^{(\lambda_1 - \lambda_2)x}}{\lambda_1 - \lambda_2} + \int_{0}^{x} \frac{f(t) e^{-\lambda_2 t}}{\lambda_2 - \lambda_1} dt \right) e^{\lambda_2 x} $$

最终形式:

$$ = \left( \int_{a}^{x} \frac{f(t) e^{-\lambda_1 t}}{\lambda_1 - \lambda_2} dt \right) e^{\lambda_1 x} + \left( \int_{a}^{x} \frac{f(t) e^{-\lambda_2 t}}{\lambda_2 - \lambda_1} dt \right) e^{\lambda_2 x} $$

① $\lambda_1 \neq \lambda_2$

$$ y(x) = \left( \int^x \frac{f(t) e^{-\lambda_1 t}}{\lambda_1 - \lambda_2} dt + C_1 \right) e^{\lambda_1 x}

  • \left( \int^x \frac{f(t) e^{-\lambda_2 t}}{\lambda_2 - \lambda_1} dt + C_2 \right) e^{\lambda_2 x}
    $$

② $\lambda_1 = \lambda_2 = \lambda$

$$ y(x) = \left( \int^x f(t) \cdot t e^{-\lambda t} dt + C_1 \right) e^{\lambda x} + \left( \int^x f(t) e^{-\lambda t} dt + C_2 \right) x e^{\lambda x} $$

这是非常正统,非常一般化的解,但是显然不太好算,也记不住。我们观察形式,发现:

$$ 齐次部分对应:c_1\phi_1(x)+c_2\phi_1(x) $$

$$ 非齐次部分对应:D_1(x)\phi_1(x)+D_2(x)\phi_2(x) $$

常数变易法

被判定为邪修,但是很好用(),根据上面我们的观察,我们知道只要整出来齐次的解,只要把系数设成新的函数带进去解出来就可以得到方程的解。实际上就是我们算出来的那一大坨,但是那显然不好记忆()

这实际上对非常系数的微分方程也成立,就不证了(buhui),非常系数的齐次解也没有通用的解法,但是我们还是假定我们找到了齐次的通解 $\varphi_1,\varphi_2$ ,然后现在讨论常数变易法。

原方程:

$$ y''+p(x)y'+q(x)y=f(x) $$

假装解出来了齐次解,安上两个系数函数:

$$ y=C_1(x)\varphi_1(x)+C_2(x)\varphi_2(x) $$

求导:

$$ y'=C_1'\varphi_1+C_1\varphi_1'+C_2'\varphi_2+C_2\varphi_2' $$

$$ y'(x) = \underline{C_1' \varphi_1 + C_2' \varphi_2} + C_1 \varphi_1' + C_2 \varphi_2' $$

$\qquad$设划线处$= 0$ (一会解释为什么能这么干)

$$ y''(x) = C_1' \varphi_1' + C_2' \varphi_2' + C_1 \varphi_1'' + C_2 \varphi_2'' $$

$$ f(x) = C_1' \varphi_1' + C_2' \varphi_2' + \underline{C_1 \varphi_1'' + C_2 \varphi_2''} $$

$$ \qquad + p(x) (\underline{C_1 \varphi_1' + C_2 \varphi_2'}) $$

$$ \qquad + q(x) (\underline{C_1 \varphi_1 + C_2 \varphi_2}) $$

$$ = C_1' \varphi_1' + C_2' \varphi_2' $$

那么就得到两个方程:

$$ \begin{cases} C_1' \varphi_1 + C_2' \varphi_2 = 0 \\ C_1' \varphi_1' + C_2' \varphi_2' = f \end{cases} $$

$$ \Rightarrow \begin{aligned} C_1' &= -\frac{f \varphi_2}{W} \\ C_2' &= \frac{f \varphi_1}{W} \end{aligned} $$

这里的 $W$ 是系数行列式,也就是朗斯基行列式。

$$ \Rightarrow \begin{aligned} C_1(x) &= \int^x -\frac{f(t) \varphi_2(t)}{W(t)} dt + D_1 \\ C_2(x) &= \int^x \frac{f \varphi_1}{W} dt + D_2 \end{aligned} $$

从而

$$ y'' + p(x) y' + q(x) y = f(x) $$

$$ \downarrow $$

$$ y

= \left( \int^x -\frac{f \varphi_2}{W} dt + D_1 \right) \varphi_1(x)

  • \left( \int^x \frac{f \varphi_1}{W} dt + D_2 \right) \varphi_2(x)
    $$

欧拉方程

$$ \sum_i a_ix^iy^{(i)}=0 $$

其中 $a_i$ 为常数,这样形式的微分方程称为所谓欧拉方程。
欧拉方程有一个不错的性质,考虑 $z(x)=y(-x)$,那么偶数项不消说,奇数项由于$z’$和$x$ 都有多一个负号,所以抵消了。也就是说,$z$也满足方程,换言之,只需要考虑$x>0$ 的情形。

那么什么函数值域大于 $0$呢,自然的想法是$e^x$,我们令$x=e^t$,那么$xy’=e^t\frac{dy}{dx}=e^t\frac{dy}{dt}\frac{dt}{dx}$,注意到$\frac{dt}{dx}=e^{-t}$,那么就有$xy’=\frac{dy}{dt}$,如此美妙。我们考虑第二项,设$D = \frac{d}{dt}$,则$x^2 \frac{d^2y}{dx^2} = D(D-1)y$,利用数学归纳法可以得到$x^k \frac{d^ky}{dx^k} = D(D-1)\dots(D-k+1)y$ 。这么一来,就又变回常系数线性方程了。

例如,我们考虑

$$ x^2y''+\frac{3}{2}xy'-y=0 $$

那么换元后就是

$$ (D(D-1)+\frac{3}{2}D-1)y=0 $$

整理得到

$$ (D^2+\frac{1}{2}D-1)y=0 $$

这个丑陋的方程就不解了,总之是解出两个根 $\lambda_i$ ,然后

$$ y=C_1e^{\lambda_1t}+C_2e^{\lambda_2t} $$

但是这还不是 $y(x)$,代入$t=lnx

$$ $y(x)=C_1x^{\lambda_1}+C_2x^{\lambda_2} $$

但是这要求 $x>0$,利用之前所说,只要把$x$ 加上绝对值就好

$$ y(x)=C_1|x|^{\lambda_1}+C_2|x|^{\lambda_2} $$

相应的,如果有重根,就得到

$$ y(x)=C_1x^{\lambda}+C_2ln|x|x^{\lambda} $$

伯努利方程

$$ y'+P(x)y=Q(x)y^n $$

如果没有 $y^n$,那就是标准的一阶非齐次方程,于是自然想到除掉$y^n$ ,得到

$$ y^{-n}y'+P(x)y^{1-n}=Q(x) $$

发现 $1-n$和$-n$差$1$,这与求一次导有所关联,于是进行变量代换$z=y^{1-n}$ ,那么

$$ z'+P(x)z=Q(x) $$

就得到了标准的一阶非齐次方程的形式。

一阶 ODE 组

$n$ 个耦合的一阶微分方程如何求解?

$$ y_1'=F_1(x,y_1,y_2,...,y_n) $$

$$ ... $$

$$ y_n'=F_n(x,y_1,y_2,...,y_n) $$

为了方便描述,可以记 $\vec{y}=(y_1,…,y_n)^T$,类似的$\vec{F}=(F_1,…,F_n)^T$ 。

通解形如

$$ y_1(x)=\varphi_1(x,C_1,...C_n) $$

因为要解 $n$个方程,故有$n$ 个常数。
独立性的判断仍然是行列式

$$ |\frac{D(\vec{\varphi})}{D(\vec{C})}| $$

存在唯一性条件则相应有所变化,要求对 $(x,\vec{y})\in \Omega \subseteq \mathbb{R}\times \mathbb{R}^n$,在其上每个$F_i$对每个$y_i$ 满足一致的李普希兹条件。

为什么要研究方程组

我们考虑 $n$阶微分方程,实际上可以通过变量替换变成一个一阶 ode 组,只要令$u_i=y^{(i)}$ ,就得到

$$ u_1'=u_2 $$

$$ ... $$

$$ u_{n-1}'=u_n $$

$$ u_n=F(x,u_0,u_1...),即原来的微分方程 $$

也就是说,要解 $n$阶方程,只要解这样一个方程组就好。所以$n$阶方程有$n$个常数,实际上是因为对应$n$个一阶方程。把上述的常数独立性条件的$\varphi$改成对应的$y^{(n)}$,就发现和$n$ 阶微分方程的常数独立性条件一样。

对存在唯一性条件,我们看 $\vec{F}$ :

$$ \vec{F}(x, \vec{y}) = (y_2 \ y_3 \ \cdots \ G(x, y_1, \dots, y_n))^T $$

那么对应的雅可比矩阵也就是

$$ \frac{D(\vec{F})}{D(\vec{y})} = \begin{pmatrix} 0 & 1 & 0 & \cdots & 0 \\ 0 & 0 & 1 & \cdots & 0 \\ \vdots & \vdots & \vdots & \ddots & \vdots \\ 0 & 0 & 0 & \cdots & 1 \\ G_{y_1} & G_{y_2} & G_{y_3} & \cdots & G_{y_n} \end{pmatrix} $$

这个矩阵 $\in C^1$ 是李普希兹连续的一个充分条件(导数有界),那么也就只要求最下方那一排导数连续。

二阶微分方程存在唯一性条件要求 $p,q$ 连续,实际上也就是对应的导数。

各种形式

1. 一般形式(General Form)

最顶层是高度抽象的非线性向量方程:

$$ \vec{y}' = \vec{F}(x, \vec{y}) $$

  • 含义:系统的演化速率 $\vec{y}’$取决于当前自变量$x$和状态向量$\vec{y}$ 的某种复杂非线性组合。

2. 线性化(Linearization)

通过引入“线性”约束,方程退化为变系数线性微分方程组:

$$ \vec{y}' = A(x)\vec{y} + \vec{f}(x) $$

  • 结构

    • $A(x)$是系数矩阵,其元素随自变量$x$ 变化。

    • $\vec{f}(x)$ 是非齐次项(或称强制项)。

  • 逻辑:此时状态 $\vec{y}$ 对演化速率的影响是线性的。

3. 常系数化(Constant Coefficients)

进一步引入“常系数”约束,方程退化为最易求解的形式:

$$ \vec{y}' = A\vec{y} + \vec{f}(x) $$

  • 核心变化:矩阵 $A$不再随$x$ 变化,而是一个常数矩阵。

  • 价值:这是线性代数介入最深的领域,可以通过计算矩阵 $A$ 的特征值特征向量(如 Jordan 标准型)来直接写出通解。

阅读全文

笔记5.线性变换 I

线代 2026/4/18

首先,线性变换实际上是一种特殊的线性映射,定义域和陪域是同一个集合,所以我们关于线性映射的讨论仍然可以延续。

线性映射的核心定义

如果把一个空间 $U$映射到另一个空间$V$,要称之为“线性映射”,它必须恪守两个底线:

  • 可加性:先相加再映射,等同于映射后再相加,即 $\mathscr{A}(\alpha + \beta) = \mathscr{A}\alpha + \mathscr{A}\beta$。

  • 齐次性:缩放后的映射,等同于映射后再缩放,即 $\mathscr{A}(k\alpha) = k\mathscr{A}\alpha$。

    当这两个空间重合(即 $U = V$)时,我们通常称之为线性变换

基的像确定整个映射

对于从 $K^n$到$K^m$ 的映射,其操作的本质就是矩阵乘法

  • 标准基的作用:通过观察标准基向量(那些只有一位是 1,其余为 0 的向量)被映射后的去向,我们可以把这些结果纵向排列,构造出矩阵 $A$

  • 运算等价性:对向量 $x$进行线性映射,在计算层面等同于执行$Ax$。

设 $\mathscr{A}: \mathbf{K}^n \to \mathbf{K}^m$ 是线性映射

$$ \begin{bmatrix} 1 \\ 0 \\ \vdots \\ 0 \end{bmatrix} \mapsto \color{green}{\begin{bmatrix} a_{11} \\ a_{21} \\ \vdots \\ a_{m1} \end{bmatrix}} , \quad \begin{bmatrix} 0 \\ 1 \\ \vdots \\ 0 \end{bmatrix} \mapsto \color{green}{\begin{bmatrix} a_{12} \\ a_{22} \\ \vdots \\ a_{m2} \end{bmatrix}} , \dots, \quad \begin{bmatrix} 0 \\ 0 \\ \vdots \\ 1 \end{bmatrix} \mapsto \color{green}{\begin{bmatrix} a_{1n} \\ a_{2n} \\ \vdots \\ a_{mn} \end{bmatrix}} $$

$$ \begin{bmatrix} x_1 \\ x_2 \\ \vdots \\ x_n \end{bmatrix} \mapsto \begin{array}{|cccc|} \hline \color{green}{a_{11}} & \color{green}{a_{12}} & \dots & \color{green}{a_{1n}} \\ \color{green}{a_{21}} & \color{green}{a_{22}} & \dots & \color{green}{a_{2n}} \\ \vdots & \vdots & & \vdots \\ \color{green}{a_{m1}} & \color{green}{a_{m2}} & \dots & \color{green}{a_{mn}} \\ \hline \end{array} \begin{bmatrix} x_1 \\ x_2 \\ \vdots \\ x_n \end{bmatrix} $$

**$\mathscr{A}$ 在标准基下的矩阵也就是表出系数。

这是线性代数中极具力量的一个结论:只要确定了基底的去向,整个映射就彻底定死了。

  • 定理内涵:如果你给定空间 $U$的一组基${\alpha_1, \dots, \alpha_n}$,并随意指定它们在 $V$中对应的目标${\beta_1, \dots, \beta_n}$,那么世界上存在且仅存在一个线性映射 $\mathscr{A}$ 满足这个对应关系。

  • 构造逻辑

    1. 由于任何向量 $\alpha$都能唯一地写成基底的线性组合$\alpha = \sum k_i \alpha_i$。

    2. 我们利用线性的“可加性”和“齐次性”,强制定义映射结果为 $\mathscr{A}\alpha = \sum k_i \beta_i$。

    3. 这种定义方式保证了映射的良定义性(即一个输入对应唯一确定的输出)。

证明一下吧:

验证 $\mathscr{A}$ 是线性映射

为了证明我们构造的映射 $\mathscr{A}$(即通过基底像的组合定义的映射)是合法的线性映射,需要验证其满足可加性与齐次性。

已知条件:

设 $\alpha = k_1 \alpha_1 + \dots + k_n \alpha_n \in U$若$\alpha’ = l_1 \alpha_1 + \dots + l_n \alpha_n \in U$,则:

验证过程:

  • 可加性:

$$ \begin{aligned} \mathscr{A} (\alpha + \alpha') &= (k_1 + l_1) \beta_1 + \dots + (k_n + l_n) \beta_n \\ &= (k_1 \beta_1 + \dots + k_n \beta_n) + (l_1 \beta_1 + \dots + l_n \beta_n) \\ &= \mathscr{A} \alpha + \mathscr{A} \alpha' \end{aligned} $$

  • 齐次性:

$$ \mathscr{A} (l \alpha) = l k_1 \beta_1 + \dots + l k_n \beta_n = l \mathscr{A} \alpha $$


$\mathscr{A}$ 的唯一性

这部分证明了:一旦基底的像 ${\beta_i}$ 被确定,世界上不存在第二个不同的线性映射能达成同样的对应关系。

证明过程:

若有线性映射 $\mathscr{B}: U \to V$,也满足:

$$ \mathscr{B} \alpha_i = \beta_i, \quad \forall i $$

则对于空间中任意向量的映射结果:

$$ \begin{aligned} \mathscr{B} (k_1 \alpha_1 + \dots + k_n \alpha_n) &= k_1 \mathscr{B} \alpha_1 + \dots + k_n \mathscr{B} \alpha_n \\ &= k_1 \beta_1 + \dots + k_n \beta_n \\ &= \mathscr{A} (k_1 \alpha_1 + \dots + k_n \alpha_n), \quad \forall k_i \end{aligned} $$

于是:

$$ \mathscr{B} = \mathscr{A} $$

线性映射的运算

线性运算:加法与数乘

若 $\mathscr{A}, \mathscr{B}$是从$U$到$V$ 的线性映射,则可以定义:

  • 加法:$(\mathscr{A} + \mathscr{B}): \alpha \mapsto \mathscr{A}\alpha + \mathscr{B}\alpha$

  • 数乘:$k\mathscr{A}: \alpha \mapsto k(\mathscr{A}\alpha) \quad (k \in K)$

这两个运算的结果仍然是线性映射。

核心结论:从 $U$到$V$ 的全体线性映射在上述运算下构成一个线性空间,记作 $\text{Hom}(U, V)$

陪域上能作的运算映射也可以作


复合运算:映射的乘法

设 $\mathscr{B} \in \text{Hom}(U, V)$,$\mathscr{A} \in \text{Hom}(V, W)$。

  • 定义:$\mathscr{B}$与$\mathscr{A}$的复合映射$\alpha \mapsto \mathscr{A}(\mathscr{B}\alpha)$是从$U$到$W$ 的线性映射。

  • 记法:称为 $\mathscr{A}$与$\mathscr{B}$ 的乘积,记作 $\mathscr{A}\mathscr{B}$

  • 前提条件:$\mathscr{B}$的陪域与$\mathscr{A}$ 的定义域相同。

  • 结合律:$(\mathscr{A}\mathscr{B})\mathscr{C} = \mathscr{A}(\mathscr{B}\mathscr{C})$。


线性变换的代数结构

当映射发生在同一个空间上,即 $\mathscr{A}, \mathscr{B} \in \text{Hom}(V)$ 时,结构变得更加丰富:

  • $\text{Hom}(V)$(或记作 $\text{End}(V)$)上的线性变换不但能相加、数乘,还能作乘法运算。

  • 该乘法满足结合律、对加法的分配律,且存在单位元 $\mathscr{I}$(恒等变换)。

核心结论:$\text{Hom}(V)$ 构成一个 $K$-代数


算子运算实例:微分与乘法

幻灯片展示了一个极具启发性的例子,定义在 $C^1(\mathbb{R})$ 上的变换:

  • 微分算子 $D$:$f(x) \mapsto f’(x)$- 乘法算子$S$:$f(x) \mapsto xf(x)$根据导数的乘法法则$(xf(x))’ = xf’(x) + f(x)$,可以推导出算子之间的关系:

$$ (DS - SD)f = (xf)' - xf' = f'x + f - xf' = f $$

即:$DS - SD = \mathscr{I}$

这实际上是量子力学中正则对易关系在函数空间的数学原型。


几何变换实例:投影变换

沿 $W$向$U$的投影变换$\mathscr{P}_U$

  • 背景:空间 $V$可以分解为直和$V = U \oplus W$。

  • 定义:对于任何向量 $\alpha = \beta + \gamma$(其中 $\beta \in U, \gamma \in W$),投影算子将其映射为 $U$ 中的分量:

$$ \mathscr{P}_U: \alpha \mapsto \beta $$

  • 几何直观:所有平行于 $W$的向量被“压扁”到了平面$U$ 上。

投影变换的代数定义

当空间 $V$可以分解为直和$V = U \oplus W$时,任何向量$\alpha$都能唯一分解为$\alpha = \beta + \gamma$(其中 $\beta \in U, \gamma \in W$)。

  • 投影算子 $P_U$:定义为 $\alpha \mapsto \beta$。

  • 基本性质

    • 幂等性:$P_U^2 = P_U$(投射一次后再投射,结果不再改变)。

    • 正交互补性:$P_U P_W = 0$且$P_U + P_W = I$。

2. 核心定理:投影与幂等的等价性

这是线性代数中的一个优美结论:一个线性变换 $P$ 是投影变换,当且仅当它是幂等变换($P^2 = P$)。

  • 空间分解:若 $P^2 = P$,则整个空间 $V$ 必然可以分解为:

$$ V = \text{Im } P \oplus \text{Ker } P $$

  • 物理意义

    • $P$是沿$\text{Ker } P$向$\text{Im } P$ 的投影。

    • $I - P$则是反过来的“镜像”操作,即沿$\text{Im } P$向$\text{Ker } P$ 的投影。

3. 证明逻辑要点

通过代数推导验证这种直和关系:

  • 不动点特性:在 $\text{Im } P$中的向量$\beta$,在 $P$ 的作用下“点点不动”($P\beta = \beta$)。

  • 零交集:通过 $P\beta = \beta$和$\beta \in \text{Ker } P \implies P\beta = 0$联立,证明了$\text{Im } P \cap \text{Ker } P = {0}$,从而满足直和的条件。

  • 全空间覆盖:利用恒等式 $\alpha = P\alpha + (I - P)\alpha$,说明任何向量都能拆分成这两个子空间的成员。

4. 推广:空间的多项分解

这一部分将二元投影推广到了多个子空间的情形。

  • 定理(正向):如果 $V$是多个子空间的直和$V = V_1 \oplus \dots \oplus V_s$,那么必然存在一组投影算子 $P_1, \dots, P_s$,它们满足:

    1. 两两正交:$P_i P_j = 0 \quad (i \neq j)$

    2. 完备性:$\sum P_i = I$

    3. 像空间对应:$\text{Im } P_i = V_i$- 定理(逆向):反之,若一组算子满足上述三个条件,它们就定义了空间$V$ 的一个直和分解。

5.多项式与投影

此前,我们已经讨论过如下定理:

设 $f_1(x), \dots, f_s(x) \in K[x]$两两互素。记$f(x) = \prod_{i=1}^s f_i(x)$。对于 $A \in M_n(K)$,有:

$$ \text{Ker } f(A) = \text{Ker } f_1(A) \oplus \text{Ker } f_2(A) \oplus \dots \oplus \text{Ker } f_s(A) $$

这实际上给出了一组投影。

线性映射空间与矩阵空间的同构

结论:$\text{Hom}(U, V) \cong M_{m,n}(K)$

当我们分别为线性空间 $U$和$V$取定基底${\alpha_1, \dots, \alpha_n}$和${\beta_1, \dots, \beta_m}$时,每一个线性映射$\mathscr{A}$都唯一对应一个矩阵$A$。

  • 映射关系:$(\mathscr{A}\alpha_1, \mathscr{A}\alpha_2, \dots, \mathscr{A}\alpha_n) = (\beta_1, \beta_2, \dots, \beta_m)A$- 本质:这种对应不仅是双射,还保持了加法和数乘运算,意味着$\text{Hom}(U, V)$作为一个线性空间的结构,被矩阵空间$M_{m,n}(K)$ 完美“克隆”了。

基础矩阵与基本映射

正如矩阵空间有一组标准基 $E_{ij}$(仅在 $(i, j)$ 位置为 1,其余为 0),映射空间也有对应的基本映射

  • 定义:$E_{ij}: U \to V$,其作用规律为:

$$ E_{ij}(\alpha_k) = \begin{cases} \beta_i & k=j \\ 0 & k \neq j \end{cases} $$

  • 意义:这组基本映射构成了 $\text{Hom}(U, V)$ 的基底。这告诉我们,任何复杂的线性映射都可以拆解为这些“只把特定的输入基映射到特定的输出基”的简单动作的线性组合。

映射复合与矩阵乘法的等价性

这是线性代数中最关键的定理之一:映射的复合对应矩阵的乘法。

  • 定理描述

    设 $\mathscr{B}: U \to V$的矩阵是$B$,$\mathscr{A}: V \to W$的矩阵是$A$。

    那么复合映射 $\mathscr{AB}: U \to W$的矩阵恰好就是$AB$。

  • 逻辑演示

    通过观察基底像的传递过程:

$$ \begin{aligned} (\mathscr{AB}\alpha_1, \dots, \mathscr{AB}\alpha_n) &= \mathscr{A}((\beta_1, \dots, \beta_m)B) \\ &= ((\mathscr{A}\beta_1, \dots, \mathscr{A}\beta_m))B \\ &= ((\gamma_1, \dots, \gamma_s)A)B \\ &= (\gamma_1, \dots, \gamma_s)(AB) \end{aligned} $$


结合律的传递

  • 映射层面:映射的复合天然满足结合律,即 $(\mathscr{AB})\mathscr{C} = \mathscr{A}(\mathscr{BC})$。

  • 矩阵层面:基于上述等价性,矩阵乘法也必须满足结合律。

复合映射的像空间与维度公式

  • 核心定理

$$ \dim \text{Im } \mathscr{B} = \dim \text{Im } \mathscr{AB} + \dim(\text{Im } \mathscr{B} \cap \text{Ker } \mathscr{A}) $$

  • 证明逻辑

    1. 考察 $\mathscr{A}$在$\text{Im } \mathscr{B}$上的限制映射$\mathscr{A}’ : \text{Im } \mathscr{B} \to W$。

    2. 根据线性映射基本定理(第一同构定理):$\text{Im } \mathscr{B} / \text{Ker } \mathscr{A}’ \cong \text{Im } \mathscr{A}’$。

    3. 验证可知:$\text{Im } \mathscr{A}’ = \text{Im } \mathscr{AB}$,且 $\text{Ker } \mathscr{A}’ = \text{Im } \mathscr{B} \cap \text{Ker } \mathscr{A}$。

  • 推论(Sylvester 秩不等式)

    利用上述维数公式,可以推导出:

$$ \dim \text{Im } \mathscr{A} + \dim \text{Im } \mathscr{B} \leq \dim \text{Im } \mathscr{AB} + \dim V $$

对于矩阵形式,即:$\text{rank}(A) + \text{rank}(B) \leq \text{rank}(AB) + n$

_等号成立条件:$\text{Ker } \mathscr{A} \subseteq \text{Im } \mathscr{B}$,即 $A$的解空间包含于$B$ 的列空间。_

这在之前,我们曾用打洞法构造大矩阵证明过。


基变换与矩阵表示的演变

这是线性代数从“静态矩阵”向“动态变换”跨越的关键。

核心问题

当 $U$的基底从${\alpha_i}$变为${\alpha’_i}$(过渡矩阵为 $P$),$V$的基底从${\beta_j}$变为${\beta’_j}$(过渡矩阵为 $Q$)时,映射 $\mathscr{A}$ 的矩阵如何变化?

变换定理

若 $\mathscr{A}$在原基底下的矩阵为$A$,则在新基底下的矩阵为:

$$ \mathbf{B} = Q^{-1} A P $$

证明推导

  1. 关系式 1:$\mathscr{A}(\alpha_1 \dots \alpha_n) = (\beta_1 \dots \beta_m)A$

  2. 基变换:$(\alpha’_1 \dots \alpha’_n) = (\alpha_1 \dots \alpha_n)P$;$(\beta’_1 \dots \beta’_m) = (\beta_1 \dots \beta_m)Q \implies (\beta_1 \dots \beta_m) = (\beta’_1 \dots \beta’_m)Q^{-1}$

  3. 代入计算

$$ \begin{aligned} \mathscr{A}(\alpha'_1 \dots \alpha'_n) &= \mathscr{A}(\alpha_1 \dots \alpha_n)P \\ &= (\beta_1 \dots \beta_m)AP \\ &= (\beta'_1 \dots \beta'_m)Q^{-1}AP \end{aligned} $$

在线性变换的语境下,就自然出现了所谓相似,$A=PQP^{-1}$ 。相似描述的实际上也就是同一个线性变换在不同基的表现。

在最美妙的选取下,就会出现所谓标准型,分块地写成单位阵和0。

阅读全文

Picard存在性定理

2026/4/18

系列前言

高斯对拆掉脚手架后的完美证明感到满意,但读者也只好接受美妙的证明却难以一窥背后的思路。实际上,大部分的证明都是有迹可循的,来源于已有的证明,而非凭空发明的思路,这也正是数学笔记的一大意义,积累足够的素材,于是自然地得到看似天马行空的证明。

我们总是希望详尽的理解,但教科书或者常见的证明则好像冷酷的传统印象的机械,工序化地一步步证明命题,却并不告诉我们纲要,不告诉我们背后的思路。这于是自然地驱动我们去发掘,为什么数学家会想到这么干。幸而如今 AI 十分超标,指令一下,便可以得到详尽的解释,但又有些不幸,还没到输出能让人直接采纳,于是我做一个中转,整理出得到的,至少我自己接受的一个思路还原。

第一篇是 Picard 的原因很简单,我看书看破防了。这是一个对我而言有一定长度的证明,教材分了一二三四步,我一步步看下去感觉不知所云。

问题

19 世纪初期,数学家面临这样一个困境:求解一阶微分方程

$$ \frac{dy}{dx} = f(x, y), \quad y(x_0) = y_0 $$

的显式解析解,仅在极其有限的特殊情形下才是可能的(如变量分离方程、恰当方程、线性方程等)。然而,来自物理学的需求却是压倒性的——牛顿力学、天体力学、热传导、流体运动,无一不产生这样的方程。物理学家的直觉告诉他们,给定一个系统的初始状态和演化规律,未来的状态“应当”是确定的。但直觉不是数学证明。是否存在解?如果存在,是否唯一? ——这两个问题直接关系到整个经典物理学世界观的可信度。

在 Cauchy 之前,整个 18 世纪关于微分方程的工作几乎全部聚焦于求解技术。Bernoulli 家族、Euler、Lagrange 等大师发展了大量精巧的积分技巧——积分因子、变量代换、幂级数展开等。但这些方法都有一个共同的局限性:它们只能处理能够被“积出来”的方程。对于非线性方程

$$ \frac{dy}{dx} = x^2 + y^2, $$

18 世纪的数学家无能为力。这个方程没有初等函数形式的解,但在数学上却完全“合法”。于是,一个深刻的问题浮现了:一个“合法”提出的微分方程,是否必然拥有解?

对于今天的我们来说,这不是一个自明的问题。请考虑以下具体例子:

(Peano 反例):考虑初值问题

$$ \frac{dy}{dx} = 3y^{2/3}, \quad y(0) = 0. $$

通过观察,可以验证函数 $y(x) \equiv 0$满足该方程。但进一步考察会发现,对于任意$c > 0$,函数

$$ y(x) = \begin{cases} 0, & x \leq c \\ (x - c)^3, & x > c \end{cases} $$

同样满足方程。这意味着从同一个初始点出发,存在无穷多条解曲线。物理上的决定论——给定初始条件唯一确定未来演化——在这里彻底失效。如果微分方程允许这种多解性,那么整个经典力学的哲学基础都将动摇。这个例子清楚地说明,解的存在性和唯一性绝非理所当然,而是需要被严格证明的数学性质

解决

转化成积分方程

面对

$$ \frac{dy}{dx} = f(x, y), \quad y(x_0) = y_0 $$

时,最朴素、最不需要创造力的念头就是:两边积分

这不是一个需要灵感的操作。微积分基本定理在 Cauchy 的时代早已是标准工具。对一个方程两边积分是“解微分方程”的最原始本能——就像看到 $a = b$会想到$a - b = 0$ 一样自然。积分之后得到:

$$ y(x) - y(x_0) = \int_{x_0}^{x} f(t, y(t)) \, dt $$

代入初始条件,直接就是:

$$ y(x) = y_0 + \int_{x_0}^{x} f(t, y(t)) \, dt $$

从微分方程到积分方程的转换,在形式上只是微积分基本定理的直接应用。数学家之所以会“想到”它,不是因为有什么深刻的洞见,而是因为 任何试图处理微分方程的人,迟早都会写下这个等式——它是出发点的自然延伸,不是终点处的巧妙构造。

写下积分等式是容易的。困难的是 意识到这个看似同义反复的改写,竟然可以用来证明解的存在性。这一步才是思想史上真正值得追问的“为什么想到”。

这个洞察的来源,可以从两个方向追溯:

方向一:数值逼近的启发(Euler 折线法的反思)

Euler 折线法在 18 世纪已广为人知。它的构造方式是:从 $x_0$出发,走一小步$h$,用当前斜率 $f(x_0, y_0)$更新$y$。这个过程本质上是在做:

$$ y_{n+1} = y_n + h f(x_n, y_n) $$

数学家会自然地追问:当 $h \to 0$ 时,这些折线收敛到什么?如果我们把离散的递推求和写成积分近似的形式,它就是:

$$ y(x) \approx y_0 + \sum f(x_i, y_i) \Delta x \longrightarrow y_0 + \int_{x_0}^{x} f(t, y(t)) \, dt $$

也就是说,Euler 折线法的连续极限天然地暗示了积分方程的形式。那些试图严格化 Euler 折线法的数学家(如 Cauchy、Peano)在做极限论证时,必须处理的正是这个积分等式。所以,积分方程并非从天上掉下来的灵感,而是 从离散逼近的极限过程中自动涌现出来的

方向二:积分方程研究的先行经验(Liouville-Neumann 方法)

在 Picard 之前,积分方程领域已经有了逐次逼近法的成功先例。对于方程

$$ y(x) = g(x) + \lambda \int_{a}^{x} K(x, t) y(t) \, dt $$

Liouville 和 Neumann 在 19 世纪中叶发展了一套迭代求解技术:从一个初始猜测出发,反复代入积分号下,得到 Neumann 级数。这种方法在求解 Volterra 积分方程时被证明极为有效。

Picard 的“想到”很可能是一种 类比迁移:他看到常微分方程的初值问题恰好可以写成这种积分方程的形式(右端没有 $y$在积分外的项,或者说$g(x) \equiv y_0$)。既然积分方程那边已经有一套成熟的迭代技术,为什么不直接搬过来用?于是有了 Picard 迭代。

所以,对 Picard 而言,“换成积分方程”不是原创动作,而是 为了使用已有的积分方程工具而做的刻意变形。他看到微分方程,想到的是:“这玩意能写成积分方程吗?如果能,我就能用 Neumann 那一套了。”

先前的经验之 Neumann 级数

Neumann 级数是求解积分方程的核心工具。它的核心思想是,通过无穷级数来构造性地表示一个算子的逆。就思想而言,实际上线性代数中也就碰到过,例如求 $A - I$ 的逆。

1. 核心思想:算子版本的“几何级数”

Neumann 级数的灵感直接来源于经典的几何级数公式:

$$ \frac{1}{1 - r} = 1 + r + r^2 + r^3 + \cdots \quad (\text{当 } |r| < 1) $$

现在,我们不把 $r$ 看作一个数,而是一个作用在函数上的线性算子(或矩阵)$K$。那么,$(I - K)^{-1}$(可以类比为$\frac{1}{1-K}$)的逆,就可以形式地写成:

$$ (I - K)^{-1} = I + K + K^2 + K^3 + \cdots $$

这个算子形式的几何级数,就是 Neumann 级数。其中,$I$ 是恒等算子,$K^2$表示连续两次应用算子$K$。

2. 在积分方程中的具体应用

Neumann 级数最经典的应用场景是求解第二类 Fredholm 积分方程。其形式如下:

$$ y(x) = f(x) + \lambda \int_{a}^{b} K(x, t) y(t) \, dt $$

这个方程可以简洁地写成算子形式:

$$ y = f + \lambda K y $$

我们的目标是求解未知函数 $y(x)$。对上述算子方程进行整理:

$$ (I - \lambda K) y = f $$

关键一步:形式上解出 $y$,就得到了逆算子的表达式:

$$ y = (I - \lambda K)^{-1} f $$

接下来,应用 Neumann 级数将逆算子展开:

$$ y = (I + \lambda K + \lambda^2 K^2 + \lambda^3 K^3 + \cdots) f $$

将这个算子级数展开并写回积分形式,我们就得到了解的级数表达式。这个级数由以下各项构成:

  • 零阶项: $y_0(x) = f(x)$- 一阶项:$y_1(x) = \lambda \int_{a}^{b} K(x, t) f(t) , dt$- 二阶项:$y_2(x) = \lambda^2 \int_{a}^{b} K(x, t) \left[ \int_{a}^{b} K(t, t_1) f(t_1) , dt_1 \right] dt$
  • ……以此类推。

这个构造过程被称为“逐次逼近法”,而得到的级数正是 Neumann 级数。

3. 历史脉络:从 Carl Neumann 到 Picard

  • Carl Neumann (1870s): 德国数学家 Carl Neumann 在研究位势理论中的 Dirichlet 问题时,发展了这一方法。他于 1870 年首次对严格凸区域上的 Dirichlet 问题给出了解的存在性证明,其核心在于证明相应积分算子的 Neumann 级数是收敛的。
  • Picard 的继承 (1890s): Émile Picard 直接继承了 Neumann 的成果。他将 Neumann 级数和逐次逼近法从积分方程“移植”到常微分方程领域,用来证明解的存在唯一性,这就是我们熟知的 Picard 迭代法。可以说,Neumann 级数为 Picard 的工作提供了直接的技术蓝图。

试图还原 Picard 的想法

有了上述,实际上也就可以试着还原了。叠甲:下面所有类似 Picard 的思考都是意淫。

证明的完整还原

问题设定

研究对象:一阶常微分方程的初值问题

$$ \frac{dy}{dx} = f(x, y), \quad y(x_0) = y_0 $$

已知条件

  1. 函数 $f(x, y)$在某个包含点$(x_0, y_0)$ 的闭矩形区域

$$ R = \{ (x, y) \in \mathbb{R}^2 : |x - x_0| \leq a, |y - y_0| \leq b \} $$

上连续。因此,根据闭区间上连续函数的性质,$f$在$R$上有界,即存在常数$M > 0$,使得对所有 $(x, y) \in R$,有 $|f(x, y)| \leq M$。

  1. 函数 $f(x, y)$在$R$上关于变量$y$满足 Lipschitz 条件:存在常数$L > 0$,使得对于任意 $(x, y_1) \in R$和$(x, y_2) \in R$,都有

$$ |f(x, y_1) - f(x, y_2)| \leq L |y_1 - y_2| $$

目标:证明在上述条件下,存在唯一的函数 $y = \phi(x)$,定义在某个包含 $x_0$的区间$I$ 上,满足该微分方程及初始条件。

第一步:转化为积分方程

推导
对微分方程 $\frac{dy}{dt} = f(t, y(t))$两边在区间$[x_0, x]$ 上积分:

$$ \int_{x_0}^{x} \frac{dy}{dt} \, dt = \int_{x_0}^{x} f(t, y(t)) \, dt $$

根据微积分基本定理,左边等于 $y(x) - y(x_0)$。代入初始条件 $y(x_0) = y_0$,得到:

$$ y(x) - y_0 = \int_{x_0}^{x} f(t, y(t)) \, dt $$

移项得到等价的积分方程

$$ y(x) = y_0 + \int_{x_0}^{x} f(t, y(t)) \, dt $$

观察
现在问题变了。我不需要找一个可导的函数,只需要找一个连续函数 $y(x)$满足这个积分方程。一旦找到,由$f$的连续性,右边作为$x$的函数是可导的,从而$y(x)$ 自动是可导的,并且满足原微分方程和初始条件。这个转化的好处是:积分运算对函数的“光滑性”要求比求导低,它把连续函数映射为连续函数。这让我可以在连续函数空间这个更“宽敞”也更“结实”的框架里工作。

第二步:构造 Picard 迭代序列

推导
构造一个函数序列 ${\phi_n(x)}_{n=0}^{\infty}$ 如下:

  1. 取初始猜测为常值函数:$\phi_0(x) \equiv y_0$。这是最自然的起点,因为我们唯一确定的信息就是在 $x_0$ 处的值。
  2. 递归定义:

$$ \phi_{n+1}(x) = y_0 + \int_{x_0}^{x} f(t, \phi_n(t)) \, dt, \quad n = 0, 1, 2, \dots $$

现在,整个证明的核心就变成了:证明这个序列 ${\phi_n(x)}$在某种意义下收敛,且其极限函数$\phi(x)$ 恰好满足那个积分方程。

第三步:确定迭代的有效区间

推导
我需要确定一个最大允许的区间半径 $h > 0$,使得只要 $|x - x_0| \leq h$,就能保证所有迭代函数的值都满足 $|\phi_n(x) - y_0| \leq b$。

让我们用归纳法来寻找这个 $h$。

  • 假设对于某个 $n$和所有满足$|x - x_0| \leq h$的$x$,都有 $|\phi_n(x) - y_0| \leq b$。
  • 那么对于下一步迭代,

$$ |\phi_{n+1}(x) - y_0| = \left| \int_{x_0}^{x} f(t, \phi_n(t)) \, dt \right| \leq \left| \int_{x_0}^{x} |f(t, \phi_n(t))| \, dt \right| \leq M |x - x_0| $$

  • 为了保证 $|\phi_{n+1}(x) - y_0| \leq b$,只要 $M |x - x_0| \leq b$ 即可。

因此,我只需要选择 $h$满足$Mh \leq b$。同时,为了不超出 $R$的水平边界,我还需要$h \leq a$。

结论
取 $h = \min\left(a, \frac{b}{M}\right)$。在区间 $I = [x_0 - h, x_0 + h]$上,所有迭代函数$\phi_n(x)$的定义都是良性的,且其图像始终保持在矩形区域$R$ 内。

第四步:估计相邻迭代之差

推导
从 $n=1$ 开始:

$$ |\phi_1(x) - \phi_0(x)| = \left| \int_{x_0}^{x} f(t, y_0) \, dt \right| \leq M |x - x_0| $$

对于一般的 $n \geq 1$,利用迭代定义和 Lipschitz 条件,

$$ \begin{aligned} |\phi_{n+1}(x) - \phi_n(x)| &= \left| \int_{x_0}^{x} [f(t, \phi_n(t)) - f(t, \phi_{n-1}(t))] \, dt \right| \\ &\leq \left| \int_{x_0}^{x} |f(t, \phi_n(t)) - f(t, \phi_{n-1}(t))| \, dt \right| \end{aligned} $$

关键点:这里用到了 Lipschitz 条件。它允许我将关于 $f$的差的估计转化为关于$\phi$ 的差的估计,这是整个证明能够进行下去的基石。

$$ \leq L \left| \int_{x_0}^{x} |\phi_n(t) - \phi_{n-1}(t)| \, dt \right| $$

第五步:递推估计与阶乘因子的出现

推导
让我们尝试计算前几项来寻找规律。

  • 已知:$|\phi_1(x) - \phi_0(x)| \leq M |x - x_0|$- 计算$|\phi_2(x) - \phi_1(x)|$:

$$ |\phi_2(x) - \phi_1(x)| \leq L \left| \int_{x_0}^{x} M |t - x_0| \, dt \right| = M L \frac{|x - x_0|^2}{2} $$

  • 计算 $|\phi_3(x) - \phi_2(x)|$:

$$ |\phi_3(x) - \phi_2(x)| \leq L \left| \int_{x_0}^{x} M L \frac{|t - x_0|^2}{2} \, dt \right| = M L^2 \frac{|x - x_0|^3}{3!} $$

一般公式
规律已经非常明显了。我可以断言,对于所有 $n \geq 1$和$x \in I$,有以下估计成立:

$$ |\phi_n(x) - \phi_{n-1}(x)| \leq \frac{M L^{n-1}}{n!} |x - x_0|^n \leq \frac{M L^{n-1}}{n!} h^n $$

Picard 的洞察
这个估计的美妙之处在于分母上的阶乘 $n!$。它增长得如此之快,以至于无论常数 $M, L, h$的具体值是多少,只要它们是有限的,级数$\sum_{n=1}^{\infty} \frac{M L^{n-1}}{n!} h^n$ 都必然收敛。这正是我需要的收敛性的保证。

第六步:证明序列的一致收敛

推导
考虑级数

$$ \sum_{n=1}^{\infty} \max_{x \in I} |\phi_n(x) - \phi_{n-1}(x)| $$

根据第五步的估计,这个级数的每一项都被 $\frac{M L^{n-1}}{n!} h^n$ 所控制。

考虑数值级数 $\sum_{n=1}^{\infty} \frac{M L^{n-1}}{n!} h^n$。我们可以用比值判别法来检验其收敛性:

$$ \lim_{n \to \infty} \frac{\frac{M L^n}{(n+1)!} h^{n+1}}{\frac{M L^{n-1}}{n!} h^n} = \lim_{n \to \infty} \frac{L h}{n+1} = 0 $$

由于极限为 0(小于 1),该数值级数收敛。

根据 Weierstrass M-判别法,由于函数项级数的每一项在区间 $I$上的绝对值都被一个收敛的正项级数的对应项所控制,因此该函数项级数在$I$ 上一致收敛

结论
这意味着 Picard 迭代序列 ${\phi_n(x)}$在区间$I$上一致收敛于一个极限函数,记作$\phi(x)$。由于每个 $\phi_n$都是连续的,且收敛是一致的,极限函数$\phi(x)$ 也是连续的。

第七步:证明极限函数是解

推导
回忆迭代公式:

$$ \phi_{n+1}(x) = y_0 + \int_{x_0}^{x} f(t, \phi_n(t)) \, dt $$

我想对等式两边取极限 $n \to \infty$。
左边直接趋于 $\phi(x)$。
对于右边,我需要将极限号移入积分号内,即证明:

$$ \lim_{n \to \infty} \int_{x_0}^{x} f(t, \phi_n(t)) \, dt = \int_{x_0}^{x} \lim_{n \to \infty} f(t, \phi_n(t)) \, dt = \int_{x_0}^{x} f(t, \phi(t)) \, dt $$

合法性验证

  1. 我已经知道函数序列 ${\phi_n(t)}$在$I$上一致收敛于$\phi(t)$。
  2. 函数 $f$在闭矩形$R$上是连续的,因此在$R$ 上是一致连续的。
  3. 根据一致连续的性质,对于任意给定的 $\varepsilon > 0$,存在 $\delta > 0$,只要 $|\phi_n(t) - \phi(t)| < \delta$,就有 $|f(t, \phi_n(t)) - f(t, \phi(t))| < \varepsilon$。
  4. 由于 ${\phi_n(t)}$一致收敛,对于这个$\delta$,存在 $N$,当 $n > N$时,对所有$t \in I$都有$|\phi_n(t) - \phi(t)| < \delta$。
  5. 因此,当 $n > N$时,对所有$t \in I$都有$|f(t, \phi_n(t)) - f(t, \phi(t))| < \varepsilon$。这意味着函数序列 ${f(t, \phi_n(t))}$在$I$上一致收敛于$f(t, \phi(t))$。
  6. 对于一致收敛的函数序列,积分和极限可以交换。

结论
因此,取极限是合法的,我得到:

$$ \phi(x) = y_0 + \int_{x_0}^{x} f(t, \phi(t)) \, dt $$

这说明 $\phi(x)$ 满足积分方程,从而是初值问题的一个解。存在性得证。

第八步:证明唯一性

推导
假设存在另一个函数 $\psi(x)$ 也满足积分方程:

$$ \psi(x) = y_0 + \int_{x_0}^{x} f(t, \psi(t)) \, dt $$

考虑两个解之差的绝对值 $u(x) = |\phi(x) - \psi(x)|$。将两者满足的积分方程相减并取绝对值:

$$ u(x) = \left| \int_{x_0}^{x} [f(t, \phi(t)) - f(t, \psi(t))] \, dt \right| \leq \left| \int_{x_0}^{x} |f(t, \phi(t)) - f(t, \psi(t))| \, dt \right| $$

再次应用 Lipschitz 条件:

$$ u(x) \leq L \left| \int_{x_0}^{x} |\phi(t) - \psi(t)| \, dt \right| = L \left| \int_{x_0}^{x} u(t) \, dt \right| $$

现在我需要从这个积分不等式推导出 $u(x) \equiv 0$。不失一般性,考虑 $x \geq x_0$的情况。定义$U(x) = \int_{x_0}^{x} u(t) , dt$。那么 $U’(x) = u(x)$。上述不等式变为:

$$ U'(x) \leq L \cdot U(x) $$

移项得 $U’(x) - L U(x) \leq 0$。两边乘以积分因子 $e^{-Lx}$:

$$ \frac{d}{dx} \left( e^{-Lx} U(x) \right) \leq 0 $$

这说明函数 $e^{-Lx} U(x)$在$x \geq x_0$上是单调不增的。在$x = x_0$ 处,$U(x_0) = \int_{x_0}^{x_0} u(t) , dt = 0$。因此,对于所有 $x \geq x_0$,有 $e^{-Lx} U(x) \leq 0$。但由于 $e^{-Lx} > 0$且$U(x) = \int_{x_0}^{x} u(t) , dt \geq 0$,我们得出 $U(x) \leq 0$且$U(x) \geq 0$,故 $U(x) = 0$。

由于 $U(x) = 0$,其导数 $u(x) = U’(x)$也必然为 0(此处$u$是连续的)。所以$u(x) \equiv 0$,即 $\phi(x) = \psi(x)$对所有$x \geq x_0$成立。对于$x \leq x_0$ 的情况,论证类似。

结论:唯一性得证。

证明完成

综合以上八个步骤,Picard 完整地证明了在连续性和 Lipschitz 条件下,初值问题在某个局部区间上存在且唯一解。他不仅证明了存在性,而且提供了一种构造性的算法(Picard 迭代)以及误差估计(通过阶乘级数的余项),这在当时是关于微分方程理论基础的一项重大突破。

通过这样,所谓的 $h$ 的形式也就很自然。

证明结构总结

Picard 的证明可以浓缩为以下几个技术节点:

步骤 核心操作 关键条件 目的
1 转化为积分方程 微积分基本定理 降低光滑性要求,嵌入初始条件
2 构造迭代序列 $f$ 连续 生成候选逼近序列
3 确定有效区间 $f$ 在紧集上有界 保证迭代良定义
4 估计相邻差 Lipschitz 条件 控制误差传递
5 递推得阶乘估计 数学归纳法 获得显式收敛速率
6 证明一致收敛 Weierstrass M-判别法 确立极限函数存在
7 取极限得解 一致连续 + 一致收敛 验证极限函数是解
8 唯一性证明 Lipschitz 条件 + Gronwall 排除多解可能性

Picard 迭代与 Neumann 级数的对应关系

最后,也许读起来还是会让人有些跳跃的部分还是这个联系,我们再做一点点补充:

这个问题的答案,不在于 Picard 盯着微分方程本身想出了什么妙招,而在于他把目光从微分方程移开,投向了另一个已经成熟的数学领域

1. 真正的灵感来源:积分方程中的“现成工具”

在 Picard 着手研究微分方程存在性的 1890 年代之前,数学界在另一个领域已经发展出了一套完整的、被称为“逐次逼近法”的技术。这个领域就是积分方程

具体来说,研究第二类 Volterra 积分方程(形如 $y(x) = g(x) + \int_a^x K(x, t) y(t) , dt$)的数学家,比如 Liouville 和 Neumann,面临的问题和 Picard 其实是一样的:解不出来显式,但需要证明它存在

他们是怎么做的?他们注意到,如果把整个积分运算看作一个算子 $T$,方程就是 $y = g + Ty$。一个非常自然的想法是:先猜 $y_0 = g$,代入右边得到 $y_1 = g + Tg$。但这显然不是解,因为 $y_1$和$g$不一样。那如果把$y_1$再代进去呢?就得到了$y_2 = g + Ty_1 = g + Tg + T^2g$。一直继续下去,就得到了一个无穷级数:

$$ y = g + Tg + T^2g + T^3g + \cdots $$

这就是 Neumann 级数。他们证明了,只要核 $K(x, t)$ 满足一定的有界条件,这个级数就是收敛的,并且收敛到的函数就是原积分方程的解。这个方法在 Picard 的时代已经是积分方程领域的标准工具,不是秘密,不是猜想,而是已经被写进论文和教科书里的成熟方法。

2. Picard 的“为什么”:一次天才的类比移植

现在,让我们把镜头转向 Picard。他面对的是微分方程初值问题:

$$ \frac{dy}{dx} = f(x, y), \quad y(x_0) = y_0 $$

他做的第一步——也是所有 19 世纪数学家都会做的本能动作——就是把它两边积分,变成:

$$ y(x) = y_0 + \int_{x_0}^x f(t, y(t)) \, dt $$

此时,Picard 的脑子里发生了什么?他看到这个等式,并不是像我们今天的学生一样,仅仅把它看作“微分方程的等价形式”。他看到的是另一副面孔:

这个等式,不就是一个积分方程吗?

具体来说,如果定义算子 $T$为$(Ty)(x) = \int_{x_0}^x f(t, y(t)) , dt$,那么这个方程就是:

$$ y = y_0 + Ty $$

这和 Volterra 积分方程 $y = g + Ty$在结构上完全一致!唯一的区别是,这里的$T$依赖于未知函数$y$的非线性方式(通过$f$),而经典的积分方程中 $T$是线性的(即$Ty = \int K(x, t) y(t) , dt$)。但形式上的相似性是如此强烈,以至于任何一个熟悉积分方程文献的人都会产生一个念头:

既然积分方程那边用“反复代入”的方法(Neumann 级数)能够成功构造出解,那么对于这个方程,我能不能也试试同样的套路?

这就是 Picard 的“为什么”。他不是在发明一个新的哲学,他是在套用一个已知的、在相邻领域被证明极其有效的算法模板。

这个思维的跳跃,本质上是一次类比

  • 源领域:线性积分方程(已知:Neumann 级数有效)
  • 目标领域:非线性微分方程的积分形式(未知:是否有效?)
  • 相似性:方程都具有 $y = g + Ty$ 的抽象形式
  • 行动:将源领域的解法(迭代)直接搬用到目标领域

Picard 的贡献,并不是凭空想出了“反复代入”这个动作,而是勇敢地将这个动作从线性积分方程迁移到了非线性的情境下,并成功地证明了它在 Lipschitz 条件下依然收敛。他的天才体现在“迁移的胆识”和“收敛证明的构造”(用阶乘估计代替 Neumann 的几何级数),而不是迭代动作本身的原创。

3. 证据与旁证

这个解释不是事后合理化的猜测。从历史文献中我们可以看到清晰的脉络:

  • Carl Neumann 在 1870 年代发表的关于位势理论的工作中,明确使用了级数展开法(即后来的 Neumann 级数)来求解边界积分方程。
  • Émile Picard 在 1890 年的论文中,明确引用了 Neumann 的工作,并指出他是将类似的方法应用于更一般的(非线性)情形。事实上,Picard 在 1890 年正是利用 Neumann 的结果发展了他的逐次逼近法。
  • Picard 迭代在现代泛函分析教材中,经常被作为 Banach 不动点定理的前身和特例来介绍,而 Banach 不动点定理的另一直接前身,正是积分方程中 Neumann 级数的抽象化。

因此,历史的链条是清晰的:积分方程中的 Neumann 级数 → Picard 的类比移植 → 微分方程中的 Picard 迭代 → Banach 的抽象不动点定理

4. 结论:为什么 Picard 会想到?

您问“为什么想到”,答案是:

因为他认出了微分方程在积分形式下,和他已经知道如何用迭代法求解的那类积分方程,长得一模一样。

对于 Picard 来说,“反复代入”根本不是一个需要灵感去凭空发明的动作。它是一个已知算法。他面对的问题不是“我应该用什么方法来逼近解?”,而是“我已知的这个叫 Neumann 级数的方法,换到这个新方程上还能不能用?”

这就好比一个现代的程序员,面对一个新的数据处理任务,发现它可以被写成一个递归结构。他不会去思考“我为什么会想到用递归?”,因为“递归”是他工具箱里已经有的一个标准工具。他思考的是:“这个任务适合用递归吗?如果适合,我该怎么改写和证明它的正确性?”

Picard 就是这样一位数学家。他手中的工具箱里,放着积分方程前辈们传下来的“逐次逼近法”。当他看到初值问题的积分形式时,他立刻意识到工具箱里的这个工具可能有戏。他试了,他证明了,于是他成功了。

这就是“为什么”的最终答案:不是灵感的火花,而是工具的自然迁移。

阅读全文

笔记3.线性空间

线代 2026/4/13

尽管可能显得欠缺一定的连续性,先论述线性空间是合理的,尔后再从多项式延展到空间分解才更为自然,或许不妨看做两个分支,从线性空间和多项式环合并而导回线性代数的主分支。

仍然给出一坨定义:

线性空间的结构

线性空间的定义与公理体系

线性空间是一个非空集合 $V$(其中的元素称为抽象向量),建立在数域 $K$ 之上,并定义了两种运算:加法数乘

核心运算与封闭性

  1. 加法 (Vector Addition)

    • 定义:$V \times V \to V$

    • 映射:$(\alpha, \beta) \mapsto \alpha + \beta$- 本质:集合$V$ 对加法运算封闭。

  2. 数乘 (Scalar Multiplication)

    • 定义:$K \times V \to V$

    • 映射:$(k, \alpha) \mapsto k\alpha$- 本质:数域$K$中的标量与向量结合,结果仍留在$V$ 中。


八条公理 (The 8 Axioms)

这八条准则共同构成了线性空间的骨架。前四条确立了 $V$ 在加法下的交换群(阿贝尔群)地位,后四条规定了数乘与加法的兼容性。

1. 加法性质(交换群)

  • (1) 交换律: $\alpha + \beta = \beta + \alpha$- (2) 结合律:$\alpha + (\beta + \gamma) = (\alpha + \beta) + \gamma$- (3) 存在单位元(零元素): 存在元素$0 \in V$,使得 $0 + \alpha = \alpha + 0 = \alpha, \forall \alpha \in V$- (4) 存在逆元(负元素): 对任何$\alpha$,都有 $-\alpha \in V$,使得 $\alpha + (-\alpha) = (-\alpha) + \alpha = 0$

    推论: 零元素与负元素在给定空间中是唯一的。

2. 数乘性质

对 $\forall \alpha, \beta \in V$以及$\forall k, l \in K$:

  • (5) 数乘单位元: $1 \cdot \alpha = \alpha$- (6) 数乘结合律:$k(l\alpha) = (kl)\alpha$- (7) 左分配律:$(k + l)\alpha = k\alpha + l\alpha$- (8) 右分配律:$k(\alpha + \beta) = k\alpha + k\beta$

$V$是能与$K$ 作数乘的交换群。

与环的对比

如果把代数结构比作某种构建规则,线性空间强调的是层次间的互动,而环强调的是内部的自我演化

  • 环(Ring) 是一个 “自给自足” 的单集结构。它在一个集合 $R$ 上定义了两种二元运算:加法和乘法。所有的操作($a+b$或$a \cdot b$)都发生在 $R$ 内部。你可以把它想象成一个封闭的黑盒,里面的元素通过两种规则自我碰撞。

  • 线性空间(Vector Space) 是一个 “双集联动” 的结构。它涉及两个集合:一个向量集 $V$和一个数域$K$(标量)。加法是 $V$内部的互动,但乘法(数乘)是跨界的——由域$K$中的“外部力量”作用于$V$ 中的元素。

这部分讲义将讨论的重心从线性空间的“定义”转向了它的结构度量。如果说公理是空间的“宪法”,那么基(Basis)维数(Dimension) 就是它的“骨架”与“尺度”。


类似我们熟悉的向量组的讨论,线性空间也可以完全类似地定义基、维数等,事实上我们将看到线性映射和矩阵是同构的。

基、维数与同构

向量组的秩与极大无关组

  • 极大无关组:向量组可以有许多不同的极大无关组,但它们包含的向量个数必然相同。

  • 秩(Rank):极大无关组所含向量的个数称为该向量组的秩。

基底与维数

对于线性空间 $V$的子集$S$:

  1. 线性表出:若 $V$中每个向量都能表示为$S$中有限个向量的线性组合,称$S$能线性表出$V$。

  2. 线性无关:若 $S$的任意有限子集都线性无关,则称$S$ 线性无关。

基底(Basis)的定义

若子集 $S$ 同时满足:

  1. $S$ 线性无关;

  2. $S$能线性表出$V$;

    则称 $S$是$V$ 的一组

  • 维数(Dimension)

    • 若 $S$是有限集,则称$V$ 为有限维线性空间

    • $V$的任意两组基包含的向量个数相同,这个常数称为$V$的维数,记为$\dim V$。

    • 规定零空间 ${0}$的维数为$0$。


引理与推论

  • 引理:设 $\alpha_1, \dots, \alpha_s$线性无关,则$\alpha_1, \dots, \alpha_s, \beta$线性相关$\iff \beta$能被$\alpha_1, \dots, \alpha_s$ 线性表出。

  • 扩充定理(推论):在有限维线性空间 $V$中,任何线性无关的向量组$\alpha_1, \dots, \alpha_s$都能扩充为$V$ 的一组基。


基底的判定定理

设 $S$是有限维线性空间$V$的子集,以下三个条件中只要有两个成立,则三个条件都成立(即$S$构成$V$ 的基):

  1. $S$ 线性无关;

  2. $S$能线性表出$V$;

  3. $|S| = \dim V$(向量个数等于空间维数)。


坐标同构 $V \cong K^n$一旦在线性空间$V$中取定了一组基$\alpha_1, \alpha_2, \dots, \alpha_n$,那么 $V$中的每一个元素$\alpha$ 都可以唯一地表示为:

$$ \alpha = k_1\alpha_1 + k_2\alpha_2 + \dots + k_n\alpha_n $$

  • 坐标:列向量 $[k_1, k_2, \dots, k_n]^T \in K^n$称为$\alpha$ 在该基下的坐标。

  • 本质:这种一一对应关系保持了加法和数乘运算。这意味着,任何 $n$维线性空间在代数结构上都与$K^n$ 是一模一样的(同构)

关于基、换基等操作,可以在数学随笔3.基底思想阅读。


子空间的运算

线性子空间的定义

若线性空间 $V$的子集$W$满足以下三条性质,则称$W$是$V$ 的子空间

  1. 非空性/包含零向量:$0 \in W$2. 加法封闭性:若$\alpha, \beta \in W$,则 $\alpha + \beta \in W$3. 数乘封闭性:若$k \in K, \beta \in W$,则 $k\beta \in W$

本质:$W$在$V$ 原有的运算下也构成一个完备的线性空间,自动满足八条公理。


子空间的性质与构造

  • 定理(基扩张与维数)

    • 子空间 $W$的基都能扩充成全空间$V$ 的基。

    • 维数不等式:$\dim W \le \dim V$。

    • 等号成立条件:$\dim W = \dim V \iff W = V$。

  • 给出子空间的几种方式

    1. 生成元方式:由一组向量生成的张成空间 $W = \langle \alpha_1, \dots, \alpha_s \rangle$。

    2. 解空间方式:作为齐次线性方程组 $Ax = 0$ 的解集。

    3. 运算构造方式:通过交、和、正交补(内积空间中)等运算得到。


子空间的运算:交与和

1. 子空间的交 (Intersection)

  • 定理:若 $V_1, V_2$是$V$的子空间,则其交集$V_1 \cap V_2$也是$V$ 的子空间。

  • 注意:并集 $V_1 \cup V_2$一般不是子空间,除非其中一个包含另一个(即$V_1 \supseteq V_2$或$V_1 \subseteq V_2$)。

2. 子空间的和 (Sum)

  • 定义:若 $V_1, V_2$是$V$的子空间,集合${ \alpha_1 + \alpha_2 \mid \alpha_1 \in V_1, \alpha_2 \in V_2 }$称为$V_1$与$V_2$ 的和,记为 $V_1 + V_2$

  • 性质:$V_1 + V_2$也是$V$ 的子空间。

  • 生成元表示

    若 $V_1 = \langle \alpha_1, \dots, \alpha_r \rangle$,$V_2 = \langle \beta_1, \dots, \beta_s \rangle$,

    则 $V_1 + V_2 = \langle \alpha_1, \dots, \alpha_r, \beta_1, \dots, \beta_s \rangle$。

相比于并,和更能体现线性空间的味道,例如两条直线的并是两条直线作为一个整体,但是和则是铺成一个平面,带有了线性运算。同时,和可以直接构造子空间,并则不太容易。

维数公式

一、 定理内容

若 $V_1, V_2$是线性空间$V$ 的子空间,则它们的和空间与交空间的维数满足以下关系:

$$ \dim(V_1 + V_2) + \dim(V_1 \cap V_2) = \dim V_1 + \dim V_2 $$

直观理解:两个空间的合并维数,等于各自维数之和减去重复计算的交集部分维数。这与集合论中的容斥原理极其相似。


二、 证明概要

证明的核心在于通过基的扩充构造出一组能张成 $V_1 + V_2$ 的线性无关组。实际上在数学随笔3之基底思想已经干过完全一样的证明了。

  1. 取交空间的基:设 $V_1 \cap V_2$的一组基为$\alpha_1, \dots, \alpha_r$。此时 $\dim(V_1 \cap V_2) = r$。

  2. 向两侧扩充

    • 将其扩充为 $V_1$ 的基:$\alpha_1, \dots, \alpha_r, \beta_1, \dots, \beta_m$。则 $\dim V_1 = r + m$。

    • 将其扩充为 $V_2$ 的基:$\alpha_1, \dots, \alpha_r, \gamma_1, \dots, \gamma_s$。则 $\dim V_2 = r + s$。

  3. 构造和空间的基:证明 $\beta_1, \dots, \beta_m, \alpha_1, \dots, \alpha_r, \gamma_1, \dots, \gamma_s$线性无关且张成$V_1 + V_2$。

    • 若线性组合为零:$k_1\beta_1 + \dots + l_1\gamma_1 + \dots = 0$。

    • 变形得:$k_i\beta_i$的组合属于$V_2$,因此必然落在交集 $V_1 \cap V_2$ 中。

    • 利用交空间的基表出并结合线性无关性,推出所有系数全为 $0$。

  4. 结论:$\dim(V_1 + V_2) = m + r + s$。

    • 代入等式:$(m + r + s) + r = (r + m) + (r + s)$,公式成立。

线性无关、直和与唯一性表示

一、 线性无关 $\iff$ 表出唯一

对于向量组 $\alpha_1, \dots, \alpha_s$:

  • 核心逻辑:如果该向量组表示零向量的方式是唯一的,那么它表示任何能表出的向量的方式都是唯一的。

若满足表达零向量唯一,则设有两种方法表示 $\beta$ ,作差就得到两种方法的系数必须一样,那也就实际上只有一种方法。


二、 子空间的直和 (Direct Sum)

当我们将讨论的对象从“单个向量”提升到“子空间”时,唯一性依然是判定结构的核心。

1. 表示方式的定义

设 $V_1, \dots, V_s$是$V$的子空间。对于和空间$V_1 + \dots + V_s$中的任意向量$\beta$,其表示方式为:

$$ \beta = \alpha_1 + \alpha_2 + \dots + \alpha_s, \quad (\alpha_i \in V_i) $$

有序组 $(\alpha_1, \dots, \alpha_s)$称为$\beta$ 的一种表示。

2. 直和的判定:零向量的唯一性
  • 定理:表示零向量的方式唯一 $\iff$ 表示任何向量的方式都唯一。

  • 直和的定义:若 $V_1 + \dots + V_s$ 中任何元素的表示方式都唯一,则称该和为直和,记为:

$$ V_1 \oplus V_2 \oplus \dots \oplus V_s $$

  • 推导过程

    • 如果表示零向量的方式不唯一(存在非零向量之和为 $0$),则通过加法叠加,任何向量的表示都会有无数种组合。

    • 反之,若表示 $0$的方式唯一(即$\sum \alpha_i = 0 \implies \alpha_i = 0$),则由 $\beta$ 的两种表示作差,立得两种表示完全一致。

直和的本质是子空间之间“不重叠”(除零向量外)。

  • 非直和情形:若 $V_1 \cap V_2 \neq {0}$,则存在非零向量 $\alpha \in V_1 \cap V_2$。此时零向量可以有非平凡表示:$0 = \alpha + (-\alpha)$。几何上表现为两个平面(或线)交于一条线。

  • 直和情形:若 $V_1 \cap V_2 = {0}$,则 $\alpha_1 + \alpha_2 = 0 \implies \alpha_1 = -\alpha_2 \in V_1 \cap V_2 = {0}$。这意味着分解方式唯一。几何上表现为两个空间仅交于原点。

当涉及多个子空间 $V_1, \dots, V_s$ 时,两两交为零是不够的,必须满足更强的条件。

定理:

$V_1 + \dots + V_s$是直和,当且仅当对每一个$k$ ($1 \le k \le s$),第 $k$ 个子空间与它前面所有子空间之和的交集仅含零向量:

$$ V_k \cap (V_1 + \dots + V_{k-1}) = \{0\} $$

  • 证明要点

    • 充分性:设 $\sum \alpha_i = 0$。取最后一个非零向量 $\alpha_k$,则 $\alpha_k = -(\alpha_1 + \dots + \alpha_{k-1})$。这导致 $\alpha_k$落在$V_k$ 与前面子空间和的交集中,与条件矛盾。

    • 必要性:若交集不为零,则存在非零向量能被前面的向量组表出,导致零向量的表示不唯一。


三、 等价命题定理

以下命题对于判定子空间是否构成直和是等价的:

  • 表示唯一性:$V_1 + \dots + V_s$是直和(即表示$0$ 的方式唯一)。

  • 基的保持性:分别取子空间 $V_1, \dots, V_s$ 的基,将这些基向量合并后,得到的向量组在全空间中依然线性无关

    • 换句话说,这些基向量合并后构成了和空间 $V_1 \oplus \dots \oplus V_s$ 的一组基.。
  • 维数和:$dim(V_1+…+V_s)=dim(V_1)+…+dim(V_s)$当$\dim(V_1 \cap V_2) = 0$(即 $V_1 \cap V_2 = {0}$)时,维数公式简化为:

$$ \dim(V_1 + V_2) = \dim V_1 + \dim V_2 $$

此时的和称为直和,记作 $V_1 \oplus V_2$。这意味着和空间中的每一个向量都可以唯一地表示为 $V_1$和$V_2$ 中向量的和。

我们看一个定理,这实际上在数学随笔之范德蒙德行列式的意外出现有提到过,讨论的就是直和。

定理:

设 $V_1, V_2, \dots, V_s$是方阵$A$对应于不同特征值$\lambda_1, \lambda_2, \dots, \lambda_s$ 的特征子空间,则它们的和是直和

  • 证明思路(范德蒙德法)

    1. 设 $\alpha_1 + \alpha_2 + \dots + \alpha_s = 0$,其中 $\alpha_i \in V_i$。

    2. 利用 $A$左乘该式$s-1$次,根据$A\alpha_i = \lambda_i \alpha_i$,得到一系列线性方程:

$$ \begin{cases} \alpha_1 + \dots + \alpha_s = 0 \\ \lambda_1 \alpha_1 + \dots + \lambda_s \alpha_s = 0 \\ \vdots \\ \lambda_1^{s-1} \alpha_1 + \dots + \lambda_s^{s-1} \alpha_s = 0 \end{cases} $$

  1. 由于特征值 $\lambda_i$两两不同,对应的范德蒙德行列式不为零,从而推导出每个分量$\alpha_i$必须全为$0$。

还可以更进一步,考虑所谓广义特征子空间。

广义特征子空间的直和与多项式分解

一、 广义特征子空间的直和性

定理

设 $\lambda_1, \dots, \lambda_s \in K$是矩阵$A \in M_n(K)$ 的互异特征值,$r_1, \dots, r_s > 0$ 为对应的幂次,则其广义特征子空间之和是直和:

$$ \text{Ker}(A - \lambda_1 I)^{r_1} \oplus \dots \oplus \text{Ker}(A - \lambda_s I)^{r_s} $$

  • 证明逻辑(构造性矛盾法)

    1. 假设存在非零向量之和为零:$\alpha_1 + \dots + \alpha_s = 0$。

    2. 对 $\alpha_1$,寻找使其“退化”到特征向量层级的最小指数 $t$,定义 $\beta_1 = (A - \lambda_1 I)^{t-1} \alpha_1 \neq 0$。此时 $\beta_1$是属于$\lambda_1$ 的特征向量($A-\lambda I$作用$\beta$是$0$ )。

    3. 利用算子 $(A - \lambda_1 I)^{t-1} \prod_{j \neq 1} (A - \lambda_j I)^{r_j}$ 左乘原式。

    4. 除了第一项,其余项均会因落在 $\text{Ker}$中而消解为$0$。

    5. 最终导出 $(\lambda_1 - \lambda_2)^{r_2} \dots (\lambda_1 - \lambda_s)^{r_s} \beta_1 = 0$。由于特征值互异且 $\beta_1 \neq 0$,产生矛盾,从而证明各分量必为零。


那之前大费周章学了那么多多项式的内容有什么用呢?实际上利用多项式我们可以给出空间的分解:

核空间分解定理的详细证明

一、 定理

设 $f_1(x), \dots, f_s(x) \in K[x]$两两互素。记$f(x) = \prod_{i=1}^s f_i(x)$。对于 $A \in M_n(K)$,有:

$$ \text{Ker } f(A) = \text{Ker } f_1(A) \oplus \text{Ker } f_2(A) \oplus \dots \oplus \text{Ker } f_s(A) $$


二、 证明步骤拆解

1. 证明和是“直和”

要证直和,只需证 $V_i \cap (\sum_{j \neq i} V_j) = {0}$,其中 $V_i = \text{Ker } f_i(A)$。

  • 构造辅助多项式:记 $F_i(x) = \frac{f(x)}{f_i(x)}$,即除去 $f_i$ 后其余多项式的乘积。

  • 利用互素性:由于 $(f_i(x), f_j(x)) = 1$(对所有 $j \neq i$),推导出 $f_i(x)$与$F_i(x)$互素,即$(f_i, F_i) = 1$。

  • 裴蜀等式 (Bézout’s Identity):存在 $u(x), v(x)$使得$u(x)f_i(x) + v(x)F_i(x) = 1$。

  • 算子化:将 $x$换成矩阵$A$,作用于任意向量 $\alpha \in V_i \cap (\sum_{j \neq i} V_j)$:

    • $\alpha = u(A)f_i(A)\alpha + v(A)F_i(A)\alpha$- 因为$\alpha \in \text{Ker } f_i(A)$,故 $f_i(A)\alpha = 0$。

    • 因为 $\alpha$在其余核空间的和中,而$F_i(A)$包含所有其余因子,故$F_i(A)\alpha = 0$。

    • 结论:$\alpha = 0$,故和为直和。

2. 证明核空间的包含关系

需证 $\sum \text{Ker } f_i(A) = \text{Ker } f(A)$。

  • 以 $s=2$为例:已知$(f_1, f_2) = 1$,则 $u(A)f_1(A) + v(A)f_2(A) = I$。

  • 对于 $\forall \alpha \in \text{Ker } f(A)$:

$$ \alpha = I\alpha = \underbrace{u(A)f_1(A)\alpha}_{\in \text{Ker } f_2(A)} + \underbrace{v(A)f_2(A)\alpha}_{\in \text{Ker } f_1(A)} $$

(注:$f_2(A) \cdot [u(A)f_1(A)\alpha] = u(A)f(A)\alpha = 0$)

  • 推广到一般情形:利用归纳法,将 $f(x)$视为$f_1(x)$与$(f_2 \dots f_s)(x)$ 的积,层层剥离。

综合两方面证明就完成了。也就是说,从一个多项式的分解,我们可以得到一个空间的分解,这是非常美妙的。

如果我们想分解整个空间,要考虑什么多项式呢?

零化多项式与空间分解

一、 零化多项式 (Annihilating Polynomial)

  • 定义:设 $A \in M_n(K)$,若存在多项式 $f(x) \in K[x]$使得$f(A) = 0$,则称 $f(x)$为$A$ 的一个零化多项式

  • 经典示例

    • 幂等变换(投影):$x^2 - x$是其零化多项式(因为$A^2 = A$)。

    • 对合变换(镜像):$x^2 - 1$是其零化多项式(因为$A^2 = I$)。

二、 零化多项式驱动的空间全分解

核心定理

若矩阵 $A$的零化多项式$f(x)$在域$K$上可分解为两两互素的因子乘积$f(x) = f_1(x) \dots f_s(x)$,则全空间 $V$ 具有直和分解:

$$ V = \text{Ker } f_1(A) \oplus \dots \oplus \text{Ker } f_s(A) $$

逻辑跃迁:这里因为 $f(A)=0$,所以 $\text{Ker } f(A)$直接就是整个空间$V$。


三、 可对角化的充分必要条件

这是线性代数中最优雅的结论之一:

矩阵 $A$在域$K$上可对角化,当且仅当$A$有一个零化多项式能在$K$ 上分解成互异的一次因式的乘积:

$$ f(x) = (x - \mu_1)(x - \mu_2) \dots (x - \mu_s), \quad \mu_i \in K \text{ 且互异} $$

  • 必要性推导:若 $A$可对角化,则全空间是特征子空间的直和。作用算子$(A - \lambda_1 I)\dots(A - \lambda_s I)$于任何向量都会得到$0$,说明该乘积即为零化多项式。

  • 充分性推导:若存在此类零化多项式,由核空间分解定理,全空间 $V$ 会分解为各个特征子空间(或零空间)的直和:

$$ V = \bigoplus_{i=1}^s \text{Ker}(A - \mu_i I) $$

这意味着 $V$有一组由特征向量构成的基,即$A$ 可对角化。


四、 案例应用:对合变换的分解

场景:设 $V = M_n(K)$,考虑转置变换 $T: A \to A^T$。

  1. 特征方程:显然 $T^2 = I$,故零化多项式为 $f(x) = x^2 - 1 = (x - 1)(x + 1)$。

  2. 空间直和:由于 $1$与$-1$互异,空间$V$ 可分解为:

$$ V = \text{Ker}(T - I) \oplus \text{Ker}(T + I) $$

  1. 几何意义

    • $\text{Ker}(T - I)$是所有满足$A^T = A$的矩阵(对称矩阵$V_1$)。

    • $\text{Ker}(T + I)$是所有满足$A^T = -A$的矩阵(反对称矩阵$V_2$)。

    • 结论:任何方阵都能唯一地分解为一个对称矩阵与一个反对称矩阵之和:$A = \frac{A+A^T}{2} + \frac{A-A^T}{2}$。

补空间与外直和

一、 补空间 (Complementary Subspace)

如果说子空间是空间的一部分,那么补空间就是“剩下那部分”的完美补充。

  • 定义:设 $W, W’$是$V$的子空间。若满足$V = W \oplus W’$(即 $V$是它们的直和),则称$W$与$W’$ 互为补空间

  • 存在性定理:任何线性子空间都有补空间。

  • 构造逻辑

    1. 取 $W$的一组基$\alpha_1, \dots, \alpha_r$。

    2. 将其扩充为全空间 $V$的一组基$\alpha_1, \dots, \alpha_r, \alpha_{r+1}, \dots, \alpha_n$。

    3. 由扩充出来的向量 $\langle \alpha_{r+1}, \dots, \alpha_n \rangle$张成的子空间即为$W$ 的一个补空间。

  • 注意:补空间通常不唯一。扩充基底的方式不同,得到的补空间在空间中的“姿态”也不同。


二、 外直和 (External Direct Sum)

当我们手里有几个独立的线性空间,想要把它们合成一个更大的空间时,就需要用到外直和。

  • 定义:设 $V_1, \dots, V_s$是数域$K$ 上的线性空间,其外直和定义为笛卡尔积集合:

$$ V_1 \oplus \dots \oplus V_s = \{ (\alpha_1, \dots, \alpha_s) \mid \alpha_i \in V_i \} $$

  • 运算规则

    • 加法:分量对位相加,$(\alpha_1, \dots) + (\beta_1, \dots) = (\alpha_1 + \beta_1, \dots)$。

    • 数乘:标量作用于每个分量,$k(\alpha_1, \dots) = (k\alpha_1, \dots)$。


三、 外直和与内直和的统一

虽然“外直和”是从多个集合构建新集合,但它本质上可以看作“内直和”。

  • 嵌入与同构

    构造 $V$的子空间$V_i’$,使得 $V_i’$中的元素仅在第$i$个位置有非零向量,其余位置全为$0$:

$$ V_i' = \{ (0, \dots, \alpha_i, \dots, 0) \mid \alpha_i \in V_i \} $$

  • 结论

    1. $V_i’ \cong V_i$(每个 $V_i’$都同构于原空间$V_i$)。

    2. 整个外直和空间 $V$恰好是这些子空间$V_i’$ 的内直和

$$ V = V_1' \oplus \dots \oplus V_s' $$


线性空间的同构

线性映射与同构的定义

设 $U, V$是域$K$上的两个线性空间。若映射$\mathcal{A}: U \to V$ 满足:

  1. 加法齐次性:$\mathcal{A}(\alpha + \beta) = \mathcal{A}\alpha + \mathcal{A}\beta, \quad \forall \alpha, \beta \in U$

  2. 数乘齐次性:$\mathcal{A}(k\alpha) = k\mathcal{A}\alpha, \quad \forall k \in K$则称$\mathcal{A}$是$U$到$V$ 的线性映射

若 $\mathcal{A}$是双射(既是单射又是满射),则称$\mathcal{A}$是$U$到$V$的线性同构,记作$U \cong V$。


2. 同构的关键判定与定理

  • 推论:设 $\mathcal{A}: U \to V$ 是线性映射,$\alpha_1, \dots, \alpha_n$是$U$的一组基。$\mathcal{A}$是$U$与$V$的线性同构$\iff \mathcal{A}\alpha_1, \dots, \mathcal{A}\alpha_n$是$V$ 的一组基。

  • 基础定理:有限维 $K$-线性空间 $U$与$V$ 同构的充要条件是它们的维数相等:

$$ U \cong V \iff \dim U = \dim V $$


3. 性质证明要点

  • 满射判定:$\mathcal{A}$是满射$\iff \mathcal{A}\alpha_1, \dots, \mathcal{A}\alpha_n$张成$V$。

    即 $V$中任意向量均可表示为$\mathcal{A}\alpha_i$ 的线性组合:$\text{Im} \mathcal{A} = L(\mathcal{A}\alpha_1, \dots, \mathcal{A}\alpha_n)$。

  • 单射判定:$\mathcal{A}$是单射$\iff \mathcal{A}\alpha_1, \dots, \mathcal{A}\alpha_n$ 线性无关。

    证明思路:由 $\sum k_i \mathcal{A}\alpha_i = 0$推导出$\mathcal{A}(\sum k_i \alpha_i) = 0$,若 $\mathcal{A}$为单射则核为空,进而利用$\alpha_i$的无关性证得$k_i = 0$。


4. 坐标同构 (Coordinate Isomorphism)

在 $n$维线性空间$V$中取定一组基$\alpha_1, \dots, \alpha_n$ 后,$V$中的每个元素$\alpha = \sum k_i \alpha_i$与其坐标向量$[k_1, \dots, k_n]^T \in K^n$ 之间建立了一一对应关系。

结论:这种对应保持了向量的加法与数乘运算,即 $V$与向量空间$K^n$ 线性同构。


5. 同构关系的性质

线性空间的同构关系满足:

  • 自反性:$V \cong V$- 交换性:若$U \cong V$,则 $V \cong U$- 传递性:若$U \cong V$且$V \cong W$,则 $U \cong W$

    因此,同构是线性空间集合上的一个等价关系


6. 实例与应用

  • 矩阵秩的性质

    设矩阵 $A = [\alpha_1, \dots, \alpha_n]$列满秩,则映射$X \mapsto AX$是$K^n$到$A$ 的列空间的线性同构。

  • 矩阵分解应用

    若 $B = AC = [\alpha_1, \dots, \alpha_n] [\gamma_1, \dots, \gamma_s]$,则:

    1. $B$的秩$= C$ 的秩。

    2. $B$的解空间$= C$ 的解空间。

    3. $\gamma_1, \dots, \gamma_s$是$\beta_1, \dots, \beta_s$在基$\alpha_1, \dots, \alpha_n$ 下的坐标。

  • 思考题:矩阵 $A$ 的行空间与列空间同构吗?

    提示:由于行秩等于列秩,即维数相等,根据定理它们必然同构。

商空间与线性映射基本定理

商空间听起来很高级,实际上动机是简单的,我们知道重力势能可以简单地写为 $mgh$ ,那么水平方向如何运动便可以置之不顾了,那么我们略去三维中的两维,只看高度这一个坐标即可,商空间干的事其实也就是这样。

核心动机:忽略不相关的细节

在处理复杂事物时,我们往往只关注某些特定的“层面”。

  • 数学直观:如果我们对子空间 $W$ 方向的差异不感兴趣,就希望通过某种方式将其“抹去”或“淡化”。

  • 几何想象:将高维空间沿 $W$方向“压扁”,使得落在同一个与$W$ 平行的平面(陪集)上的所有点,在商空间视角下被视为同一个“元素”。

$W$-陪集(Coset)

陪集是将空间 $V$按照子空间$W$进行划分的基本单位。简单来说就是让$W=0$。按照之前的重力势能的比喻,就是说在同一个高度的坐标我们就看做一个陪集,认为他们都相等,这里就可以把$W$看做$x,y$ 坐标,即被弃置不顾的东西。

  • 等价关系:定义 $\alpha \sim \beta \iff \alpha - \beta \in W$。

  • 定义:对于 $V$中的向量$\beta$,其所在的等价类称为 $\beta$的$W$-陪集,记作 $\beta + W = { \beta + \gamma \mid \gamma \in W }$。

  • 代表元:陪集中的任何向量都可以作为该陪集的代表。只要 $\alpha - \beta \in W$,则 $\alpha + W = \beta + W$。

商空间 $V/W$ 的代数结构

全体 $W$-陪集的集合记为 $V/W$。为了使其成为线性空间,定义了如下运算:

  • 加法:$(\alpha + W) + (\beta + W) = (\alpha + \beta) + W$

  • 数乘:$k(\alpha + W) = k\alpha + W$

  • 良定义性:运算结果不依赖于陪集代表元的选取(需验证)。作差即可验证。

  • 结论:在此运算下,$V/W$ 构成线性空间,称为 $V$模$W$ 的商空间

基与维度(Basis and Dimension)

这是将商空间具体化的关键。

  • 定理:设 $W$的一组基为$\alpha_1, \dots, \alpha_s$,将其扩充为 $V$的一组基$\alpha_1, \dots, \alpha_s, \beta_1, \dots, \beta_r$。

  • 结论:剩余的向量所形成的陪集 ${\beta_1 + W, \dots, \beta_r + W}$构成了商空间$V/W$ 的一组

  • 维数公式

$$ \dim(V/W) = \dim V - \dim W $$

证明:

  • 证明能表出(Spanning)

    对于 $V/W$中任意元素$\alpha + W$,将 $\alpha$用$V$的全基线性表示。由于$\alpha_i$部分全部落在$W$中,在商运算(模$W$)下,属于 $W$的分量会自动坍缩为零元(即$0 + W$)。

$$ \alpha + W = (\sum k_i \alpha_i + \sum l_j \beta_j) + W = (\sum l_j \beta_j) + W $$

这说明 $\beta_j + W$ 足以覆盖整个商空间。

  • 证明线性无关(Linear Independence)

    设定线性组合为零元:$\sum l_j (\beta_j + W) = 0 + W$。

    这意味着向量 $\sum l_j \beta_j$必须落在子空间$W$ 内。

    根据基底的唯一定义,若一个仅由 $\beta_j$组成的向量属于$\text{span}{\alpha_i}$,由于全基 ${\alpha_i, \beta_j}$是线性无关的,所有系数$l_j$必须全为$0$。

线性映射的核心:核与像

对于任何线性映射 $\mathcal{A}: U \to V$,都有两个关键的子空间:

  • 像空间 $\text{Im},\mathcal{A}$:$V$ 中所有能被映射到的向量集合。它反映了映射的“广度”。

  • 核空间 $\text{Ker},\mathcal{A}$:$U$中所有被映射到$0$ 的向量集合。它反映了映射丢失的“信息量”。

  • 典范映射:特例情况下,映射 $\mathcal{A}: V \to V/W$将向量映为其陪集$\alpha + W$,此时 $\text{Ker},\mathcal{A} = W$,$\text{Im},\mathcal{A} = V/W$。

线性映射基本定理

这是线性代数的高光时刻。定理指出:任何线性映射都可以被“分解”为一个同构映射。

  • 同构关系

$$ U/\text{Ker}\,\mathcal{A} \cong \text{Im}\,\mathcal{A} $$

  • 直观理解

    如果我们把定义域 $U$中那些映射到同一个点的向量“打包”在一起(即作商空间,模掉$\text{Ker},\mathcal{A}$),那么这个“包”的集合与像空间之间就是一一对应的。

  • 性质:映射 $\varphi: \alpha + \text{Ker},\mathcal{A} \mapsto \mathcal{A}\alpha$ 是良定义的,且既是单射又是满射。

1. 诱导映射的构造

定义映射 $\varphi: U/\text{Ker},\mathcal{A} \to \text{Im},\mathcal{A}$,其规则为:

$$ \varphi(\alpha + \text{Ker}\,\mathcal{A}) = \mathcal{A}\alpha $$

  • 代数上的相容性:$\varphi$ 完美保持了向量的加法与数乘运算。

  • 几何上的映射关系:原本在 $U$中所有映射到同一个像点$\beta$的向量(它们构成一个$\text{Ker},\mathcal{A}$ 的陪集),现在被视为商空间中的一个整体。这意味着映射从“多对一”变成了一对一的线性同构

具体的验证比较容易,就不打出来了。

2. 维度守恒:秩-零化度定理

基于 $U/\text{Ker},\mathcal{A} \cong \text{Im},\mathcal{A}$ 的同构关系,我们必然得到维度的平衡:

$$ \dim U = \dim(\text{Ker}\,\mathcal{A}) + \dim(\text{Im}\,\mathcal{A}) $$

这可以看作是定义域空间的“能量守恒”:一部分维度坍缩到了零点(核空间),剩下的维度则铺开了映射的像(像空间)。


矩阵视角的具象化:方程组与空间的映射

当我们将上述理论落地到矩阵 $A \in K^{m \times n}$ 时,抽象的符号变成了直观的线性方程组特性:

抽象概念 矩阵具象 物理/几何意义
像空间 $\text{Im},\mathcal{A}$ 列空间 (Column Space) 矩阵各列向量线性组合所能张成的空间。
核空间 $\text{Ker},\mathcal{A}$ 解空间 (Null Space) 齐次线性方程组 $A\mathbf{x} = \mathbf{0}$ 的全体解。
同构关系 $K^n / \text{Null}(A) \cong \text{Col}(A)$ 剔除解空间后的输入,与输出空间达成一一对应。

结论

由基本定理可直接导出矩阵论的基石:

矩阵的秩(列空间的维数) + 解空间的维数 = 矩阵的列数。

这意味着,非齐次线性方程组 $A\mathbf{x} = \mathbf{b}$ 的解集之所以呈现出“特解 + 齐次核”的形态,本质上是因为它就是商空间中某一个特定的陪集。

商空间的使用方法:构造满射,模去核空间,得到同构

例:设 $U, W$是线性空间$V$ 的子空间。证明:

$$ U / U \cap W \cong (U + W) / W $$

证:映射 $\mathcal{A} : U \to (U + W) / W

$$ $\alpha \mapsto \alpha + W $$

是线性映射。

$\mathcal{A}$显然是满射 且$\text{Ker} \mathcal{A} = U \cap W$。

由线性映射基本定理即得到结论。


$\mathbf{W}$的补空间$\cong$模$\mathbf{W}$ 的商空间

定理:

设 $\mathbf{V}$的子空间$\mathbf{W}$的有一个补空间$\mathbf{U}$,即 $\mathbf{W} \oplus \mathbf{U} = \mathbf{V}$。则映射

$$ \sigma : \mathbf{U} \to \mathbf{V} / \mathbf{W} $$

$$ \alpha \mapsto \alpha + \mathbf{W} $$

是 $\mathbf{W}$的补空间$\mathbf{U}$到商空间$\mathbf{V} / \mathbf{W}$ 的同构。


定理

$$ \text{Im}\mathcal{A} \big/ (\text{Im}\mathcal{A} \cap \text{Ker}\mathcal{B}) \cong \text{Im}(\mathcal{BA}) $$

首先,考虑把 $B$限制在$ImA$上,有$Ker(A|_W)=KerA\cap ImB$,从而$ImA/KerB \cap ImA\cong Im(BA)$。$\mathbf{W} \oplus \mathbf{U} = \mathbf{V} \implies \mathbf{U} \cong \mathbf{V} / \mathbf{W}$

$\beta + \alpha = \gamma \mapsto \alpha + \mathbf{W} = \gamma + \mathbf{W}$

阅读全文

笔记4.矩阵空间与向量空间的同构

线代 2026/4/13

对一个向量,我们把它看做 $n$个坐标,构建从向量到$n$ 个坐标的同构。
矩阵实际上也就是向量的堆叠,那类似的我们把它看做 $n$ 个向量,也可以构建同构。

矩阵的展开 (Matrix Vectorization)

  • 列展开 $\text{cs}(A)$:将 $m \times n$矩阵$A$的元素自左向右、一列一列地排列成一个$mn$ 维列向量。

    • 示例:若 $A = \begin{pmatrix} 1 & 4 \ 2 & 5 \ 3 & 6 \end{pmatrix}$,则 $\text{cs}(A) = [1, 2, 3, 4, 5, 6]^T$。
  • 行展开 $\text{rs}(A)$:类似地,将矩阵按行顺序排列成一个行向量。

    • 示例:对于上述矩阵,$rs(A) = [1, 4, 2, 5, 3, 6]$。

这显然是同构,也就是说,我们完全可以把矩阵看成一个超级向量。


Kronecker 积 (Kronecker Product)

定义

设矩阵 $A = [a_{ij}] \in M_{m,n}(K)$,矩阵 $B \in M_{p,q}(K)$。它们的 Kronecker 积(也称张量积)记为 $A \otimes B$,是一个 $mp \times nq$ 的分块矩阵:

$$ A \otimes B = \begin{pmatrix} a_{11}B & \dots & a_{1n}B \\ \vdots & \ddots & \vdots \\ a_{m1}B & \dots & a_{mn}B \end{pmatrix} $$

即用 $A$的每个元素$a_{ij}$乘以矩阵$B$ 得到的分块矩阵。

关键性质

  • 非交换性:一般情况下,$A \otimes B \neq B \otimes A$。

  • 结合律:$(A \otimes B) \otimes C = A \otimes (B \otimes C)$。

  • 特殊情形:当 $A$为列向量且$C$为行向量时(或反之),在特定维度下可能满足$A \otimes C = C \otimes A = AC$。


运算示例

基础计算

若 $A = \begin{pmatrix} 1 & 2 & 3 \ 4 & 5 & 6 \end{pmatrix}$,$B = \begin{pmatrix} a & b \ c & d \end{pmatrix}$,则:

$$ A \otimes B = \begin{pmatrix} B & 2B & 3B \\ 4B & 5B & 6B \end{pmatrix} = \begin{pmatrix} a & b & 2a & 2b & 3a & 3b \\ c & d & 2c & 2d & 3c & 3d \\ 4a & 4b & 5a & 5b & 6a & 6b \\ 4c & 4d & 5c & 5d & 6c & 6d \end{pmatrix} $$

向量间的积

若 $A = [1, 2, 3]^T$,$B = [a, b]^T$,则:

  • $A \otimes B = [a, b, 2a, 2b, 3a, 3b]^T$-$B \otimes A = [a, 2a, 3a, b, 2b, 3b]^T$

    (此处直观展示了顺序不同导致的结果差异)


4. 混合乘积公式 (Mixed-Product Property)

这是 Kronecker 积最重要的性质之一,联系了普通矩阵乘法与张量积:

$$ (A \otimes B)(C \otimes D) = (AC) \otimes (BD) $$

  • 前提条件:矩阵乘法 $AC$和$BD$必须有意义(即$A$的列数等于$C$ 的行数,$B$的列数等于$D$ 的行数)。

  • 推导逻辑:通过分块矩阵乘法规律可以证明,左侧展开后的子块项 $\sum a_{ik} c_{kj} B D$正好对应右侧$(AC) \otimes (BD)$ 的构造。

Kronecker 积的核心性质

  • 结合律:$(A \otimes B) \otimes C = A \otimes (B \otimes C)$

  • 混合乘积公式:$(A \otimes B)(C \otimes D) = AC \otimes BD$

  • 逆矩阵:$(A \otimes B)^{-1} = A^{-1} \otimes B^{-1}$

  • 转置:$(A \otimes B)^T = A^T \otimes B^T$- 正交性保持:若$A, B$是正交矩阵,则$A \otimes B$ 也是正交矩阵。


代数特征(秩、行列式、特征值)

  1. :$\text{rank}(A \otimes B) = \text{rank}(A) \cdot \text{rank}(B)$2. 行列式:设$A$为$m$ 阶方阵,$B$为$n$阶方阵,则$|A \otimes B| = |A|^n |B|^m$

  2. 特征值

    • 设 $A$的特征值为$\lambda_i$,$B$的特征值为$\mu_j$。

    • $A \otimes B$的特征值为$\lambda_i \mu_j$。

    • Kronecker 和 $A \otimes I_n + I_m \otimes B$的特征值为$\lambda_i + \mu_j$。


特殊实例:Hadamard 矩阵的构造

利用 Kronecker 积可以递归构造特殊的正交矩阵(如 Hadamard 矩阵):

  • $A_2 = \frac{1}{\sqrt{2}} \begin{pmatrix} 1 & 1 \ 1 & -1 \end{pmatrix}$-$A_4 = A_2 \otimes A_2 = \frac{1}{2} \begin{pmatrix} A_2 & A_2 \ A_2 & -A_2 \end{pmatrix}$-$A_8 = A_2 \otimes A_4$ … 以此类推。

矩阵列展开的核心定理

这是连接矩阵方程与线性方程组的桥梁:

定理:$\text{cs}(AXB) = (B^T \otimes A) \text{cs}(X)$

证明逻辑拆解:

  1. 左乘变换:$\text{cs}(AX) = (I_n \otimes A) \text{cs}(X)$。这说明 $A$对$X$ 的左乘对应于列展开后的块对角阵相乘。

  2. 右乘变换:$\text{cs}(XB) = (B^T \otimes I_m) \text{cs}(X)$。注意此处 $B$ 需要转置。

  3. 合成结论:通过结合律 $\text{cs}(A(XB)) = (I_n \otimes A) \text{cs}(XB) = (I_n \otimes A)(B^T \otimes I_m) \text{cs}(X)$,利用混合乘积公式化简为 $(B^T \otimes A) \text{cs}(X)$。


线性变换的矩阵表示

设 $\mathcal{A}: X \mapsto AXB$是矩阵空间$M_{m,n}(K)$ 上的线性变换:

  • 在标准基 $E_{1,1}, E_{2,1}, \dots, E_{m,n}$(即按列展开排序)下,该线性变换对应的矩阵正是 $B^T \otimes A$

  • 直观理解

    • $A$作用于$X$ 的行变换

    • $B$作用于$X$ 的列变换


线性矩阵方程的向量化求解

基于前文的列展开性质,可以将复杂的矩阵方程转化为标准的线性方程组形式。

  • 推论:$X \in M_{m,n}(K)$是矩阵方程$\sum_{j=1}^{s} A_j X B_j = C$的解,当且仅当其列展开$\text{cs}(X)$ 满足:

$$ \left( \sum_{j=1}^{s} B_j^T \otimes A_j \right) \text{cs}(X) = \text{cs}(C) $$

其中 $A_j, B_j$分别为$m, n$ 级方阵,$C \in M_{m,n}(K)$。

  • 本质:这利用了 Kronecker 积将矩阵算子“拉直”为算子矩阵,使得我们能用经典的线性代数工具(如高斯消元法)来处理矩阵方程。

张量积空间 (Tensor Product Space)

将张量积从矩阵运算上升到线性空间的构造。

  • 定义:设 $U = R^m, V = R^n$ 是两个线性空间,集合

$$ T = \left\{ \sum_{i=1}^{k} \alpha_i \otimes \beta_i \mid \alpha_i \in U, \beta_i \in V, k \geq 1 \right\} $$

构成一个线性空间,称为 $U$与$V$的张量积空间,记为$U \otimes V$。

  • 基与维数

    • 若 $\alpha_1, \dots, \alpha_m$是$U$ 的基,$\beta_1, \dots, \beta_n$是$V$ 的基。

    • 则所有可能的组合 ${\alpha_i \otimes \beta_j}$构成$U \otimes V$ 的一组基。

    • 结论:$U \otimes V \cong R^{mn}$,即张量积空间的维数是原空间维数的乘积。


线性变换的张量积

这是张量积在算子层面的推广。

  • 定义:设 $\mathcal{A} \in \text{Hom}(U), \mathcal{B} \in \text{Hom}(V)$,定义线性变换 $\mathcal{A} \otimes \mathcal{B}: U \otimes V \to U \otimes V$ 为:

$$ \mathcal{A} \otimes \mathcal{B} (\alpha \otimes \beta) = (\mathcal{A}\alpha) \otimes (\mathcal{B}\beta) $$

该变换称为变换 $\mathcal{A}$与$\mathcal{B}$ 的张量积。

  • 矩阵表示

    若 $\mathcal{A}$在基${\alpha_i}$下的矩阵为$A$,$\mathcal{B}$在基${\beta_j}$下的矩阵为$B$,则线性变换 $\mathcal{A} \otimes \mathcal{B}$在$U \otimes V$的基${\alpha_i \otimes \beta_j}$ 下的矩阵恰好就是 $A \otimes B$

这些东西实际上是可以简化结构,让我们更清楚地看到矩阵的,例如我们可以看一些问题:


题目:矩阵方程解空间的性质证明

设 $A, B$分别是$m, n$级方阵,且$\text{rank}(A) = r$,$\text{rank}(B) = s$。证明:

$$ W = \{ X \in M_{m,n}(K) \mid AXB = 0 \} $$

是矩阵空间 $M_{m,n}(K)$的子空间,且$\dim W = mn - rs$。


1. 证明 $W$ 是子空间

根据子空间的定义,需验证对加法和数乘的封闭性:

  • 加法封闭性:设 $X, Y \in W$,则有 $AXB = 0$且$AYB = 0$。

$$ A(X + Y)B = AXB + AYB = 0 + 0 = 0 $$

故 $X + Y \in W$。

  • 数乘封闭性:设 $X \in W, k \in K$,则:

$$ A(kX)B = k(AXB) = k \cdot 0 = 0 $$

故 $kX \in W$。

由此可知,$W$是$M_{m,n}(K)$ 的子空间。

2. 证明 $\dim W = mn - rs$

这里使用了**列展开(Vectorization)**和 Kronecker 积 的性质将矩阵问题转化为线性方程组问题。

(1) 方程转化

利用恒等式 $\text{cs}(AXB) = (B^T \otimes A) \text{cs}(X)$,原矩阵方程 $AXB = 0$ 等价于线性方程组:

$$ (B^T \otimes A) \cdot \text{cs}(X) = \mathbf{0} $$

其中,$\text{cs}(X)$是一个$mn$维的列向量,系数矩阵为$M = B^T \otimes A$,其规模为 $mn \times mn$。

(2) 确定系数矩阵的秩

根据 Kronecker 积关于秩的性质:

$$ \text{rank}(B^T \otimes A) = \text{rank}(B^T) \cdot \text{rank}(A) $$

由于矩阵转置不改变秩,且已知 $\text{rank}(A) = r, \text{rank}(B) = s$,则:

$$ \text{rank}(B^T \otimes A) = s \cdot r = rs $$

(3) 利用维数公式

子空间 $W$ 的维数等价于上述齐次线性方程组解空间的维数。根据线性方程组解空间的维数公式($n$ 维空间减去系数矩阵的秩):

$$ \dim W = \dim (\text{解空间}) = mn - \text{rank}(B^T \otimes A) = mn - rs $$

证毕。

题目:矩阵变换 $\mathcal{S}$ 的特征值与对角化证明

设 $A, B$分别是$m, n$阶复矩阵,其特征值分别为${\lambda_1, \dots, \lambda_m}$与${\mu_1, \dots, \mu_n}$。

定义映射 $\mathcal{S}: M_{m,n}(\mathbb{C}) \to M_{m,n}(\mathbb{C})$:

$$ \mathcal{S}(X) = AX - XB + AXB^2 $$


1. 证明 $\mathcal{S}$ 是线性变换

根据线性变换的定义,需满足加法与数乘的齐次性:

  • 线性度验证:利用矩阵乘法的分配律与结合律:

$$ \mathcal{S}(k_1 X + k_2 Y) = A(k_1 X + k_2 Y) - (k_1 X + k_2 Y)B + A(k_1 X + k_2 Y)B^2 $$

$$ = k_1(AX - XB + AXB^2) + k_2(AY - YB + AYB^2) = k_1 \mathcal{S}(X) + k_2 \mathcal{S}(Y) $$

故 $\mathcal{S}$是$M_{m,n}(\mathbb{C})$ 上的线性变换。


2. 求变换 $\mathcal{S}$ 的所有特征值

利用列展开(Vectorization),我们将 $\mathcal{S}(X)$ 转换为向量形式:

$$ \text{cs}(\mathcal{S}(X)) = \text{cs}(AXI_n - I_m XB + AXB^2) $$

根据公式 $\text{cs}(AXB) = (B^T \otimes A) \text{cs}(X)$,提取 $\text{cs}(X)$得到变换矩阵$M$:

$$ M = (I_n \otimes A) - (B^T \otimes I_m) + ((B^2)^T \otimes A) $$

  • 特征值计算

    已知 $A$的特征值为$\lambda_i$,$B$(及 $B^T$)的特征值为 $\mu_j$。

    根据 Kronecker 积的性质,特征值的对应关系为:

    • $I_n \otimes A$的特征值为$1 \cdot \lambda_i = \lambda_i$-$B^T \otimes I_m$的特征值为$\mu_j \cdot 1 = \mu_j$-$(B^T)^2 \otimes A$的特征值为$\mu_j^2 \cdot \lambda_i$由于这些项在同一组基(由$A$和$B^T$的特征向量构成的张量积基)下可以同时三角化,因此变换$\mathcal{S}$ 的特征值为:

$$ \lambda'_{ij} = \lambda_i - \mu_j + \lambda_i \mu_j^2, \quad (i=1,\dots,m; \ j=1,\dots,n) $$


3. 对角化证明与特征向量

证明:

  1. 前提条件:已知 $A$和$B$可对角化。这意味着$A$有$m$个线性无关的特征向量$\alpha_i$, $B^T$有$n$个线性无关的特征向量$\gamma_j$(注意 $B$可对角化则$B^T$ 亦然,且特征值相同)。

  2. 构造变换 $\mathcal{S}$ 的特征向量

    在张量积空间 $M_{m,n}(\mathbb{C})$中,变换$\mathcal{S}$ 的特征向量对应的“矩阵形式”为:

$$ X_{ij} = \alpha_i \beta_j^H \quad (\text{或更简单地记为 } \alpha_i \text{ 与 } B \text{ 的左特征向量的积}) $$

更严谨地说,若 $A\alpha_i = \lambda_i \alpha_i$,且 $\beta_j$是$B$的特征向量(满足$B\beta_j = \mu_j \beta_j$并不直观,这里通常看作$X \beta_j$ 的映射关系)。

  1. 结论

    由于我们能构造出 $m \times n$个形如$E_{ij} = \alpha_i \otimes \gamma_j$的线性无关特征向量,而空间$M_{m,n}(\mathbb{C})$的维数恰好也是$mn$,特征向量集构成了空间的一组基。

    故 $\mathcal{S}$ 可对角化。

  • $\mathcal{S}$ 的特征向量(矩阵形式)

    即满足 $\mathcal{S}(X) = \lambda’_{ij} X$的矩阵。若$A \alpha_i = \lambda_i \alpha_i$且$\beta_j^T B = \mu_j \beta_j^T$(即 $\beta_j^T$是$B$ 的左特征向量),则:

$$ X_{ij} = \alpha_i \beta_j^T $$

阅读全文

神秘补充题

线代 2026/4/5

设 $V = \mathbb{F}{13}^3$是有限域$\mathbb{F}{13}$ 上的三维向量空间。给定矩阵:

$$ A = \begin{bmatrix} 5 & 7 & 7 \\ 12 & 4 & 2 \\ 3 & 7 & 9 \end{bmatrix} \pmod{13} $$

  1. 对角化判定判断矩阵 $A$能否在域$\mathbb{F}_{13}$ 上对角化,并说明理由。

  2. 矩阵的阶与可逆性证明 $A$是可逆矩阵,并求出最小的正整数$d$,使得:

$$ A^d = I $$

(其中 $I$ 为单位矩阵)。

  1. 向量等价关系与轨道分解设 $\alpha, \beta \in \mathbb{F}_{13}^3$。若存在非负整数 $k, l \ge 0$,使得:

$$ A^k \alpha = \beta \quad \text{且} \quad A^l \beta = \alpha $$

则称 $\alpha$与$\beta$等价,记作$\alpha \sim \beta$。证明:“$\sim$” 是向量空间 $\mathbb{F}{13}^3$上的一个等价关系。向量空间$\mathbb{F}{13}^3$被划分为几个等价类?每个等价类(称为一条$A$-轨道)分别包含几个向量?哪些等价类的并集能够构成 $\mathbb{F}_{13}^3$ 的子空间?

这道题的本质,其实是:

有限域上线性变换 = 对角化 + 有限乘法群 + 群作用轨道分解

阅读全文

罗马

阅读全文

4月日记

日记类 2026/4/1

4月了呢。

阅读全文
1 ... 9 10 11 ... 15