1. 正态分布的核心思想
正态分布也称高斯分布,是概率论、统计学、机器学习和优化理论中最重要的连续型分布之一。
它的核心特征是:
- 分布由均值和方差控制。
- 曲线关于均值对称。
- 越靠近均值,概率密度越大。
- 越远离均值,概率密度按指数速度衰减。
- 多个独立随机因素叠加时,经常近似服从正态分布。
从一维推广到高维后,正态分布不再只由一个均值和一个方差描述,而是由:
- 均值向量 $\mu$
- 协方差矩阵 $\Sigma$
共同描述。
一维正态分布描述数轴上的随机变量;二维正态分布描述平面上的随机向量;$n$ 维正态分布描述 $n$ 维空间中的随机向量。
2. 一维正态分布
2.1 定义
若随机变量 $X$ 的概率密度函数为:
$$ f_X(x) =\frac{1}{\sqrt{2\pi\sigma^2}} \exp\left( -\frac{(x-\mu)^2}{2\sigma^2} \right), $$
其中:
$$ \mu\in\mathbb{R},\quad \sigma^2>0, $$
则称 $X$ 服从均值为 $\mu$、方差为 $\sigma^2$ 的一维正态分布,记作:
$$ X\sim N(\mu,\sigma^2). $$
其中:
- $\mu$ 是均值,决定分布中心。
- $\sigma^2$ 是方差,决定分布离散程度。
- $\sigma$ 是标准差,决定钟形曲线的宽窄。
2.2 标准正态分布
当:
$$ \mu=0,\quad \sigma^2=1 $$
时,称为标准正态分布:
$$ Z\sim N(0,1). $$
其概率密度函数为:
$$ \phi(z) =\frac{1}{\sqrt{2\pi}} \exp\left(-\frac{z^2}{2}\right). $$
标准正态分布是所有一维正态分布的基础。
若:
$$ X\sim N(\mu,\sigma^2), $$
则标准化变量:
$$ Z=\frac{X-\mu}{\sigma} $$
满足:
$$ Z\sim N(0,1). $$
反过来,如果:
$$ Z\sim N(0,1), $$
则:
$$ X=\mu+\sigma Z $$
满足:
$$ X\sim N(\mu,\sigma^2). $$
2.3 一维正态分布的图像性质
一维正态分布的密度曲线是钟形曲线。
其主要性质包括:
- 关于 $x=\mu$ 对称。
- 在 $x=\mu$ 处取得最大值。
- 当 $|x-\mu|$ 越大时,密度越小。
- $\sigma$ 越大,曲线越宽、越矮。
- $\sigma$ 越小,曲线越窄、越高。
- 曲线下面积为 $1$。
由于概率密度必须积分为 $1$,所以:
$$ \int_{-\infty}^{\infty} \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left( -\frac{(x-\mu)^2}{2\sigma^2} \right),dx =1. $$
2.4 均值与方差
若:
$$ X\sim N(\mu,\sigma^2), $$
则:
$$ \mathbb{E}[X]=\mu, $$
$$ \operatorname{Var}(X)=\sigma^2. $$
其中:
$$ \mathbb{E}[X] =\int_{-\infty}^{\infty}x f_X(x),dx, $$
$$ \operatorname{Var}(X) =\mathbb{E}[(X-\mu)^2]. $$
2.5 分布函数
一维正态分布的分布函数为:
$$ F_X(x)=P(X\le x). $$
如果:
$$ X\sim N(\mu,\sigma^2), $$
则:
$$ F_X(x) =\Phi\left(\frac{x-\mu}{\sigma}\right), $$
其中 $\Phi$ 是标准正态分布函数:
$$ \Phi(z)=\int_{-\infty}^z \frac{1}{\sqrt{2\pi}} \exp\left(-\frac{t^2}{2}\right),dt. $$
标准正态分布函数一般没有初等函数形式,实际计算时通常查表或用数值方法。
2.6 线性变换性质
若:
$$ X\sim N(\mu,\sigma^2), $$
且:
$$ Y=aX+b, $$
其中 $a,b$ 是常数,则:
$$ Y\sim N(a\mu+b,a^2\sigma^2). $$
这说明正态分布在线性变换下仍然是正态分布。
特别地:
$$ \frac{X-\mu}{\sigma}\sim N(0,1). $$
2.7 矩母函数与特征函数
若:
$$ X\sim N(\mu,\sigma^2), $$
则矩母函数为:
$$ M_X(t)=\mathbb{E}[e^{tX}] =\exp\left(\mu t+\frac12\sigma^2t^2\right). $$
特征函数为:
$$ \varphi_X(t)=\mathbb{E}[e^{itX}] =\exp\left(i\mu t-\frac12\sigma^2t^2\right). $$
矩母函数和特征函数可以用来证明正态分布在线性组合下的封闭性。
2.8 独立正态变量之和
若:
$$ X_1\sim N(\mu_1,\sigma_1^2), $$
$$ X_2\sim N(\mu_2,\sigma_2^2), $$
且 $X_1,X_2$ 独立,则:
$$ X_1+X_2 \sim N(\mu_1+\mu_2,\sigma_1^2+\sigma_2^2). $$
更一般地,若 $X_1,\dots,X_n$ 相互独立,且:
$$ X_i\sim N(\mu_i,\sigma_i^2), $$
则:
$$ \sum_{i=1}^n a_iX_i \sim N\left( \sum_{i=1}^n a_i\mu_i, \sum_{i=1}^n a_i^2\sigma_i^2 \right). $$
3. 二维正态分布
3.1 从随机变量到随机向量
一维正态分布研究一个随机变量:
$$ X. $$
二维正态分布研究一个随机向量:
$$ X= \begin{pmatrix} X_1\ X_2 \end{pmatrix}. $$
其中 $X_1$ 和 $X_2$ 都是随机变量。
二维正态分布不仅要描述每个变量自己的均值和方差,还要描述二者之间的相关关系。
因此需要:
均值向量:
$$ \mu= \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, $$
协方差矩阵:
$$ \Sigma= \begin{pmatrix} \sigma_1^2 & \rho\sigma_1\sigma_2\ \rho\sigma_1\sigma_2 & \sigma_2^2 \end{pmatrix}. $$
其中:
- $\mu_1=\mathbb{E}[X_1]$。
- $\mu_2=\mathbb{E}[X_2]$。
- $\sigma_1^2=\operatorname{Var}(X_1)$。
- $\sigma_2^2=\operatorname{Var}(X_2)$。
- $\rho=\operatorname{Corr}(X_1,X_2)$ 是相关系数。
- $\rho\sigma_1\sigma_2=\operatorname{Cov}(X_1,X_2)$ 是协方差。
3.2 二维正态分布的密度函数
若随机向量:
$$ X= \begin{pmatrix} X_1\ X_2 \end{pmatrix} $$
服从二维正态分布,记作:
$$ X\sim N_2(\mu,\Sigma). $$
当 $\Sigma$ 正定时,其联合密度为:
$$ f(x_1,x_2)
\frac{1}{2\pi\sigma_1\sigma_2\sqrt{1-\rho^2}} \exp\left[ -\frac{1}{2(1-\rho^2)} \left( \frac{(x_1-\mu_1)^2}{\sigma_1^2} -2\rho\frac{(x_1-\mu_1)(x_2-\mu_2)}{\sigma_1\sigma_2} +\frac{(x_2-\mu_2)^2}{\sigma_2^2} \right) \right]. $$
这里要求:
$$ \sigma_1>0,\quad \sigma_2>0,\quad -1<\rho<1. $$
如果 $|\rho|=1$,则协方差矩阵退化,分布集中在一条直线上,不再有普通二维密度函数。
3.3 矩阵形式
二维密度也可以写成更简洁的矩阵形式:
$$ f(x)
\frac{1}{(2\pi)^{1}\det(\Sigma)^{1/2}} \exp\left[ -\frac12(x-\mu)^T\Sigma^{-1}(x-\mu) \right], $$
其中:
$$ x= \begin{pmatrix} x_1\ x_2 \end{pmatrix}. $$
因为二维时 $n=2$,所以一般公式中的 $(2\pi)^{n/2}$ 变为:
$$ (2\pi)^{2/2}=2\pi. $$
二维协方差矩阵的行列式为:
$$ \det(\Sigma) =\sigma_1^2\sigma_2^2(1-\rho^2). $$
因此:
$$ \det(\Sigma)^{1/2} =\sigma_1\sigma_2\sqrt{1-\rho^2}. $$
这正好对应前面密度函数的归一化系数。
3.4 相关系数的作用
相关系数:
$$ \rho\in(-1,1) $$
控制 $X_1$ 与 $X_2$ 的线性相关程度。
若:
$$ \rho=0, $$
则协方差矩阵为对角矩阵:
$$ \Sigma= \begin{pmatrix} \sigma_1^2 & 0\ 0 & \sigma_2^2 \end{pmatrix}. $$
此时密度函数可以分解为:
$$ f(x_1,x_2)=f_1(x_1)f_2(x_2). $$
所以在二维正态分布中:
$$ \rho=0 \quad\Longleftrightarrow\quad X_1,X_2\ \text{独立}. $$
注意:对一般随机变量来说,不相关不一定独立。但对联合正态分布来说,不相关等价于独立。
3.5 边缘分布
若:
$$ \begin{pmatrix} X_1\ X_2 \end{pmatrix} \sim N_2 \left( \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, \begin{pmatrix} \sigma_1^2 & \rho\sigma_1\sigma_2\ \rho\sigma_1\sigma_2 & \sigma_2^2 \end{pmatrix} \right), $$
则边缘分布为:
$$ X_1\sim N(\mu_1,\sigma_1^2), $$
$$ X_2\sim N(\mu_2,\sigma_2^2). $$
也就是说,二维正态分布的每个分量都是一维正态分布。
但反过来不一定成立:
如果 $X_1$ 和 $X_2$ 分别是一维正态分布,并不能自动推出 $(X_1,X_2)^T$ 是二维联合正态分布。
3.6 条件分布
二维正态分布的一个重要性质是:条件分布仍然是正态分布。
若:
$$ \begin{pmatrix} X_1\ X_2 \end{pmatrix} \sim N_2 \left( \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, \begin{pmatrix} \sigma_1^2 & \rho\sigma_1\sigma_2\ \rho\sigma_1\sigma_2 & \sigma_2^2 \end{pmatrix} \right), $$
则在给定 $X_2=x_2$ 的条件下:
$$ X_1\mid X_2=x_2 \sim N\left( \mu_1+\rho\frac{\sigma_1}{\sigma_2}(x_2-\mu_2), \sigma_1^2(1-\rho^2) \right). $$
类似地:
$$ X_2\mid X_1=x_1 \sim N\left( \mu_2+\rho\frac{\sigma_2}{\sigma_1}(x_1-\mu_1), \sigma_2^2(1-\rho^2) \right). $$
这个公式说明:
- 条件均值是被给定变量的线性函数。
- 条件方差不依赖具体观测值 $x_2$ 或 $x_1$。
- 当 $|\rho|$ 越大时,条件方差越小。
- 当 $\rho=0$ 时,条件分布退化为边缘分布,说明二者独立。
3.7 二维正态分布的几何形状
二维正态分布的密度函数在三维图像中像一个山丘。
它的等密度曲线满足:
$$ (x-\mu)^T\Sigma^{-1}(x-\mu)=c, $$
其中 $c>0$ 是常数。
这是平面中的椭圆。
因此二维正态分布的等密度线是椭圆:
- 椭圆中心是均值向量 $\mu$。
- 椭圆方向由协方差矩阵的特征向量决定。
- 椭圆轴长由协方差矩阵的特征值决定。
- 相关系数 $\rho$ 决定椭圆是否倾斜。
当:
$$ \Sigma= \sigma^2 I $$
时,等密度曲线是圆。
当协方差矩阵不是单位矩阵的倍数时,等密度曲线一般是椭圆。
4. 从二维推广到 n 维
4.1 n 维随机向量
$n$ 维随机向量写作:
$$ X= \begin{pmatrix} X_1\ X_2\ \vdots\ X_n \end{pmatrix} \in\mathbb{R}^n. $$
其均值向量为:
$$ \mu=\mathbb{E}[X]
\begin{pmatrix} \mathbb{E}[X_1]\ \mathbb{E}[X_2]\ \vdots\ \mathbb{E}[X_n] \end{pmatrix}. $$
协方差矩阵为:
$$ \Sigma =\operatorname{Cov}(X) =\mathbb{E}[(X-\mu)(X-\mu)^T]. $$
展开为:
$$ \Sigma= \begin{pmatrix} \operatorname{Var}(X_1) & \operatorname{Cov}(X_1,X_2) & \cdots & \operatorname{Cov}(X_1,X_n)\ \operatorname{Cov}(X_2,X_1) & \operatorname{Var}(X_2) & \cdots & \operatorname{Cov}(X_2,X_n)\ \vdots & \vdots & \ddots & \vdots\ \operatorname{Cov}(X_n,X_1) & \operatorname{Cov}(X_n,X_2) & \cdots & \operatorname{Var}(X_n) \end{pmatrix}. $$
协方差矩阵有两个基本性质:
- 对称性:
$$ \Sigma^T=\Sigma. $$
- 半正定性:
$$ a^T\Sigma a\ge 0,\quad \forall a\in\mathbb{R}^n. $$
因为:
$$ a^T\Sigma a =\operatorname{Var}(a^TX)\ge 0. $$
如果 $\Sigma$ 正定,即:
$$ a^T\Sigma a>0,\quad \forall a\ne 0, $$
则分布在整个 $\mathbb{R}^n$ 中有非退化密度。
4.2 n 维正态分布的定义
若随机向量 $X\in\mathbb{R}^n$ 的密度函数为:
$$ f_X(x)
\frac{1}{(2\pi)^{n/2}\det(\Sigma)^{1/2}} \exp\left[ -\frac12(x-\mu)^T\Sigma^{-1}(x-\mu) \right], $$
其中:
$$ \mu\in\mathbb{R}^n, $$
$$ \Sigma\in\mathbb{R}^{n\times n}, $$
且 $\Sigma$ 是对称正定矩阵,则称:
$$ X\sim N_n(\mu,\Sigma). $$
有时也写作:
$$ X\sim \mathcal{N}(\mu,\Sigma). $$
其中:
- $\mu$ 控制分布中心。
- $\Sigma$ 控制各方向上的尺度、相关性和形状。
- $\Sigma^{-1}$ 称为精度矩阵或信息矩阵。
- $(x-\mu)^T\Sigma^{-1}(x-\mu)$ 称为马氏距离平方。
4.3 为什么指数项是二次型
一维正态分布的指数项是:
$$ \frac{(x-\mu)^2}{\sigma^2}. $$
这可以写成:
$$ (x-\mu)\frac{1}{\sigma^2}(x-\mu). $$
高维情形中,方差 $\sigma^2$ 被协方差矩阵 $\Sigma$ 替代,因此:
$$ \frac{1}{\sigma^2} $$
被:
$$ \Sigma^{-1} $$
替代。
于是得到高维二次型:
$$ (x-\mu)^T\Sigma^{-1}(x-\mu). $$
这个量衡量 $x$ 到均值 $\mu$ 的距离,但不是普通欧氏距离,而是考虑了各方向方差和相关性的马氏距离。
4.4 归一化常数的来源
n 维正态分布的归一化常数为:
$$ \frac{1}{(2\pi)^{n/2}\det(\Sigma)^{1/2}}. $$
它保证:
$$ \int_{\mathbb{R}^n} f_X(x),dx=1. $$
当 $\Sigma=I$ 时,标准 n 维正态分布密度为:
$$ f_X(x)
\frac{1}{(2\pi)^{n/2}} \exp\left(-\frac12 x^Tx\right). $$
由于:
$$ x^Tx=x_1^2+\cdots+x_n^2, $$
所以:
$$ f_X(x)
\prod_{i=1}^n \frac{1}{\sqrt{2\pi}} \exp\left(-\frac{x_i^2}{2}\right). $$
这说明标准 n 维正态分布等价于 $n$ 个相互独立的标准正态变量组成的向量。
5. 多维正态分布的等价定义
高维正态分布有一个非常重要的等价定义。
随机向量 $X\in\mathbb{R}^n$ 服从多维正态分布,当且仅当对任意向量:
$$ a\in\mathbb{R}^n, $$
线性组合:
$$ a^TX $$
都是一维正态分布。
也就是说:
$$ X\sim N_n(\mu,\Sigma) $$
等价于:
$$ a^TX\sim N(a^T\mu,a^T\Sigma a), \quad \forall a\in\mathbb{R}^n. $$
这个定义非常重要,因为它直接说明:
- 多维正态分布在任意方向上的投影都是一维正态分布。
- 多维正态分布在线性变换下仍然是多维正态分布。
- 多维正态分布的所有低维边缘分布仍然是正态分布。
6. 线性变换性质
若:
$$ X\sim N_n(\mu,\Sigma), $$
令:
$$ Y=AX+b, $$
其中:
$$ A\in\mathbb{R}^{m\times n},\quad b\in\mathbb{R}^m, $$
则:
$$ Y\sim N_m(A\mu+b,A\Sigma A^T). $$
这是多维正态分布最重要的性质之一。
特殊情形:
若 $a\in\mathbb{R}^n$,则:
$$ Y=a^TX $$
是一维正态分布:
$$ a^TX\sim N(a^T\mu,a^T\Sigma a). $$
7. 边缘分布
将 $X$ 分块:
$$ X= \begin{pmatrix} X_1\ X_2 \end{pmatrix}, $$
其中:
$$ X_1\in\mathbb{R}^{k}, \quad X_2\in\mathbb{R}^{n-k}. $$
均值和协方差也相应分块:
$$ \mu= \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, $$
$$ \Sigma= \begin{pmatrix} \Sigma_{11} & \Sigma_{12}\ \Sigma_{21} & \Sigma_{22} \end{pmatrix}. $$
若:
$$ X\sim N_n(\mu,\Sigma), $$
则边缘分布为:
$$ X_1\sim N_k(\mu_1,\Sigma_{11}), $$
$$ X_2\sim N_{n-k}(\mu_2,\Sigma_{22}). $$
也就是说,多维正态分布的任意子向量仍然服从多维正态分布。
8. 条件分布
多维正态分布的条件分布仍然是正态分布。
设:
$$ \begin{pmatrix} X_1\ X_2 \end{pmatrix} \sim N \left( \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, \begin{pmatrix} \Sigma_{11} & \Sigma_{12}\ \Sigma_{21} & \Sigma_{22} \end{pmatrix} \right), $$
其中 $\Sigma_{22}$ 可逆。
则:
$$ X_1\mid X_2=x_2 \sim N \left( \mu_{1|2}, \Sigma_{1|2} \right), $$
其中条件均值为:
$$ \mu_{1|2}
\mu_1+\Sigma_{12}\Sigma_{22}^{-1}(x_2-\mu_2), $$
条件协方差为:
$$ \Sigma_{1|2}
\Sigma_{11}-\Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21}. $$
这可以看作二维条件分布公式的矩阵推广。
8.1 条件均值的含义
条件均值:
$$ \mu_1+\Sigma_{12}\Sigma_{22}^{-1}(x_2-\mu_2) $$
是 $x_2$ 的线性函数。
这意味着在联合正态模型中,用 $X_2$ 预测 $X_1$ 的最优均方预测器是线性的。
8.2 条件协方差的含义
条件协方差:
$$ \Sigma_{11}-\Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21} $$
不依赖具体观测值 $x_2$。
它表示观察到 $X_2$ 之后,$X_1$ 剩余的不确定性。
如果 $X_1$ 与 $X_2$ 的相关性越强,则条件协方差通常越小。
9. 独立性与不相关性
对于一般随机变量:
$$ \operatorname{Cov}(X,Y)=0 $$
只表示不相关,不一定表示独立。
但对于联合正态分布,情况更强。
若:
$$ \begin{pmatrix} X_1\ X_2 \end{pmatrix} \sim N \left( \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, \begin{pmatrix} \Sigma_{11} & \Sigma_{12}\ \Sigma_{21} & \Sigma_{22} \end{pmatrix} \right), $$
则:
$$ X_1\ \text{与}\ X_2\ \text{独立} \quad\Longleftrightarrow\quad \Sigma_{12}=0. $$
也就是说,在联合正态分布中,零协方差等价于独立。
这是正态分布区别于一般分布的重要特征。
10. 马氏距离与几何解释
n 维正态分布的密度函数中有:
$$ (x-\mu)^T\Sigma^{-1}(x-\mu). $$
定义马氏距离为:
$$ d_M(x,\mu)
\sqrt{(x-\mu)^T\Sigma^{-1}(x-\mu)}. $$
它衡量点 $x$ 到均值 $\mu$ 的距离,同时考虑:
- 不同方向上的方差大小。
- 不同变量之间的相关性。
- 数据云的椭球形状。
多维正态分布的等密度面满足:
$$ (x-\mu)^T\Sigma^{-1}(x-\mu)=c. $$
这是 $n$ 维空间中的椭球面。
二维时是椭圆;三维时是椭球;更高维时是超椭球。
10.1 协方差矩阵的特征分解
若 $\Sigma$ 对称正定,则可以特征分解:
$$ \Sigma=Q\Lambda Q^T, $$
其中:
- $Q$ 是正交矩阵,列向量是特征向量。
- $\Lambda=\operatorname{diag}(\lambda_1,\dots,\lambda_n)$。
- $\lambda_i>0$ 是特征值。
于是:
$$ \Sigma^{-1}=Q\Lambda^{-1}Q^T. $$
令:
$$ y=Q^T(x-\mu), $$
则:
$$ (x-\mu)^T\Sigma^{-1}(x-\mu)
\sum_{i=1}^n \frac{y_i^2}{\lambda_i}. $$
因此:
- 特征向量给出椭球主轴方向。
- 特征值给出各主轴方向上的方差。
- 特征值越大,该方向上分布越分散。
11. 白化变换
若:
$$ X\sim N_n(\mu,\Sigma), $$
且 $\Sigma$ 正定。
设:
$$ Z=\Sigma^{-1/2}(X-\mu). $$
则:
$$ Z\sim N_n(0,I). $$
这个过程称为白化。
它将一个一般多维正态分布变换为标准多维正态分布。
反过来,如果:
$$ Z\sim N_n(0,I), $$
令:
$$ X=\mu+\Sigma^{1/2}Z, $$
则:
$$ X\sim N_n(\mu,\Sigma). $$
这也是生成多维正态随机样本的基本方法。
实际计算中常用 Cholesky 分解:
$$ \Sigma=LL^T. $$
若:
$$ Z\sim N_n(0,I), $$
则:
$$ X=\mu+LZ $$
满足:
$$ X\sim N_n(\mu,\Sigma). $$
12. 特征函数与矩母函数
若:
$$ X\sim N_n(\mu,\Sigma), $$
则特征函数为:
$$ \varphi_X(t) =\mathbb{E}[e^{it^TX}]
\exp\left( it^T\mu-\frac12 t^T\Sigma t \right), $$
其中:
$$ t\in\mathbb{R}^n. $$
矩母函数为:
$$ M_X(t) =\mathbb{E}[e^{t^TX}]
\exp\left( t^T\mu+\frac12 t^T\Sigma t \right). $$
这两个公式是高维正态分布许多性质的基础。
例如,如果:
$$ Y=AX+b, $$
则:
$$ Y\sim N(A\mu+b,A\Sigma A^T). $$
这个结论可以直接由特征函数推出。
13. 二次型与卡方分布
若:
$$ X\sim N_n(\mu,\Sigma), $$
且 $\Sigma$ 正定,则:
$$ (X-\mu)^T\Sigma^{-1}(X-\mu) \sim \chi_n^2. $$
也就是说,马氏距离平方服从自由度为 $n$ 的卡方分布。
原因是:
$$ Z=\Sigma^{-1/2}(X-\mu)\sim N_n(0,I), $$
于是:
$$ (X-\mu)^T\Sigma^{-1}(X-\mu) =Z^TZ =\sum_{i=1}^n Z_i^2. $$
而 $n$ 个独立标准正态变量平方和服从:
$$ \chi_n^2. $$
这个性质常用于:
- 异常检测。
- 置信椭球。
- 多元统计推断。
- 高维数据的距离度量。
14. 退化多维正态分布
前面给出的密度函数要求 $\Sigma$ 正定。
如果 $\Sigma$ 只是半正定而不是正定,则称为退化多维正态分布。
此时存在非零向量 $a$,使得:
$$ a^T\Sigma a=0. $$
这意味着:
$$ \operatorname{Var}(a^TX)=0. $$
所以 $a^TX$ 是常数,随机向量 $X$ 被限制在某个低维仿射子空间中。
例如二维情形中,如果:
$$ \rho=1 $$
或:
$$ \rho=-1, $$
则 $X_1$ 与 $X_2$ 完全线性相关,联合分布集中在一条直线上,不存在普通二维密度。
退化正态仍然可以用线性变换定义:
若:
$$ Z\sim N_k(0,I), $$
$$ X=\mu+AZ, $$
其中 $A\in\mathbb{R}^{n\times k}$,则:
$$ X\sim N_n(\mu,AA^T). $$
如果 $AA^T$ 不满秩,则这是退化正态分布。
15. 精度矩阵与条件独立
多维正态分布中:
$$ \Omega=\Sigma^{-1} $$
称为精度矩阵。
精度矩阵不仅仅是协方差矩阵的逆,它还包含条件独立信息。
如果:
$$ X\sim N_n(\mu,\Sigma), $$
且:
$$ \Omega=\Sigma^{-1}. $$
则对于 $i\ne j$:
$$ \Omega_{ij}=0 $$
意味着:
$$ X_i\ \text{与}\ X_j\ \text{在给定其他变量后条件独立}. $$
即:
$$ X_i\perp X_j\mid X_{{1,\dots,n}\setminus{i,j}}. $$
这在高斯图模型中非常重要。
协方差矩阵描述的是边缘相关关系;精度矩阵描述的是条件相关关系。
16. 一维、二维、n 维公式对照
16.1 一维
$$ X\sim N(\mu,\sigma^2). $$
密度:
$$ f(x)
\frac{1}{\sqrt{2\pi\sigma^2}} \exp\left( -\frac{(x-\mu)^2}{2\sigma^2} \right). $$
参数:
$$ \mu\in\mathbb{R},\quad \sigma^2>0. $$
16.2 二维
$$ X= \begin{pmatrix} X_1\ X_2 \end{pmatrix} \sim N_2(\mu,\Sigma). $$
其中:
$$ \mu= \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, $$
$$ \Sigma= \begin{pmatrix} \sigma_1^2 & \rho\sigma_1\sigma_2\ \rho\sigma_1\sigma_2 & \sigma_2^2 \end{pmatrix}. $$
密度:
$$ f(x)
\frac{1}{2\pi\det(\Sigma)^{1/2}} \exp\left[ -\frac12(x-\mu)^T\Sigma^{-1}(x-\mu) \right]. $$
16.3 n 维
$$ X\sim N_n(\mu,\Sigma). $$
其中:
$$ \mu\in\mathbb{R}^n, $$
$$ \Sigma\in\mathbb{R}^{n\times n} $$
是对称正定矩阵。
密度:
$$ f(x)
\frac{1}{(2\pi)^{n/2}\det(\Sigma)^{1/2}} \exp\left[ -\frac12(x-\mu)^T\Sigma^{-1}(x-\mu) \right]. $$
17. 从一维到 n 维的推广逻辑
一维正态分布:
$$ \frac{(x-\mu)^2}{\sigma^2} $$
衡量点 $x$ 偏离均值的标准化平方距离。
二维正态分布中,变量变成向量:
$$ x-\mu= \begin{pmatrix} x_1-\mu_1\ x_2-\mu_2 \end{pmatrix}. $$
方差变成协方差矩阵:
$$ \Sigma= \begin{pmatrix} \sigma_1^2 & \operatorname{Cov}(X_1,X_2)\ \operatorname{Cov}(X_2,X_1) & \sigma_2^2 \end{pmatrix}. $$
标准化平方距离变成:
$$ (x-\mu)^T\Sigma^{-1}(x-\mu). $$
n 维时完全类似:
- 标量 $x$ 推广为向量 $x\in\mathbb{R}^n$。
- 均值 $\mu$ 推广为均值向量 $\mu\in\mathbb{R}^n$。
- 方差 $\sigma^2$ 推广为协方差矩阵 $\Sigma$。
- 标准化平方距离推广为马氏距离平方。
- 钟形曲线推广为高维钟形密度。
- 一维的区间概率推广为高维区域概率。
- 一维等密度点推广为高维椭球面。
18. 常见误区
18.1 每个分量正态不代表联合正态
若每个 $X_i$ 都是一维正态,不一定说明:
$$ X=(X_1,\dots,X_n)^T $$
是联合正态。
联合正态要求任意线性组合:
$$ a^TX $$
都是一维正态。
18.2 不相关一般不等于独立
对一般随机变量:
$$ \operatorname{Cov}(X,Y)=0 $$
不代表 $X,Y$ 独立。
但如果它们联合正态,则不相关等价于独立。
18.3 协方差矩阵不能随便取
协方差矩阵必须满足:
$$ \Sigma^T=\Sigma, $$
$$ \Sigma\succeq 0. $$
如果要有普通密度函数,还需要:
$$ \Sigma\succ 0. $$
18.4 相关系数不能超出范围
二维正态中:
$$ -1\le \rho\le 1. $$
若要求非退化密度,则:
$$ -1<\rho<1. $$
18.5 高维正态不是简单的多个一维正态相乘
只有当协方差矩阵是对角矩阵时:
$$ \Sigma=\operatorname{diag}(\sigma_1^2,\dots,\sigma_n^2), $$
各分量才相互独立,此时联合密度可以分解为一维密度的乘积。
如果协方差矩阵存在非零非对角项,则联合密度不能简单分解。
19. 总结
一维正态分布:
$$ X\sim N(\mu,\sigma^2) $$
由均值 $\mu$ 和方差 $\sigma^2$ 描述。
二维正态分布:
$$ X\sim N_2(\mu,\Sigma) $$
由均值向量和 $2\times 2$ 协方差矩阵描述,其中协方差项或相关系数刻画两个变量之间的线性关系。
n 维正态分布:
$$ X\sim N_n(\mu,\Sigma) $$
由均值向量:
$$ \mu\in\mathbb{R}^n $$
和协方差矩阵:
$$ \Sigma\in\mathbb{R}^{n\times n} $$
描述。
其密度函数为:
$$ f_X(x)
\frac{1}{(2\pi)^{n/2}\det(\Sigma)^{1/2}} \exp\left[ -\frac12(x-\mu)^T\Sigma^{-1}(x-\mu) \right]. $$
高维正态分布最重要的性质包括:
- 任意线性组合仍然是正态分布。
- 任意子向量的边缘分布仍然是正态分布。
- 条件分布仍然是正态分布。
- 联合正态下,不相关等价于独立。
- 等密度面是由协方差矩阵决定的椭球面。
- 马氏距离平方服从卡方分布。
- 可以通过标准正态和矩阵分解生成高维正态样本。
从一维到高维的本质推广是:
$$ \frac{(x-\mu)^2}{\sigma^2} \quad\longrightarrow\quad (x-\mu)^T\Sigma^{-1}(x-\mu). $$
这就是高维正态分布的核心结构。