1. 正态分布的核心思想

正态分布也称高斯分布,是概率论、统计学、机器学习和优化理论中最重要的连续型分布之一。

它的核心特征是:

  • 分布由均值和方差控制。
  • 曲线关于均值对称。
  • 越靠近均值,概率密度越大。
  • 越远离均值,概率密度按指数速度衰减。
  • 多个独立随机因素叠加时,经常近似服从正态分布。

从一维推广到高维后,正态分布不再只由一个均值和一个方差描述,而是由:

  • 均值向量 $\mu$
  • 协方差矩阵 $\Sigma$

共同描述。

一维正态分布描述数轴上的随机变量;二维正态分布描述平面上的随机向量;$n$ 维正态分布描述 $n$ 维空间中的随机向量。


2. 一维正态分布

2.1 定义

若随机变量 $X$ 的概率密度函数为:

$$ f_X(x) =\frac{1}{\sqrt{2\pi\sigma^2}} \exp\left( -\frac{(x-\mu)^2}{2\sigma^2} \right), $$

其中:

$$ \mu\in\mathbb{R},\quad \sigma^2>0, $$

则称 $X$ 服从均值为 $\mu$、方差为 $\sigma^2$ 的一维正态分布,记作:

$$ X\sim N(\mu,\sigma^2). $$

其中:

  • $\mu$ 是均值,决定分布中心。
  • $\sigma^2$ 是方差,决定分布离散程度。
  • $\sigma$ 是标准差,决定钟形曲线的宽窄。

2.2 标准正态分布

当:

$$ \mu=0,\quad \sigma^2=1 $$

时,称为标准正态分布:

$$ Z\sim N(0,1). $$

其概率密度函数为:

$$ \phi(z) =\frac{1}{\sqrt{2\pi}} \exp\left(-\frac{z^2}{2}\right). $$

标准正态分布是所有一维正态分布的基础。

若:

$$ X\sim N(\mu,\sigma^2), $$

则标准化变量:

$$ Z=\frac{X-\mu}{\sigma} $$

满足:

$$ Z\sim N(0,1). $$

反过来,如果:

$$ Z\sim N(0,1), $$

则:

$$ X=\mu+\sigma Z $$

满足:

$$ X\sim N(\mu,\sigma^2). $$

2.3 一维正态分布的图像性质

一维正态分布的密度曲线是钟形曲线。

其主要性质包括:

  1. 关于 $x=\mu$ 对称。
  2. 在 $x=\mu$ 处取得最大值。
  3. 当 $|x-\mu|$ 越大时,密度越小。
  4. $\sigma$ 越大,曲线越宽、越矮。
  5. $\sigma$ 越小,曲线越窄、越高。
  6. 曲线下面积为 $1$。

由于概率密度必须积分为 $1$,所以:

$$ \int_{-\infty}^{\infty} \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left( -\frac{(x-\mu)^2}{2\sigma^2} \right),dx =1. $$

2.4 均值与方差

若:

$$ X\sim N(\mu,\sigma^2), $$

则:

$$ \mathbb{E}[X]=\mu, $$

$$ \operatorname{Var}(X)=\sigma^2. $$

其中:

$$ \mathbb{E}[X] =\int_{-\infty}^{\infty}x f_X(x),dx, $$

$$ \operatorname{Var}(X) =\mathbb{E}[(X-\mu)^2]. $$

2.5 分布函数

一维正态分布的分布函数为:

$$ F_X(x)=P(X\le x). $$

如果:

$$ X\sim N(\mu,\sigma^2), $$

则:

$$ F_X(x) =\Phi\left(\frac{x-\mu}{\sigma}\right), $$

其中 $\Phi$ 是标准正态分布函数:

$$ \Phi(z)=\int_{-\infty}^z \frac{1}{\sqrt{2\pi}} \exp\left(-\frac{t^2}{2}\right),dt. $$

标准正态分布函数一般没有初等函数形式,实际计算时通常查表或用数值方法。

2.6 线性变换性质

若:

$$ X\sim N(\mu,\sigma^2), $$

且:

$$ Y=aX+b, $$

其中 $a,b$ 是常数,则:

$$ Y\sim N(a\mu+b,a^2\sigma^2). $$

这说明正态分布在线性变换下仍然是正态分布。

特别地:

$$ \frac{X-\mu}{\sigma}\sim N(0,1). $$

2.7 矩母函数与特征函数

若:

$$ X\sim N(\mu,\sigma^2), $$

则矩母函数为:

$$ M_X(t)=\mathbb{E}[e^{tX}] =\exp\left(\mu t+\frac12\sigma^2t^2\right). $$

特征函数为:

$$ \varphi_X(t)=\mathbb{E}[e^{itX}] =\exp\left(i\mu t-\frac12\sigma^2t^2\right). $$

矩母函数和特征函数可以用来证明正态分布在线性组合下的封闭性。

2.8 独立正态变量之和

若:

$$ X_1\sim N(\mu_1,\sigma_1^2), $$

$$ X_2\sim N(\mu_2,\sigma_2^2), $$

且 $X_1,X_2$ 独立,则:

$$ X_1+X_2 \sim N(\mu_1+\mu_2,\sigma_1^2+\sigma_2^2). $$

更一般地,若 $X_1,\dots,X_n$ 相互独立,且:

$$ X_i\sim N(\mu_i,\sigma_i^2), $$

则:

$$ \sum_{i=1}^n a_iX_i \sim N\left( \sum_{i=1}^n a_i\mu_i, \sum_{i=1}^n a_i^2\sigma_i^2 \right). $$


3. 二维正态分布

3.1 从随机变量到随机向量

一维正态分布研究一个随机变量:

$$ X. $$

二维正态分布研究一个随机向量:

$$ X= \begin{pmatrix} X_1\ X_2 \end{pmatrix}. $$

其中 $X_1$ 和 $X_2$ 都是随机变量。

二维正态分布不仅要描述每个变量自己的均值和方差,还要描述二者之间的相关关系。

因此需要:

均值向量:

$$ \mu= \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, $$

协方差矩阵:

$$ \Sigma= \begin{pmatrix} \sigma_1^2 & \rho\sigma_1\sigma_2\ \rho\sigma_1\sigma_2 & \sigma_2^2 \end{pmatrix}. $$

其中:

  • $\mu_1=\mathbb{E}[X_1]$。
  • $\mu_2=\mathbb{E}[X_2]$。
  • $\sigma_1^2=\operatorname{Var}(X_1)$。
  • $\sigma_2^2=\operatorname{Var}(X_2)$。
  • $\rho=\operatorname{Corr}(X_1,X_2)$ 是相关系数。
  • $\rho\sigma_1\sigma_2=\operatorname{Cov}(X_1,X_2)$ 是协方差。

3.2 二维正态分布的密度函数

若随机向量:

$$ X= \begin{pmatrix} X_1\ X_2 \end{pmatrix} $$

服从二维正态分布,记作:

$$ X\sim N_2(\mu,\Sigma). $$

当 $\Sigma$ 正定时,其联合密度为:

$$ f(x_1,x_2)

\frac{1}{2\pi\sigma_1\sigma_2\sqrt{1-\rho^2}} \exp\left[ -\frac{1}{2(1-\rho^2)} \left( \frac{(x_1-\mu_1)^2}{\sigma_1^2} -2\rho\frac{(x_1-\mu_1)(x_2-\mu_2)}{\sigma_1\sigma_2} +\frac{(x_2-\mu_2)^2}{\sigma_2^2} \right) \right]. $$

这里要求:

$$ \sigma_1>0,\quad \sigma_2>0,\quad -1<\rho<1. $$

如果 $|\rho|=1$,则协方差矩阵退化,分布集中在一条直线上,不再有普通二维密度函数。

3.3 矩阵形式

二维密度也可以写成更简洁的矩阵形式:

$$ f(x)

\frac{1}{(2\pi)^{1}\det(\Sigma)^{1/2}} \exp\left[ -\frac12(x-\mu)^T\Sigma^{-1}(x-\mu) \right], $$

其中:

$$ x= \begin{pmatrix} x_1\ x_2 \end{pmatrix}. $$

因为二维时 $n=2$,所以一般公式中的 $(2\pi)^{n/2}$ 变为:

$$ (2\pi)^{2/2}=2\pi. $$

二维协方差矩阵的行列式为:

$$ \det(\Sigma) =\sigma_1^2\sigma_2^2(1-\rho^2). $$

因此:

$$ \det(\Sigma)^{1/2} =\sigma_1\sigma_2\sqrt{1-\rho^2}. $$

这正好对应前面密度函数的归一化系数。

3.4 相关系数的作用

相关系数:

$$ \rho\in(-1,1) $$

控制 $X_1$ 与 $X_2$ 的线性相关程度。

若:

$$ \rho=0, $$

则协方差矩阵为对角矩阵:

$$ \Sigma= \begin{pmatrix} \sigma_1^2 & 0\ 0 & \sigma_2^2 \end{pmatrix}. $$

此时密度函数可以分解为:

$$ f(x_1,x_2)=f_1(x_1)f_2(x_2). $$

所以在二维正态分布中:

$$ \rho=0 \quad\Longleftrightarrow\quad X_1,X_2\ \text{独立}. $$

注意:对一般随机变量来说,不相关不一定独立。但对联合正态分布来说,不相关等价于独立。

3.5 边缘分布

若:

$$ \begin{pmatrix} X_1\ X_2 \end{pmatrix} \sim N_2 \left( \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, \begin{pmatrix} \sigma_1^2 & \rho\sigma_1\sigma_2\ \rho\sigma_1\sigma_2 & \sigma_2^2 \end{pmatrix} \right), $$

则边缘分布为:

$$ X_1\sim N(\mu_1,\sigma_1^2), $$

$$ X_2\sim N(\mu_2,\sigma_2^2). $$

也就是说,二维正态分布的每个分量都是一维正态分布。

但反过来不一定成立:

如果 $X_1$ 和 $X_2$ 分别是一维正态分布,并不能自动推出 $(X_1,X_2)^T$ 是二维联合正态分布。

3.6 条件分布

二维正态分布的一个重要性质是:条件分布仍然是正态分布。

若:

$$ \begin{pmatrix} X_1\ X_2 \end{pmatrix} \sim N_2 \left( \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, \begin{pmatrix} \sigma_1^2 & \rho\sigma_1\sigma_2\ \rho\sigma_1\sigma_2 & \sigma_2^2 \end{pmatrix} \right), $$

则在给定 $X_2=x_2$ 的条件下:

$$ X_1\mid X_2=x_2 \sim N\left( \mu_1+\rho\frac{\sigma_1}{\sigma_2}(x_2-\mu_2), \sigma_1^2(1-\rho^2) \right). $$

类似地:

$$ X_2\mid X_1=x_1 \sim N\left( \mu_2+\rho\frac{\sigma_2}{\sigma_1}(x_1-\mu_1), \sigma_2^2(1-\rho^2) \right). $$

这个公式说明:

  • 条件均值是被给定变量的线性函数。
  • 条件方差不依赖具体观测值 $x_2$ 或 $x_1$。
  • 当 $|\rho|$ 越大时,条件方差越小。
  • 当 $\rho=0$ 时,条件分布退化为边缘分布,说明二者独立。

3.7 二维正态分布的几何形状

二维正态分布的密度函数在三维图像中像一个山丘。

它的等密度曲线满足:

$$ (x-\mu)^T\Sigma^{-1}(x-\mu)=c, $$

其中 $c>0$ 是常数。

这是平面中的椭圆。

因此二维正态分布的等密度线是椭圆:

  • 椭圆中心是均值向量 $\mu$。
  • 椭圆方向由协方差矩阵的特征向量决定。
  • 椭圆轴长由协方差矩阵的特征值决定。
  • 相关系数 $\rho$ 决定椭圆是否倾斜。

当:

$$ \Sigma= \sigma^2 I $$

时,等密度曲线是圆。

当协方差矩阵不是单位矩阵的倍数时,等密度曲线一般是椭圆。


4. 从二维推广到 n 维

4.1 n 维随机向量

$n$ 维随机向量写作:

$$ X= \begin{pmatrix} X_1\ X_2\ \vdots\ X_n \end{pmatrix} \in\mathbb{R}^n. $$

其均值向量为:

$$ \mu=\mathbb{E}[X]

\begin{pmatrix} \mathbb{E}[X_1]\ \mathbb{E}[X_2]\ \vdots\ \mathbb{E}[X_n] \end{pmatrix}. $$

协方差矩阵为:

$$ \Sigma =\operatorname{Cov}(X) =\mathbb{E}[(X-\mu)(X-\mu)^T]. $$

展开为:

$$ \Sigma= \begin{pmatrix} \operatorname{Var}(X_1) & \operatorname{Cov}(X_1,X_2) & \cdots & \operatorname{Cov}(X_1,X_n)\ \operatorname{Cov}(X_2,X_1) & \operatorname{Var}(X_2) & \cdots & \operatorname{Cov}(X_2,X_n)\ \vdots & \vdots & \ddots & \vdots\ \operatorname{Cov}(X_n,X_1) & \operatorname{Cov}(X_n,X_2) & \cdots & \operatorname{Var}(X_n) \end{pmatrix}. $$

协方差矩阵有两个基本性质:

  1. 对称性:

$$ \Sigma^T=\Sigma. $$

  1. 半正定性:

$$ a^T\Sigma a\ge 0,\quad \forall a\in\mathbb{R}^n. $$

因为:

$$ a^T\Sigma a =\operatorname{Var}(a^TX)\ge 0. $$

如果 $\Sigma$ 正定,即:

$$ a^T\Sigma a>0,\quad \forall a\ne 0, $$

则分布在整个 $\mathbb{R}^n$ 中有非退化密度。

4.2 n 维正态分布的定义

若随机向量 $X\in\mathbb{R}^n$ 的密度函数为:

$$ f_X(x)

\frac{1}{(2\pi)^{n/2}\det(\Sigma)^{1/2}} \exp\left[ -\frac12(x-\mu)^T\Sigma^{-1}(x-\mu) \right], $$

其中:

$$ \mu\in\mathbb{R}^n, $$

$$ \Sigma\in\mathbb{R}^{n\times n}, $$

且 $\Sigma$ 是对称正定矩阵,则称:

$$ X\sim N_n(\mu,\Sigma). $$

有时也写作:

$$ X\sim \mathcal{N}(\mu,\Sigma). $$

其中:

  • $\mu$ 控制分布中心。
  • $\Sigma$ 控制各方向上的尺度、相关性和形状。
  • $\Sigma^{-1}$ 称为精度矩阵或信息矩阵。
  • $(x-\mu)^T\Sigma^{-1}(x-\mu)$ 称为马氏距离平方。

4.3 为什么指数项是二次型

一维正态分布的指数项是:

$$ \frac{(x-\mu)^2}{\sigma^2}. $$

这可以写成:

$$ (x-\mu)\frac{1}{\sigma^2}(x-\mu). $$

高维情形中,方差 $\sigma^2$ 被协方差矩阵 $\Sigma$ 替代,因此:

$$ \frac{1}{\sigma^2} $$

被:

$$ \Sigma^{-1} $$

替代。

于是得到高维二次型:

$$ (x-\mu)^T\Sigma^{-1}(x-\mu). $$

这个量衡量 $x$ 到均值 $\mu$ 的距离,但不是普通欧氏距离,而是考虑了各方向方差和相关性的马氏距离。

4.4 归一化常数的来源

n 维正态分布的归一化常数为:

$$ \frac{1}{(2\pi)^{n/2}\det(\Sigma)^{1/2}}. $$

它保证:

$$ \int_{\mathbb{R}^n} f_X(x),dx=1. $$

当 $\Sigma=I$ 时,标准 n 维正态分布密度为:

$$ f_X(x)

\frac{1}{(2\pi)^{n/2}} \exp\left(-\frac12 x^Tx\right). $$

由于:

$$ x^Tx=x_1^2+\cdots+x_n^2, $$

所以:

$$ f_X(x)

\prod_{i=1}^n \frac{1}{\sqrt{2\pi}} \exp\left(-\frac{x_i^2}{2}\right). $$

这说明标准 n 维正态分布等价于 $n$ 个相互独立的标准正态变量组成的向量。


5. 多维正态分布的等价定义

高维正态分布有一个非常重要的等价定义。

随机向量 $X\in\mathbb{R}^n$ 服从多维正态分布,当且仅当对任意向量:

$$ a\in\mathbb{R}^n, $$

线性组合:

$$ a^TX $$

都是一维正态分布。

也就是说:

$$ X\sim N_n(\mu,\Sigma) $$

等价于:

$$ a^TX\sim N(a^T\mu,a^T\Sigma a), \quad \forall a\in\mathbb{R}^n. $$

这个定义非常重要,因为它直接说明:

  • 多维正态分布在任意方向上的投影都是一维正态分布。
  • 多维正态分布在线性变换下仍然是多维正态分布。
  • 多维正态分布的所有低维边缘分布仍然是正态分布。

6. 线性变换性质

若:

$$ X\sim N_n(\mu,\Sigma), $$

令:

$$ Y=AX+b, $$

其中:

$$ A\in\mathbb{R}^{m\times n},\quad b\in\mathbb{R}^m, $$

则:

$$ Y\sim N_m(A\mu+b,A\Sigma A^T). $$

这是多维正态分布最重要的性质之一。

特殊情形:

若 $a\in\mathbb{R}^n$,则:

$$ Y=a^TX $$

是一维正态分布:

$$ a^TX\sim N(a^T\mu,a^T\Sigma a). $$


7. 边缘分布

将 $X$ 分块:

$$ X= \begin{pmatrix} X_1\ X_2 \end{pmatrix}, $$

其中:

$$ X_1\in\mathbb{R}^{k}, \quad X_2\in\mathbb{R}^{n-k}. $$

均值和协方差也相应分块:

$$ \mu= \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, $$

$$ \Sigma= \begin{pmatrix} \Sigma_{11} & \Sigma_{12}\ \Sigma_{21} & \Sigma_{22} \end{pmatrix}. $$

若:

$$ X\sim N_n(\mu,\Sigma), $$

则边缘分布为:

$$ X_1\sim N_k(\mu_1,\Sigma_{11}), $$

$$ X_2\sim N_{n-k}(\mu_2,\Sigma_{22}). $$

也就是说,多维正态分布的任意子向量仍然服从多维正态分布。


8. 条件分布

多维正态分布的条件分布仍然是正态分布。

设:

$$ \begin{pmatrix} X_1\ X_2 \end{pmatrix} \sim N \left( \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, \begin{pmatrix} \Sigma_{11} & \Sigma_{12}\ \Sigma_{21} & \Sigma_{22} \end{pmatrix} \right), $$

其中 $\Sigma_{22}$ 可逆。

则:

$$ X_1\mid X_2=x_2 \sim N \left( \mu_{1|2}, \Sigma_{1|2} \right), $$

其中条件均值为:

$$ \mu_{1|2}

\mu_1+\Sigma_{12}\Sigma_{22}^{-1}(x_2-\mu_2), $$

条件协方差为:

$$ \Sigma_{1|2}

\Sigma_{11}-\Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21}. $$

这可以看作二维条件分布公式的矩阵推广。

8.1 条件均值的含义

条件均值:

$$ \mu_1+\Sigma_{12}\Sigma_{22}^{-1}(x_2-\mu_2) $$

是 $x_2$ 的线性函数。

这意味着在联合正态模型中,用 $X_2$ 预测 $X_1$ 的最优均方预测器是线性的。

8.2 条件协方差的含义

条件协方差:

$$ \Sigma_{11}-\Sigma_{12}\Sigma_{22}^{-1}\Sigma_{21} $$

不依赖具体观测值 $x_2$。

它表示观察到 $X_2$ 之后,$X_1$ 剩余的不确定性。

如果 $X_1$ 与 $X_2$ 的相关性越强,则条件协方差通常越小。


9. 独立性与不相关性

对于一般随机变量:

$$ \operatorname{Cov}(X,Y)=0 $$

只表示不相关,不一定表示独立。

但对于联合正态分布,情况更强。

若:

$$ \begin{pmatrix} X_1\ X_2 \end{pmatrix} \sim N \left( \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, \begin{pmatrix} \Sigma_{11} & \Sigma_{12}\ \Sigma_{21} & \Sigma_{22} \end{pmatrix} \right), $$

则:

$$ X_1\ \text{与}\ X_2\ \text{独立} \quad\Longleftrightarrow\quad \Sigma_{12}=0. $$

也就是说,在联合正态分布中,零协方差等价于独立。

这是正态分布区别于一般分布的重要特征。


10. 马氏距离与几何解释

n 维正态分布的密度函数中有:

$$ (x-\mu)^T\Sigma^{-1}(x-\mu). $$

定义马氏距离为:

$$ d_M(x,\mu)

\sqrt{(x-\mu)^T\Sigma^{-1}(x-\mu)}. $$

它衡量点 $x$ 到均值 $\mu$ 的距离,同时考虑:

  • 不同方向上的方差大小。
  • 不同变量之间的相关性。
  • 数据云的椭球形状。

多维正态分布的等密度面满足:

$$ (x-\mu)^T\Sigma^{-1}(x-\mu)=c. $$

这是 $n$ 维空间中的椭球面。

二维时是椭圆;三维时是椭球;更高维时是超椭球。

10.1 协方差矩阵的特征分解

若 $\Sigma$ 对称正定,则可以特征分解:

$$ \Sigma=Q\Lambda Q^T, $$

其中:

  • $Q$ 是正交矩阵,列向量是特征向量。
  • $\Lambda=\operatorname{diag}(\lambda_1,\dots,\lambda_n)$。
  • $\lambda_i>0$ 是特征值。

于是:

$$ \Sigma^{-1}=Q\Lambda^{-1}Q^T. $$

令:

$$ y=Q^T(x-\mu), $$

则:

$$ (x-\mu)^T\Sigma^{-1}(x-\mu)

\sum_{i=1}^n \frac{y_i^2}{\lambda_i}. $$

因此:

  • 特征向量给出椭球主轴方向。
  • 特征值给出各主轴方向上的方差。
  • 特征值越大,该方向上分布越分散。

11. 白化变换

若:

$$ X\sim N_n(\mu,\Sigma), $$

且 $\Sigma$ 正定。

设:

$$ Z=\Sigma^{-1/2}(X-\mu). $$

则:

$$ Z\sim N_n(0,I). $$

这个过程称为白化。

它将一个一般多维正态分布变换为标准多维正态分布。

反过来,如果:

$$ Z\sim N_n(0,I), $$

令:

$$ X=\mu+\Sigma^{1/2}Z, $$

则:

$$ X\sim N_n(\mu,\Sigma). $$

这也是生成多维正态随机样本的基本方法。

实际计算中常用 Cholesky 分解:

$$ \Sigma=LL^T. $$

若:

$$ Z\sim N_n(0,I), $$

则:

$$ X=\mu+LZ $$

满足:

$$ X\sim N_n(\mu,\Sigma). $$


12. 特征函数与矩母函数

若:

$$ X\sim N_n(\mu,\Sigma), $$

则特征函数为:

$$ \varphi_X(t) =\mathbb{E}[e^{it^TX}]

\exp\left( it^T\mu-\frac12 t^T\Sigma t \right), $$

其中:

$$ t\in\mathbb{R}^n. $$

矩母函数为:

$$ M_X(t) =\mathbb{E}[e^{t^TX}]

\exp\left( t^T\mu+\frac12 t^T\Sigma t \right). $$

这两个公式是高维正态分布许多性质的基础。

例如,如果:

$$ Y=AX+b, $$

则:

$$ Y\sim N(A\mu+b,A\Sigma A^T). $$

这个结论可以直接由特征函数推出。


13. 二次型与卡方分布

若:

$$ X\sim N_n(\mu,\Sigma), $$

且 $\Sigma$ 正定,则:

$$ (X-\mu)^T\Sigma^{-1}(X-\mu) \sim \chi_n^2. $$

也就是说,马氏距离平方服从自由度为 $n$ 的卡方分布。

原因是:

$$ Z=\Sigma^{-1/2}(X-\mu)\sim N_n(0,I), $$

于是:

$$ (X-\mu)^T\Sigma^{-1}(X-\mu) =Z^TZ =\sum_{i=1}^n Z_i^2. $$

而 $n$ 个独立标准正态变量平方和服从:

$$ \chi_n^2. $$

这个性质常用于:

  • 异常检测。
  • 置信椭球。
  • 多元统计推断。
  • 高维数据的距离度量。

14. 退化多维正态分布

前面给出的密度函数要求 $\Sigma$ 正定。

如果 $\Sigma$ 只是半正定而不是正定,则称为退化多维正态分布。

此时存在非零向量 $a$,使得:

$$ a^T\Sigma a=0. $$

这意味着:

$$ \operatorname{Var}(a^TX)=0. $$

所以 $a^TX$ 是常数,随机向量 $X$ 被限制在某个低维仿射子空间中。

例如二维情形中,如果:

$$ \rho=1 $$

或:

$$ \rho=-1, $$

则 $X_1$ 与 $X_2$ 完全线性相关,联合分布集中在一条直线上,不存在普通二维密度。

退化正态仍然可以用线性变换定义:

若:

$$ Z\sim N_k(0,I), $$

$$ X=\mu+AZ, $$

其中 $A\in\mathbb{R}^{n\times k}$,则:

$$ X\sim N_n(\mu,AA^T). $$

如果 $AA^T$ 不满秩,则这是退化正态分布。


15. 精度矩阵与条件独立

多维正态分布中:

$$ \Omega=\Sigma^{-1} $$

称为精度矩阵。

精度矩阵不仅仅是协方差矩阵的逆,它还包含条件独立信息。

如果:

$$ X\sim N_n(\mu,\Sigma), $$

且:

$$ \Omega=\Sigma^{-1}. $$

则对于 $i\ne j$:

$$ \Omega_{ij}=0 $$

意味着:

$$ X_i\ \text{与}\ X_j\ \text{在给定其他变量后条件独立}. $$

即:

$$ X_i\perp X_j\mid X_{{1,\dots,n}\setminus{i,j}}. $$

这在高斯图模型中非常重要。

协方差矩阵描述的是边缘相关关系;精度矩阵描述的是条件相关关系。


16. 一维、二维、n 维公式对照

16.1 一维

$$ X\sim N(\mu,\sigma^2). $$

密度:

$$ f(x)

\frac{1}{\sqrt{2\pi\sigma^2}} \exp\left( -\frac{(x-\mu)^2}{2\sigma^2} \right). $$

参数:

$$ \mu\in\mathbb{R},\quad \sigma^2>0. $$

16.2 二维

$$ X= \begin{pmatrix} X_1\ X_2 \end{pmatrix} \sim N_2(\mu,\Sigma). $$

其中:

$$ \mu= \begin{pmatrix} \mu_1\ \mu_2 \end{pmatrix}, $$

$$ \Sigma= \begin{pmatrix} \sigma_1^2 & \rho\sigma_1\sigma_2\ \rho\sigma_1\sigma_2 & \sigma_2^2 \end{pmatrix}. $$

密度:

$$ f(x)

\frac{1}{2\pi\det(\Sigma)^{1/2}} \exp\left[ -\frac12(x-\mu)^T\Sigma^{-1}(x-\mu) \right]. $$

16.3 n 维

$$ X\sim N_n(\mu,\Sigma). $$

其中:

$$ \mu\in\mathbb{R}^n, $$

$$ \Sigma\in\mathbb{R}^{n\times n} $$

是对称正定矩阵。

密度:

$$ f(x)

\frac{1}{(2\pi)^{n/2}\det(\Sigma)^{1/2}} \exp\left[ -\frac12(x-\mu)^T\Sigma^{-1}(x-\mu) \right]. $$


17. 从一维到 n 维的推广逻辑

一维正态分布:

$$ \frac{(x-\mu)^2}{\sigma^2} $$

衡量点 $x$ 偏离均值的标准化平方距离。

二维正态分布中,变量变成向量:

$$ x-\mu= \begin{pmatrix} x_1-\mu_1\ x_2-\mu_2 \end{pmatrix}. $$

方差变成协方差矩阵:

$$ \Sigma= \begin{pmatrix} \sigma_1^2 & \operatorname{Cov}(X_1,X_2)\ \operatorname{Cov}(X_2,X_1) & \sigma_2^2 \end{pmatrix}. $$

标准化平方距离变成:

$$ (x-\mu)^T\Sigma^{-1}(x-\mu). $$

n 维时完全类似:

  • 标量 $x$ 推广为向量 $x\in\mathbb{R}^n$。
  • 均值 $\mu$ 推广为均值向量 $\mu\in\mathbb{R}^n$。
  • 方差 $\sigma^2$ 推广为协方差矩阵 $\Sigma$。
  • 标准化平方距离推广为马氏距离平方。
  • 钟形曲线推广为高维钟形密度。
  • 一维的区间概率推广为高维区域概率。
  • 一维等密度点推广为高维椭球面。

18. 常见误区

18.1 每个分量正态不代表联合正态

若每个 $X_i$ 都是一维正态,不一定说明:

$$ X=(X_1,\dots,X_n)^T $$

是联合正态。

联合正态要求任意线性组合:

$$ a^TX $$

都是一维正态。

18.2 不相关一般不等于独立

对一般随机变量:

$$ \operatorname{Cov}(X,Y)=0 $$

不代表 $X,Y$ 独立。

但如果它们联合正态,则不相关等价于独立。

18.3 协方差矩阵不能随便取

协方差矩阵必须满足:

$$ \Sigma^T=\Sigma, $$

$$ \Sigma\succeq 0. $$

如果要有普通密度函数,还需要:

$$ \Sigma\succ 0. $$

18.4 相关系数不能超出范围

二维正态中:

$$ -1\le \rho\le 1. $$

若要求非退化密度,则:

$$ -1<\rho<1. $$

18.5 高维正态不是简单的多个一维正态相乘

只有当协方差矩阵是对角矩阵时:

$$ \Sigma=\operatorname{diag}(\sigma_1^2,\dots,\sigma_n^2), $$

各分量才相互独立,此时联合密度可以分解为一维密度的乘积。

如果协方差矩阵存在非零非对角项,则联合密度不能简单分解。


19. 总结

一维正态分布:

$$ X\sim N(\mu,\sigma^2) $$

由均值 $\mu$ 和方差 $\sigma^2$ 描述。

二维正态分布:

$$ X\sim N_2(\mu,\Sigma) $$

由均值向量和 $2\times 2$ 协方差矩阵描述,其中协方差项或相关系数刻画两个变量之间的线性关系。

n 维正态分布:

$$ X\sim N_n(\mu,\Sigma) $$

由均值向量:

$$ \mu\in\mathbb{R}^n $$

和协方差矩阵:

$$ \Sigma\in\mathbb{R}^{n\times n} $$

描述。

其密度函数为:

$$ f_X(x)

\frac{1}{(2\pi)^{n/2}\det(\Sigma)^{1/2}} \exp\left[ -\frac12(x-\mu)^T\Sigma^{-1}(x-\mu) \right]. $$

高维正态分布最重要的性质包括:

  • 任意线性组合仍然是正态分布。
  • 任意子向量的边缘分布仍然是正态分布。
  • 条件分布仍然是正态分布。
  • 联合正态下,不相关等价于独立。
  • 等密度面是由协方差矩阵决定的椭球面。
  • 马氏距离平方服从卡方分布。
  • 可以通过标准正态和矩阵分解生成高维正态样本。

从一维到高维的本质推广是:

$$ \frac{(x-\mu)^2}{\sigma^2} \quad\longrightarrow\quad (x-\mu)^T\Sigma^{-1}(x-\mu). $$

这就是高维正态分布的核心结构。