说明:本卷根据 机器学习导论复习.md 和四份往年卷整理,重点参考本学院的 2024-2025 第二学期回忆版与 23fall 期末风格。它不是原题或泄题,而是按高频章节、题型比例和命题习惯生成的复习模拟卷。

一、预测依据

本学院近两份卷子的共同特点:

  • 前面有少量客观题,偏概念辨析、模型性质、常见方法对比。
  • 大题按章节组织,常见形式是“概念解释 + 公式 + 手算 + 伪代码/应用分析”。
  • 高频章节包括:绪论、模型评估、线性模型/LDA、决策树、SVM、GMM/EM、PCA、神经网络。
  • 后两份人工智能学院试卷更偏基础概念、判断填空和泛化应用,可作为补充,不作为主要风格来源。

本预测卷设定为:6 个选择题,6 个大题。由于去年回忆版中 PCA 和神经网络均独立出现,而本次只设 6 个大题,因此第六大题将 PCA 与神经网络的高频计算压缩到同一题中。


模拟试卷

一、选择题(每题 2 分,共 12 分)

  1. 下列关于归纳偏置的说法,最准确的是( )

    A. 归纳偏置只存在于深度学习模型中
    B. 归纳偏置是学习算法在假设空间中选择模型时的偏好
    C. 归纳偏置越强,模型泛化能力一定越好
    D. 归纳偏置等价于训练误差最小化

  2. 在常见距离度量中,对单个维度上的异常大偏差通常更敏感的是( )

    A. 曼哈顿距离
    B. 欧氏距离
    C. 余弦相似度
    D. 0-1 距离

  3. 关于 Bagging 和 Boosting,下列说法正确的是( )

    A. Bagging 串行训练基学习器,主要降低偏差
    B. Boosting 并行训练基学习器,主要降低方差
    C. Random Forest 是 Bagging 的典型代表
    D. AdaBoost 是 Bagging 的典型代表

  4. 对二分类任务,若 TP=30, FP=10, FN=20, TN=40,则查准率 Precision 为( )

    A. 0.50
    B. 0.60
    C. 0.75
    D. 0.80

  5. 对软间隔 SVM 中参数 $C$ 的理解,正确的是( )

    A. $C$ 越大,对违反间隔的样本惩罚越重
    B. $C$ 越大,模型越倾向于容忍训练错误
    C. $C$ 只影响核函数,不影响间隔
    D. $C$ 越小,模型一定越不会欠拟合

  6. 关于 PCA 和 LDA,下列说法正确的是( )

    A. PCA 是有监督降维方法,LDA 是无监督降维方法
    B. PCA 最大化类间距离,LDA 最大化总体方差
    C. PCA 不使用类别标签,LDA 使用类别标签
    D. PCA 的降维维度最多为类别数减一


二、大题(共 88 分)

1. 绪论:归纳偏置、奥卡姆剃刀与模型类型(12 分)

  1. 什么是归纳偏置?为什么机器学习必须依赖某种归纳偏置?(4 分)
  2. 解释奥卡姆剃刀原则,并说明它与过拟合/欠拟合的关系。(4 分)
  3. 区分生成式模型和判别式模型,各举两个例子。(4 分)

2. 线性模型与 LDA(14 分)

给定二分类样本:

类别 样本
$C_0$ $(0,0),(0,2),(1,1)$
$C_1$ $(3,2),(4,4),(5,3)$
  1. 简述 LDA 如何用于分类任务。(4 分)
  2. 写出 LDA 中类内散度矩阵 $S_w$、类间散度矩阵 $S_b$ 和目标函数 $J$。(4 分)
  3. 计算两类均值 $\mu_0,\mu_1$,并求二分类 LDA 投影方向 $\mathbf{w}$ 的一个比例形式。(6 分)

3. GMM 与 EM(14 分)

设一维高斯混合模型为:

$$ p(x)=0.4\mathcal{N}(0,1)+0.6\mathcal{N}(3,1) $$

给定样本 $x=1$。

  1. 计算两个高斯成分在 $x=1$ 处的概率密度。(4 分)
  2. 计算该样本属于第一个高斯成分的后验概率。(4 分)
  3. 说明 GMM 为什么是软聚类模型。(3 分)
  4. 简述 EM 算法在 GMM 参数估计中的 E 步和 M 步。(3 分)

4. 决策树(16 分)

给定如下训练集:

编号 $X$ $Y$ $Z$ 类别
1 0 0 0 +
2 0 1 0 +
3 1 0 0 +
4 1 1 0 +
5 0 0 1 -
6 0 1 1 -
7 1 0 1 -
8 1 1 1 -
  1. 写出信息熵 $Ent(D)$ 的公式,并计算该数据集的信息熵。(4 分)
  2. 分别计算按属性 $X,Y,Z$ 划分的信息增益。(6 分)
  3. 根据 ID3 算法选择根结点属性,并画出文字形式的决策树。(3 分)
  4. 写出 ID3、C4.5、CART 分别使用的划分指标,并说明各自特点。(3 分)

5. 支持向量机 SVM(16 分)

  1. 从最大间隔思想出发,写出线性可分硬间隔 SVM 的原始优化问题。(4 分)
  2. 写出软间隔 SVM 的原始优化问题,并解释松弛变量 $\xi_i$ 和参数 $C$ 的含义。(4 分)
  3. 写出软间隔 SVM 的对偶问题形式。(4 分)
  4. 说明核函数为什么可以处理非线性分类,并比较多项式核与 RBF 核的直观差异。(4 分)

6. PCA 与神经网络高频计算(16 分)

  1. 已知协方差矩阵的特征值为 $\lambda_1=8,\lambda_2=3,\lambda_3=1$。计算各主成分贡献率和累计贡献率;若要求累计贡献率不低于 90%,至少保留几维?(5 分)

  2. 输入图像大小为 $3\times64\times64$,使用 16 个 $5\times5$ 卷积核,padding 为 2,stride 为 2。求卷积层输出形状和该层参数量(含偏置)。(4 分)

  3. 给定输入矩阵

    $$ A=\begin{pmatrix} 1&0&2&1\ 3&1&0&2\ 2&1&1&0\ 0&2&3&1 \end{pmatrix} $$

    卷积核

    $$ K=\begin{pmatrix} 1&0\ 2&1 \end{pmatrix} $$

    不使用 padding,卷积步长为 1,采用机器学习课程中常见的互相关形式计算卷积输出;再进行 $2\times2$ 最大池化,池化步长为 1。求最终输出。(5 分)

  4. 简述 Batch Normalization 与 Layer Normalization 的归一化范围差异。(2 分)

神经网络 BP 推导加强题(重点加练)

考虑一个只有 1 个隐藏神经元和 1 个输出神经元的前馈神经网络。输入为 $\mathbf{x}=(x_1,x_2)=(1,2)$,真实标签 $y=1$。隐藏层和输出层均使用 Sigmoid 激活函数:

$$ \sigma(t)=\frac{1}{1+e^{-t}} $$

参数为:

$$ w_1=0.1,\quad w_2=-0.2,\quad b_h=0.1 $$

$$ v=0.4,\quad b_o=-0.1 $$

前向传播为:

$$ a=w_1x_1+w_2x_2+b_h,\quad h=\sigma(a) $$

$$ z=vh+b_o,\quad \hat{y}=\sigma(z) $$

损失函数为:

$$ L=\frac12(\hat{y}-y)^2 $$

请完成:

  1. 计算 $a,h,z,\hat{y},L$。
  2. 推导并计算输出层误差项 $\delta_o=\frac{\partial L}{\partial z}$。
  3. 推导并计算隐藏层误差项 $\delta_h=\frac{\partial L}{\partial a}$。
  4. 计算 $\frac{\partial L}{\partial v},\frac{\partial L}{\partial b_o},\frac{\partial L}{\partial w_1},\frac{\partial L}{\partial w_2},\frac{\partial L}{\partial b_h}$。
  5. 若学习率 $\eta=0.1$,写出一次梯度下降更新后的参数。

参考答案与解析

一、选择题答案

  1. B。归纳偏置是学习算法在假设空间中的偏好。训练样本有限时,往往有多个假设都能解释训练集,算法必须借助偏好选择一个用于泛化。
  2. B。欧氏距离会对较大的坐标差异产生更明显响应,异常值容易显著拉大距离。
  3. C。Random Forest 是 Bagging + 决策树 + 特征随机选择。Bagging 通常并行训练,主要降低方差;Boosting 通常串行训练,主要降低偏差。
  4. C。$Precision=\frac{TP}{TP+FP}=\frac{30}{30+10}=0.75$。
  5. A。$C$ 越大,对 $\sum_i\xi_i$ 的惩罚越重,模型更倾向于减少训练错误,但可能更容易过拟合。
  6. C。PCA 是无监督降维,关注总体方差;LDA 是有监督降维,关注类内小、类间大。LDA 多分类最多降到类别数减一维。

二、大题答案

1. 绪论

  1. 归纳偏置是学习算法在面对多个候选假设时,对某类假设的偏好。例如线性模型偏好线性决策边界,KNN 偏好相近样本有相似标签,SVM 偏好最大间隔分类边界。由于训练集有限,仅靠训练样本通常无法唯一确定真实规律,因此学习算法必须依赖某种归纳偏置,才能从有限样本推广到未见样本。

  2. 奥卡姆剃刀原则指:若多个假设都能较好解释数据,应优先选择较简单的假设。在机器学习中,这表现为偏好较低复杂度模型、较小参数范数、较浅决策树或带正则化的模型。它有助于降低过拟合风险;但如果真实规律本身复杂,过度追求简单也可能导致欠拟合。

  3. 生成式模型学习联合分布 $P(x,y)$ 或类别条件分布 $P(x|y)$ 与先验 $P(y)$,再通过贝叶斯公式分类。例子:朴素贝叶斯、GMM、HMM。判别式模型直接学习 $P(y|x)$ 或决策函数 $f(x)$。例子:对数几率回归、SVM、CRF、CNN 分类器。

2. 线性模型与 LDA

  1. LDA 是有监督降维/分类方法。它把样本投影到低维方向上,使同类样本投影后尽可能接近,异类样本投影后尽可能远离。分类时,可先将样本投影到 LDA 方向,再根据投影后离哪个类别均值更近来判别类别。

  2. 二分类 LDA 中:

    $$ S_w=\sum_{\mathbf{x}\in C_0}(\mathbf{x}-\mu_0)(\mathbf{x}-\mu_0)^T+ \sum_{\mathbf{x}\in C_1}(\mathbf{x}-\mu_1)(\mathbf{x}-\mu_1)^T $$

    $$ S_b=(\mu_0-\mu_1)(\mu_0-\mu_1)^T $$

    目标函数为:

    $$ J(\mathbf{w})=\frac{\mathbf{w}^TS_b\mathbf{w}}{\mathbf{w}^TS_w\mathbf{w}} $$

    分子越大表示类间越远,分母越小表示类内越紧。

  3. 两类均值为:

    $$ \mu_0=\left(\frac{0+0+1}{3},\frac{0+2+1}{3}\right)=\left(\frac13,1\right) $$

    $$ \mu_1=\left(\frac{3+4+5}{3},\frac{2+4+3}{3}\right)=(4,3) $$

    对 $C_0$:

    $$ S_{w0}= \begin{pmatrix} 2/3&0\ 0&2 \end{pmatrix} $$

    对 $C_1$:

    $$ S_{w1}= \begin{pmatrix} 2&1\ 1&2 \end{pmatrix} $$

    因此:

    $$ S_w= \begin{pmatrix} 8/3&1\ 1&4 \end{pmatrix} $$

    二分类 LDA 的投影方向可取:

    $$ \mathbf{w}=S_w^{-1}(\mu_1-\mu_0) $$

    其中:

    $$ \mu_1-\mu_0=\left(\frac{11}{3},2\right) $$

    $$ S_w^{-1}= \begin{pmatrix} 12/29&-3/29\ -3/29&8/29 \end{pmatrix} $$

    所以:

    $$ \mathbf{w}= \begin{pmatrix} 38/29\ 5/29 \end{pmatrix} $$

    投影方向只关心比例,因此可写为:

    $$ \mathbf{w}\propto(38,5)^T $$

3. GMM 与 EM

  1. 一维高斯密度为:

    $$ \mathcal{N}(x;\mu,\sigma^2)=\frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right) $$

    对第一个成分:

    $$ \mathcal{N}(1;0,1)=\frac{1}{\sqrt{2\pi}}e^{-1/2}\approx0.24197 $$

    对第二个成分:

    $$ \mathcal{N}(1;3,1)=\frac{1}{\sqrt{2\pi}}e^{-2}\approx0.05399 $$

  2. 属于第一个高斯成分的后验概率为:

    $$ \gamma_1= \frac{0.4\mathcal{N}(1;0,1)} {0.4\mathcal{N}(1;0,1)+0.6\mathcal{N}(1;3,1)} $$

    代入数值:

    $$ \gamma_1= \frac{0.4\times0.24197}{0.4\times0.24197+0.6\times0.05399} \approx0.749 $$

    因此该样本属于第一个高斯成分的后验概率约为 0.749。

  3. GMM 是软聚类模型,因为它不把一个样本硬性分配给某一个簇,而是给出样本属于每个高斯成分的后验概率。一个样本可以以不同责任度同时属于多个成分。

  4. EM 在 GMM 中的流程:

    • E 步:在当前参数 $\alpha_k,\mu_k,\Sigma_k$ 下,计算每个样本属于每个高斯成分的后验概率,也就是责任度 $\gamma_{jk}$。
    • M 步:固定责任度,用加权最大似然重新估计混合系数、均值和协方差。
    • 重复 E 步与 M 步,直到对数似然变化很小或达到最大迭代次数。

4. 决策树

  1. 信息熵公式:

    $$ Ent(D)=-\sum_{k=1}^{|\mathcal{Y}|}p_k\log_2p_k $$

    数据集中正例 4 个,反例 4 个:

    $$ Ent(D)=-\frac12\log_2\frac12-\frac12\log_2\frac12=1 $$

  2. 属性 $X$:

    • $X=0$ 时,有 2 个正例、2 个反例,熵为 1。
    • $X=1$ 时,有 2 个正例、2 个反例,熵为 1。

    $$ Gain(D,X)=1-\frac48\times1-\frac48\times1=0 $$

    属性 $Y$:

    • $Y=0$ 时,有 2 个正例、2 个反例,熵为 1。
    • $Y=1$ 时,有 2 个正例、2 个反例,熵为 1。

    $$ Gain(D,Y)=1-\frac48\times1-\frac48\times1=0 $$

    属性 $Z$:

    • $Z=0$ 时,有 4 个正例、0 个反例,熵为 0。
    • $Z=1$ 时,有 0 个正例、4 个反例,熵为 0。

    $$ Gain(D,Z)=1-\frac48\times0-\frac48\times0=1 $$

  3. ID3 选择信息增益最大的属性作为划分属性,因此根结点选择 $Z$。文字形式的树为:

    if Z = 0:
        类别 = +
    if Z = 1:
        类别 = -
    
  4. 三类指标:

    • ID3 使用信息增益,选择信息增益最大的属性。缺点是偏好取值数目多的属性。
    • C4.5 使用增益率,形式为 $Gain_ratio(D,a)=Gain(D,a)/IV(a)$,可缓解多取值偏好;实际常先筛选信息增益高于平均的属性,再选增益率最高者。
    • CART 使用基尼指数,$Gini(D)=1-\sum_kp_k^2$,选择划分后基尼指数最小的属性,常构造二叉树,可用于分类和回归。

5. 支持向量机 SVM

  1. 线性可分硬间隔 SVM 希望在正确分类的前提下最大化几何间隔。固定函数间隔为 1 后,原问题为:

    $$ \min_{\mathbf{w},b}\frac12|\mathbf{w}|^2 $$

    $$ s.t.\quad y_i(\mathbf{w}^T\mathbf{x}_i+b)\ge1,\quad i=1,\dots,m $$

  2. 软间隔 SVM 引入松弛变量:

    $$ \min_{\mathbf{w},b,\boldsymbol{\xi}} \frac12|\mathbf{w}|^2+C\sum_{i=1}^m\xi_i $$

    $$ s.t.\quad y_i(\mathbf{w}^T\mathbf{x}_i+b)\ge1-\xi_i,\quad \xi_i\ge0 $$

    含义:

    • $\xi_i$ 表示第 $i$ 个样本违反间隔约束的程度。
    • $\xi_i=0$ 表示满足间隔要求。
    • $0<\xi_i<1$ 表示分类正确但落入间隔内部。
    • $\xi_i>1$ 表示可能被错分。
    • $C$ 控制间隔大小与训练错误惩罚之间的权衡;$C$ 越大,对违反间隔惩罚越重。
  3. 软间隔 SVM 的对偶问题为:

    $$ \max_{\boldsymbol{\alpha}} \sum_{i=1}^m\alpha_i -\frac12\sum_{i=1}^m\sum_{j=1}^m \alpha_i\alpha_jy_iy_j\mathbf{x}_i^T\mathbf{x}_j $$

    约束为:

    $$ 0\le\alpha_i\le C,\quad i=1,\dots,m $$

    $$ \sum_{i=1}^m\alpha_iy_i=0 $$

    若使用核函数,只需将内积 $\mathbf{x}_i^T\mathbf{x}_j$ 替换为 $K(\mathbf{x}_i,\mathbf{x}_j)$。

  4. 核函数的作用是隐式计算高维特征空间中的内积:

    $$ K(\mathbf{x}_i,\mathbf{x}_j)=\phi(\mathbf{x}_i)^T\phi(\mathbf{x}_j) $$

    SVM 的对偶形式和预测函数只依赖样本内积,因此可以不显式构造高维映射 $\phi(x)$,直接通过核函数获得非线性分类边界。

    • 多项式核对应有限阶多项式特征组合,边界形状相对规则,阶数越高越灵活。
    • RBF 核具有局部响应特性,可以形成更复杂、更局部的非线性边界;参数过大或过小都可能导致欠拟合或过拟合。

6. PCA 与神经网络高频计算

  1. 总方差为:

    $$ 8+3+1=12 $$

    各主成分贡献率:

    $$ r_1=\frac{8}{12}=0.667 $$

    $$ r_2=\frac{3}{12}=0.250 $$

    $$ r_3=\frac{1}{12}=0.083 $$

    累计贡献率:

    • 第一维:0.667。
    • 前二维:0.667+0.250=0.917。
    • 前三维:1.000。

    若要求累计贡献率不低于 90%,至少保留 2 维。

  2. 卷积输出高宽:

    $$ H_{out}=W_{out}= \left\lfloor\frac{64+2\times2-5}{2}\right\rfloor+1

    \left\lfloor\frac{63}{2}\right\rfloor+1=32 $$

    输出通道数等于卷积核个数,为 16。因此输出形状为:

    $$ 16\times32\times32 $$

    参数量为:

    $$ (5\times5\times3+1)\times16=76\times16=1216 $$

  3. 互相关形式的卷积输出为:

    $$ B= \begin{pmatrix} 8&2&4\ 8&4&2\ 4&8&8 \end{pmatrix} $$

    例如左上角:

    $$ 1\times1+0\times0+3\times2+1\times1=8 $$

    对 $B$ 做 $2\times2$ 最大池化,步长为 1:

    $$ \begin{pmatrix} \max(8,2,8,4)&\max(2,4,4,2)\ \max(8,4,4,8)&\max(4,2,8,8) \end{pmatrix}

    \begin{pmatrix} 8&4\ 8&8 \end{pmatrix} $$

  4. Batch Normalization 通常在同一 batch 内、对同一特征维度或通道统计均值方差,常用于 CNN。Layer Normalization 对单个样本内部的所有特征维度统计均值方差,常用于 RNN 和 Transformer。BN 依赖 batch 统计,LN 不依赖 batch 大小。

神经网络 BP 推导加强题答案

  1. 前向传播:

    $$ a=w_1x_1+w_2x_2+b_h=0.1\times1+(-0.2)\times2+0.1=-0.2 $$

    $$ h=\sigma(-0.2)\approx0.4502 $$

    $$ z=vh+b_o=0.4\times0.4502-0.1\approx0.0801 $$

    $$ \hat{y}=\sigma(0.0801)\approx0.5200 $$

    $$ L=\frac12(0.5200-1)^2\approx0.1152 $$

  2. 输出层误差项:

    $$ \delta_o=\frac{\partial L}{\partial z} =\frac{\partial L}{\partial \hat{y}}\frac{\partial \hat{y}}{\partial z} $$

    因为:

    $$ \frac{\partial L}{\partial \hat{y}}=\hat{y}-y $$

    $$ \frac{\partial \hat{y}}{\partial z}=\hat{y}(1-\hat{y}) $$

    所以:

    $$ \delta_o=(\hat{y}-y)\hat{y}(1-\hat{y}) $$

    代入:

    $$ \delta_o=(0.5200-1)\times0.5200\times0.4800\approx-0.1198 $$

  3. 隐藏层误差项:

    $$ \delta_h=\frac{\partial L}{\partial a} =\frac{\partial L}{\partial z}\frac{\partial z}{\partial h}\frac{\partial h}{\partial a} $$

    其中:

    $$ \frac{\partial z}{\partial h}=v $$

    $$ \frac{\partial h}{\partial a}=h(1-h) $$

    所以:

    $$ \delta_h=\delta_o v h(1-h) $$

    代入:

    $$ \delta_h=-0.1198\times0.4\times0.4502\times(1-0.4502) \approx-0.0119 $$

  4. 参数梯度:

    输出层:

    $$ \frac{\partial L}{\partial v} =\delta_o\frac{\partial z}{\partial v} =\delta_oh \approx-0.1198\times0.4502=-0.0539 $$

    $$ \frac{\partial L}{\partial b_o}=\delta_o\approx-0.1198 $$

    隐藏层:

    $$ \frac{\partial L}{\partial w_1} =\delta_h\frac{\partial a}{\partial w_1} =\delta_hx_1 \approx-0.0119 $$

    $$ \frac{\partial L}{\partial w_2} =\delta_h\frac{\partial a}{\partial w_2} =\delta_hx_2 \approx-0.0237 $$

    $$ \frac{\partial L}{\partial b_h}=\delta_h\approx-0.0119 $$

  5. 梯度下降更新公式为:

    $$ \theta'=\theta-\eta\frac{\partial L}{\partial \theta} $$

    当 $\eta=0.1$ 时:

    $$ v'=0.4-0.1\times(-0.0539)\approx0.4054 $$

    $$ b_o'=-0.1-0.1\times(-0.1198)\approx-0.0880 $$

    $$ w_1'=0.1-0.1\times(-0.0119)\approx0.1012 $$

    $$ w_2'=-0.2-0.1\times(-0.0237)\approx-0.1976 $$

    $$ b_h'=0.1-0.1\times(-0.0119)\approx0.1012 $$

    这类题的核心是记住两层误差项:

    $$ \delta_o=(\hat{y}-y)\hat{y}(1-\hat{y}) $$

    $$ \delta_h=\delta_o v h(1-h) $$


复习优先级建议

若时间有限,建议按以下顺序复习:

  1. 决策树三指标:信息增益、增益率、基尼指数,必须会手算。
  2. SVM:硬间隔、软间隔、松弛变量、$C$、对偶问题、核函数。
  3. LDA:类内小、类间大,$J=\frac{w^TS_bw}{w^TS_ww}$ 的含义。
  4. GMM/EM:后验概率计算,E 步/M 步含义。
  5. PCA:贡献率、累计贡献率、重构误差。
  6. 神经网络:卷积输出尺寸、参数量、池化、BN/LN 区别。