说明:本卷保持本学院往年卷的章节化大题风格,但重点换为线性模型、KNN、聚类、集成学习、SVM 和神经网络。题目与前两份模拟卷在数据、考点和问法上均有区别。


模拟试卷

一、选择题(每题 2 分,共 12 分)

  1. 下列哪项最能体现 KNN 的归纳偏置( )

    A. 特征之间条件独立
    B. 相近样本倾向具有相似标签
    C. 决策边界应具有最大间隔
    D. 模型参数应尽可能少

  2. 对数几率回归中,Sigmoid 函数的作用是( )

    A. 将实数映射为 $[0,1]$ 上的概率
    B. 将所有特征归一化为零均值
    C. 直接计算欧氏距离
    D. 消除所有过拟合

  3. K-means 聚类中,通常需要预先指定的是( )

    A. 类别标签
    B. 簇的个数 $K$
    C. 支持向量个数
    D. 特征值贡献率

  4. Random Forest 相比单棵决策树通常泛化更好,主要因为( )

    A. 每棵树都没有方差
    B. 它通过样本随机和特征随机降低相关性,再投票降低方差
    C. 它完全避免过拟合
    D. 它不需要训练数据

  5. 下列关于 PCA 的说法正确的是( )

    A. PCA 使用类别标签最大化类间距离
    B. PCA 总是提高分类准确率
    C. PCA 选择方差最大的方向保留主要信息
    D. PCA 不需要中心化

  6. 卷积神经网络比全连接网络更适合图像任务,主要因为( )

    A. CNN 不需要反向传播
    B. CNN 通过局部连接和参数共享利用图像局部性
    C. CNN 只能处理一维序列
    D. CNN 没有可学习参数


二、大题(共 88 分)

1. 线性模型与对数几率回归(16 分)

  1. 写出线性回归的平方损失目标,并说明最小二乘法的思想。(4 分)
  2. 对数几率回归为什么可以用于二分类?写出 $P(y=1|\mathbf{x})$ 的表达式。(4 分)
  3. 对样本 $\mathbf{x}=(1,2)$,$y=1$,参数 $\mathbf{w}=(0.2,-0.1)$,$b=0$,计算 $z,\hat{y}$。(3 分)
  4. 使用交叉熵损失时,单样本梯度为 $(\hat{y}-y)\mathbf{x}$ 和 $\hat{y}-y$。计算 $\nabla_{\mathbf{w}}L$ 和 $\partial L/\partial b$。(5 分)

2. KNN 与距离度量(14 分)

给定训练样本:

样本 坐标 类别
A $(0,0)$
B $(1,1)$
C $(4,4)$
D $(5,5)$
E $(0,3)$

待分类点为 $q=(2,2)$。

  1. 分别计算 $q$ 到五个样本的欧氏距离。(5 分)
  2. 当 $k=1$ 和 $k=3$ 时,预测类别分别是什么?(3 分)
  3. 说明 $k$ 过小和过大分别有什么风险。(3 分)
  4. 为什么 KNN 被称为懒惰学习?它的主要时间和空间开销在哪里?(3 分)

3. 聚类与 K-means(14 分)

给定 6 个样本:

$$ (0,0),(0,2),(2,0),(8,8),(8,10),(10,8) $$

令 $K=2$,初始中心为 $\mu_1=(0,0),\mu_2=(8,8)$。

  1. 写出 K-means 的基本步骤或伪代码。(4 分)
  2. 完成第一轮样本分配。(4 分)
  3. 更新两个聚类中心。(3 分)
  4. 比较 K-means 和 GMM 聚类的差异。(3 分)

4. 集成学习(14 分)

  1. 说明 Bagging 的训练流程,并解释它主要降低偏差还是方差。(4 分)
  2. 说明 Boosting 的训练思想,并解释它主要降低偏差还是方差。(4 分)
  3. Random Forest 在 Bagging 的基础上额外引入了什么随机性?为什么有帮助?(3 分)
  4. 比较投票法、平均法和 Stacking 的基本思想。(3 分)

5. SVM 图形判断与参数影响(14 分)

  1. 给出软间隔 SVM 中 $C$ 较大和较小时决策边界的差异。(4 分)
  2. RBF 核参数使边界非常曲折时,可能对应欠拟合还是过拟合?为什么?(3 分)
  3. 解释合页损失 $\max(0,1-yf(x))$ 的含义。(4 分)
  4. 说明支持向量、间隔边界和分类超平面的关系。(3 分)

6. 神经网络、CNN 与 BP(16 分)

  1. 画出或文字描述 MP 神经元结构,并说明输入、权重、阈值/偏置、激活函数和输出的作用。(4 分)
  2. 输入图像为 $1\times28\times28$,卷积层有 6 个 $5\times5$ 卷积核,无 padding,stride=1。求输出形状和参数量。(4 分)
  3. 给定两层网络:$a=w_1x_1+w_2x_2+b_h$,$h=\sigma(a)$,$z=vh+b_o$,$\hat{y}=\sigma(z)$,$L=\frac12(\hat{y}-y)^2$。写出 $\delta_o$、$\delta_h$ 以及各参数梯度的一般公式。(5 分)
  4. 简述两种缓解神经网络过拟合的方法及其原理。(3 分)

参考答案与解析

一、选择题答案

  1. B。KNN 假设相近样本标签相似。
  2. A。Sigmoid 将线性输出映射到 $[0,1]$,可解释为正类概率。
  3. B。K-means 需要指定簇数 $K$。
  4. B。随机森林通过降低树之间相关性并聚合预测来降低方差。
  5. C。PCA 是无监督方法,选择方差最大的方向。
  6. B。CNN 利用局部连接、参数共享和平移不变性。

二、大题答案

1. 线性模型与对数几率回归

  1. 线性回归模型为:

    $$ f(\mathbf{x})=\mathbf{w}^T\mathbf{x}+b $$

    平方损失目标为:

    $$ \min_{\mathbf{w},b}\sum_{i=1}^m(y_i-\mathbf{w}^T\mathbf{x}_i-b)^2 $$

    最小二乘法的思想是选择参数,使预测值与真实值之间残差平方和最小。

  2. 对数几率回归用 Sigmoid 函数把线性输出 $z=\mathbf{w}^T\mathbf{x}+b$ 映射为正类概率:

    $$ P(y=1|\mathbf{x})=\frac{1}{1+e^{-(\mathbf{w}^T\mathbf{x}+b)}} $$

    当该概率大于阈值时判为正类,否则判为负类。

$$ z=0.2\times1+(-0.1)\times2+0=0 $$

$$ \hat{y}=\sigma(0)=0.5 $$

  1. 交叉熵下:

    $$ \hat{y}-y=0.5-1=-0.5 $$

    $$ \nabla_{\mathbf{w}}L=(\hat{y}-y)\mathbf{x}=(-0.5)(1,2)=(-0.5,-1.0) $$

    $$ \frac{\partial L}{\partial b}=\hat{y}-y=-0.5 $$

    若用梯度下降,参数会沿负梯度方向更新,使正类概率增大。

2. KNN 与距离度量

  1. 欧氏距离:

    $$ d(q,A)=\sqrt{(2-0)^2+(2-0)^2}=\sqrt8\approx2.828 $$

    $$ d(q,B)=\sqrt{(2-1)^2+(2-1)^2}=\sqrt2\approx1.414 $$

    $$ d(q,C)=\sqrt{(2-4)^2+(2-4)^2}=\sqrt8\approx2.828 $$

    $$ d(q,D)=\sqrt{(2-5)^2+(2-5)^2}=\sqrt{18}\approx4.243 $$

    $$ d(q,E)=\sqrt{(2-0)^2+(2-3)^2}=\sqrt5\approx2.236 $$

  2. $k=1$ 时最近邻为 B,类别为红。$k=3$ 时最近的三个样本为 B、E、A/C 中一个并列。若按距离并列时任选一个,可能出现红红红或红红蓝;多数情况下预测为红。

  3. $k$ 过小会对噪声和异常点敏感,方差较高,容易过拟合。$k$ 过大会使局部结构被过度平滑,偏差较高,容易欠拟合。

  4. KNN 训练阶段几乎只是存储样本,不显式学习参数,因此称为懒惰学习。主要空间开销是存储全部训练样本;预测时要计算待测样本与训练样本的距离,时间开销较大。

3. 聚类与 K-means

  1. K-means 基本步骤:

    选择 K 个初始聚类中心
    repeat:
        对每个样本,分配到最近的中心
        对每个簇,更新中心为该簇样本均值
    until 中心不再明显变化或达到迭代次数
    
  2. 到 $\mu_1=(0,0)$ 与 $\mu_2=(8,8)$ 的距离比较可知:

    • $(0,0),(0,2),(2,0)$ 分到第 1 簇。
    • $(8,8),(8,10),(10,8)$ 分到第 2 簇。
  3. 更新中心:

    $$ \mu_1'=\left(\frac{0+0+2}{3},\frac{0+2+0}{3}\right)=\left(\frac23,\frac23\right) $$

    $$ \mu_2'=\left(\frac{8+8+10}{3},\frac{8+10+8}{3}\right)=\left(\frac{26}{3},\frac{26}{3}\right) $$

  4. K-means 是硬聚类,每个样本只属于一个簇,通常用欧氏距离和簇均值表示簇。GMM 是软聚类,每个样本对多个高斯成分有后验概率,能够表示不同方差和形状的簇,参数通常用 EM 估计。

4. 集成学习

  1. Bagging 使用自助采样生成多个训练集,并行训练多个基学习器,再通过投票或平均得到最终预测。由于多个不稳定模型的误差可相互抵消,Bagging 主要降低方差。

  2. Boosting 串行训练基学习器,后一个学习器重点关注前面学习器预测错误或拟合不足的样本,逐步组合成强学习器。它主要通过逐步修正错误来降低偏差。

  3. Random Forest 在样本随机采样之外,还在每个结点划分时随机选择一部分特征作为候选。这样能降低树之间的相关性,使集成投票更有效,从而提高泛化能力。

  4. 投票法常用于分类任务,让多个分类器投票决定类别。平均法常用于回归任务,对多个模型输出取平均。Stacking 先训练多个初级学习器,再把它们的输出作为新特征训练一个元学习器。

5. SVM 图形判断与参数影响

  1. $C$ 较大时,对违反间隔和错分惩罚更重,边界会更努力正确分类训练样本,间隔可能较窄,过拟合风险更高。$C$ 较小时,对错误容忍更高,间隔可能更宽,边界更平滑,但欠拟合风险更高。

  2. RBF 核边界非常曲折时通常对应过拟合,因为模型过度适应训练样本局部细节甚至噪声,训练误差可能很低但测试误差较高。

  3. 合页损失:

    $$ \max(0,1-yf(x)) $$

    当 $yf(x)\ge1$ 时,样本分类正确且在间隔外,损失为 0。当 $yf(x)<1$ 时,样本要么落入间隔内,要么被错分,会产生正损失。它体现了 SVM 不仅要求分对,还要求离边界足够远。

  4. 分类超平面为 $f(x)=0$,间隔边界为 $f(x)=1$ 和 $f(x)=-1$。支持向量是落在间隔边界上或违反间隔的关键样本,它们决定最优超平面的位置。

6. 神经网络、CNN 与 BP

  1. MP 神经元接收多个输入 $x_i$,每个输入乘以权重 $w_i$,再求和并加偏置 $b$,得到:

    $$ z=\sum_iw_ix_i+b $$

    然后通过激活函数产生输出。权重表示输入重要性,偏置调整阈值,激活函数引入非线性。

  2. 输出高宽:

    $$ \frac{28-5}{1}+1=24 $$

    输出形状为:

    $$ 6\times24\times24 $$

    参数量为:

    $$ (5\times5\times1+1)\times6=156 $$

  3. 输出层误差项:

    $$ \delta_o=\frac{\partial L}{\partial z}=(\hat{y}-y)\hat{y}(1-\hat{y}) $$

    隐藏层误差项:

    $$ \delta_h=\frac{\partial L}{\partial a}=\delta_o v h(1-h) $$

    参数梯度:

    $$ \frac{\partial L}{\partial v}=\delta_oh,\quad \frac{\partial L}{\partial b_o}=\delta_o $$

    $$ \frac{\partial L}{\partial w_1}=\delta_hx_1,\quad \frac{\partial L}{\partial w_2}=\delta_hx_2,\quad \frac{\partial L}{\partial b_h}=\delta_h $$

  4. 缓解过拟合的方法包括:正则化,通过惩罚大权重降低模型复杂度;Dropout,训练时随机丢弃部分神经元,减少神经元共适应;数据增强,通过扩充训练样本提高泛化能力;早停,在验证集性能变差时停止训练。