说明:本卷保持本学院往年卷的章节化大题风格,但重点换为线性模型、KNN、聚类、集成学习、SVM 和神经网络。题目与前两份模拟卷在数据、考点和问法上均有区别。
模拟试卷
一、选择题(每题 2 分,共 12 分)
下列哪项最能体现 KNN 的归纳偏置( )
A. 特征之间条件独立
B. 相近样本倾向具有相似标签
C. 决策边界应具有最大间隔
D. 模型参数应尽可能少对数几率回归中,Sigmoid 函数的作用是( )
A. 将实数映射为 $[0,1]$ 上的概率
B. 将所有特征归一化为零均值
C. 直接计算欧氏距离
D. 消除所有过拟合K-means 聚类中,通常需要预先指定的是( )
A. 类别标签
B. 簇的个数 $K$
C. 支持向量个数
D. 特征值贡献率Random Forest 相比单棵决策树通常泛化更好,主要因为( )
A. 每棵树都没有方差
B. 它通过样本随机和特征随机降低相关性,再投票降低方差
C. 它完全避免过拟合
D. 它不需要训练数据下列关于 PCA 的说法正确的是( )
A. PCA 使用类别标签最大化类间距离
B. PCA 总是提高分类准确率
C. PCA 选择方差最大的方向保留主要信息
D. PCA 不需要中心化卷积神经网络比全连接网络更适合图像任务,主要因为( )
A. CNN 不需要反向传播
B. CNN 通过局部连接和参数共享利用图像局部性
C. CNN 只能处理一维序列
D. CNN 没有可学习参数
二、大题(共 88 分)
1. 线性模型与对数几率回归(16 分)
- 写出线性回归的平方损失目标,并说明最小二乘法的思想。(4 分)
- 对数几率回归为什么可以用于二分类?写出 $P(y=1|\mathbf{x})$ 的表达式。(4 分)
- 对样本 $\mathbf{x}=(1,2)$,$y=1$,参数 $\mathbf{w}=(0.2,-0.1)$,$b=0$,计算 $z,\hat{y}$。(3 分)
- 使用交叉熵损失时,单样本梯度为 $(\hat{y}-y)\mathbf{x}$ 和 $\hat{y}-y$。计算 $\nabla_{\mathbf{w}}L$ 和 $\partial L/\partial b$。(5 分)
2. KNN 与距离度量(14 分)
给定训练样本:
| 样本 | 坐标 | 类别 |
|---|---|---|
| A | $(0,0)$ | 红 |
| B | $(1,1)$ | 红 |
| C | $(4,4)$ | 蓝 |
| D | $(5,5)$ | 蓝 |
| E | $(0,3)$ | 红 |
待分类点为 $q=(2,2)$。
- 分别计算 $q$ 到五个样本的欧氏距离。(5 分)
- 当 $k=1$ 和 $k=3$ 时,预测类别分别是什么?(3 分)
- 说明 $k$ 过小和过大分别有什么风险。(3 分)
- 为什么 KNN 被称为懒惰学习?它的主要时间和空间开销在哪里?(3 分)
3. 聚类与 K-means(14 分)
给定 6 个样本:
$$ (0,0),(0,2),(2,0),(8,8),(8,10),(10,8) $$
令 $K=2$,初始中心为 $\mu_1=(0,0),\mu_2=(8,8)$。
- 写出 K-means 的基本步骤或伪代码。(4 分)
- 完成第一轮样本分配。(4 分)
- 更新两个聚类中心。(3 分)
- 比较 K-means 和 GMM 聚类的差异。(3 分)
4. 集成学习(14 分)
- 说明 Bagging 的训练流程,并解释它主要降低偏差还是方差。(4 分)
- 说明 Boosting 的训练思想,并解释它主要降低偏差还是方差。(4 分)
- Random Forest 在 Bagging 的基础上额外引入了什么随机性?为什么有帮助?(3 分)
- 比较投票法、平均法和 Stacking 的基本思想。(3 分)
5. SVM 图形判断与参数影响(14 分)
- 给出软间隔 SVM 中 $C$ 较大和较小时决策边界的差异。(4 分)
- RBF 核参数使边界非常曲折时,可能对应欠拟合还是过拟合?为什么?(3 分)
- 解释合页损失 $\max(0,1-yf(x))$ 的含义。(4 分)
- 说明支持向量、间隔边界和分类超平面的关系。(3 分)
6. 神经网络、CNN 与 BP(16 分)
- 画出或文字描述 MP 神经元结构,并说明输入、权重、阈值/偏置、激活函数和输出的作用。(4 分)
- 输入图像为 $1\times28\times28$,卷积层有 6 个 $5\times5$ 卷积核,无 padding,stride=1。求输出形状和参数量。(4 分)
- 给定两层网络:$a=w_1x_1+w_2x_2+b_h$,$h=\sigma(a)$,$z=vh+b_o$,$\hat{y}=\sigma(z)$,$L=\frac12(\hat{y}-y)^2$。写出 $\delta_o$、$\delta_h$ 以及各参数梯度的一般公式。(5 分)
- 简述两种缓解神经网络过拟合的方法及其原理。(3 分)
参考答案与解析
一、选择题答案
- B。KNN 假设相近样本标签相似。
- A。Sigmoid 将线性输出映射到 $[0,1]$,可解释为正类概率。
- B。K-means 需要指定簇数 $K$。
- B。随机森林通过降低树之间相关性并聚合预测来降低方差。
- C。PCA 是无监督方法,选择方差最大的方向。
- B。CNN 利用局部连接、参数共享和平移不变性。
二、大题答案
1. 线性模型与对数几率回归
线性回归模型为:
$$ f(\mathbf{x})=\mathbf{w}^T\mathbf{x}+b $$
平方损失目标为:
$$ \min_{\mathbf{w},b}\sum_{i=1}^m(y_i-\mathbf{w}^T\mathbf{x}_i-b)^2 $$
最小二乘法的思想是选择参数,使预测值与真实值之间残差平方和最小。
对数几率回归用 Sigmoid 函数把线性输出 $z=\mathbf{w}^T\mathbf{x}+b$ 映射为正类概率:
$$ P(y=1|\mathbf{x})=\frac{1}{1+e^{-(\mathbf{w}^T\mathbf{x}+b)}} $$
当该概率大于阈值时判为正类,否则判为负类。
$$ z=0.2\times1+(-0.1)\times2+0=0 $$
$$ \hat{y}=\sigma(0)=0.5 $$
交叉熵下:
$$ \hat{y}-y=0.5-1=-0.5 $$
$$ \nabla_{\mathbf{w}}L=(\hat{y}-y)\mathbf{x}=(-0.5)(1,2)=(-0.5,-1.0) $$
$$ \frac{\partial L}{\partial b}=\hat{y}-y=-0.5 $$
若用梯度下降,参数会沿负梯度方向更新,使正类概率增大。
2. KNN 与距离度量
欧氏距离:
$$ d(q,A)=\sqrt{(2-0)^2+(2-0)^2}=\sqrt8\approx2.828 $$
$$ d(q,B)=\sqrt{(2-1)^2+(2-1)^2}=\sqrt2\approx1.414 $$
$$ d(q,C)=\sqrt{(2-4)^2+(2-4)^2}=\sqrt8\approx2.828 $$
$$ d(q,D)=\sqrt{(2-5)^2+(2-5)^2}=\sqrt{18}\approx4.243 $$
$$ d(q,E)=\sqrt{(2-0)^2+(2-3)^2}=\sqrt5\approx2.236 $$
$k=1$ 时最近邻为 B,类别为红。$k=3$ 时最近的三个样本为 B、E、A/C 中一个并列。若按距离并列时任选一个,可能出现红红红或红红蓝;多数情况下预测为红。
$k$ 过小会对噪声和异常点敏感,方差较高,容易过拟合。$k$ 过大会使局部结构被过度平滑,偏差较高,容易欠拟合。
KNN 训练阶段几乎只是存储样本,不显式学习参数,因此称为懒惰学习。主要空间开销是存储全部训练样本;预测时要计算待测样本与训练样本的距离,时间开销较大。
3. 聚类与 K-means
K-means 基本步骤:
选择 K 个初始聚类中心 repeat: 对每个样本,分配到最近的中心 对每个簇,更新中心为该簇样本均值 until 中心不再明显变化或达到迭代次数到 $\mu_1=(0,0)$ 与 $\mu_2=(8,8)$ 的距离比较可知:
- $(0,0),(0,2),(2,0)$ 分到第 1 簇。
- $(8,8),(8,10),(10,8)$ 分到第 2 簇。
更新中心:
$$ \mu_1'=\left(\frac{0+0+2}{3},\frac{0+2+0}{3}\right)=\left(\frac23,\frac23\right) $$
$$ \mu_2'=\left(\frac{8+8+10}{3},\frac{8+10+8}{3}\right)=\left(\frac{26}{3},\frac{26}{3}\right) $$
K-means 是硬聚类,每个样本只属于一个簇,通常用欧氏距离和簇均值表示簇。GMM 是软聚类,每个样本对多个高斯成分有后验概率,能够表示不同方差和形状的簇,参数通常用 EM 估计。
4. 集成学习
Bagging 使用自助采样生成多个训练集,并行训练多个基学习器,再通过投票或平均得到最终预测。由于多个不稳定模型的误差可相互抵消,Bagging 主要降低方差。
Boosting 串行训练基学习器,后一个学习器重点关注前面学习器预测错误或拟合不足的样本,逐步组合成强学习器。它主要通过逐步修正错误来降低偏差。
Random Forest 在样本随机采样之外,还在每个结点划分时随机选择一部分特征作为候选。这样能降低树之间的相关性,使集成投票更有效,从而提高泛化能力。
投票法常用于分类任务,让多个分类器投票决定类别。平均法常用于回归任务,对多个模型输出取平均。Stacking 先训练多个初级学习器,再把它们的输出作为新特征训练一个元学习器。
5. SVM 图形判断与参数影响
$C$ 较大时,对违反间隔和错分惩罚更重,边界会更努力正确分类训练样本,间隔可能较窄,过拟合风险更高。$C$ 较小时,对错误容忍更高,间隔可能更宽,边界更平滑,但欠拟合风险更高。
RBF 核边界非常曲折时通常对应过拟合,因为模型过度适应训练样本局部细节甚至噪声,训练误差可能很低但测试误差较高。
合页损失:
$$ \max(0,1-yf(x)) $$
当 $yf(x)\ge1$ 时,样本分类正确且在间隔外,损失为 0。当 $yf(x)<1$ 时,样本要么落入间隔内,要么被错分,会产生正损失。它体现了 SVM 不仅要求分对,还要求离边界足够远。
分类超平面为 $f(x)=0$,间隔边界为 $f(x)=1$ 和 $f(x)=-1$。支持向量是落在间隔边界上或违反间隔的关键样本,它们决定最优超平面的位置。
6. 神经网络、CNN 与 BP
MP 神经元接收多个输入 $x_i$,每个输入乘以权重 $w_i$,再求和并加偏置 $b$,得到:
$$ z=\sum_iw_ix_i+b $$
然后通过激活函数产生输出。权重表示输入重要性,偏置调整阈值,激活函数引入非线性。
输出高宽:
$$ \frac{28-5}{1}+1=24 $$
输出形状为:
$$ 6\times24\times24 $$
参数量为:
$$ (5\times5\times1+1)\times6=156 $$
输出层误差项:
$$ \delta_o=\frac{\partial L}{\partial z}=(\hat{y}-y)\hat{y}(1-\hat{y}) $$
隐藏层误差项:
$$ \delta_h=\frac{\partial L}{\partial a}=\delta_o v h(1-h) $$
参数梯度:
$$ \frac{\partial L}{\partial v}=\delta_oh,\quad \frac{\partial L}{\partial b_o}=\delta_o $$
$$ \frac{\partial L}{\partial w_1}=\delta_hx_1,\quad \frac{\partial L}{\partial w_2}=\delta_hx_2,\quad \frac{\partial L}{\partial b_h}=\delta_h $$
缓解过拟合的方法包括:正则化,通过惩罚大权重降低模型复杂度;Dropout,训练时随机丢弃部分神经元,减少神经元共适应;数据增强,通过扩充训练样本提高泛化能力;早停,在验证集性能变差时停止训练。