上海大学 机器学习 · 研究生 第 10 讲 神经网络 https://kaizhao.net/teaching/shu-ml-grad
第 10 讲

神经网络

可学习表示 · 前向计算 · 反向传播 · 卷积
输入图像、数值或文本表示可计算的特征目标预测与重建

特征工程与表示学习

像素图像输入人工特征边缘、纹理统计分类器学习分类参数像素图像输入可学习表示学习特征参数分类器联合优化

CS229:非线性模型与可学习特征

神经元的加权求和

输入x₁ = 2,x₂ = 1加权求和z = w₁x₁ + w₂x₂ + b激活a = φ(z)输出传给下一层
$$z=0.5\times2-1\times1+0.2=0.2$$
权重 $w$ 与偏置 $b$ 决定响应。

激活函数的形状

$$a=\phi(wx+b)$$

修正线性单元(Rectified Linear Unit, ReLU):$\max(0,z)$。

多层感知机的函数复合

输入 x隐藏表示 h₁隐藏表示 h₂预测 ŷ
$$h_1=\phi(W_1x+b_1),\quad \hat y=W_2h_1+b_2$$

多层感知机(Multilayer Perceptron, MLP);隐藏层输出作为新特征。

非线性层的作用

$$W_2(W_1x+b_1)+b_2=(W_2W_1)x+(W_2b_1+b_2)$$
仿射层线性变换+偏置仿射层继续组合单个仿射层可合并
中间加入非线性激活,扩大函数表示能力。

异或数据上的网络训练

观察训练损失与决策区域。

合成异或(exclusive OR, XOR)数据;背景为当前模型 $p(y=1\mid x)$。

前向计算与损失

输入 x = 2w = 0.5隐藏 a = 1a = ReLU(wx)预测 ŷ = 0.5v = 0.5
$$y=1,\qquad L=\tfrac12(\hat y-y)^2=0.125$$

反向传播中的链式法则

第一层 w∂L/∂w = −0.5隐藏 a∂L/∂a = −0.25预测 ŷ∂L/∂ŷ = −0.5损失 L
$$\frac{\partial L}{\partial w}=(\hat y-y)\,v\,\phi\prime(wx)\,x=-0.5$$
$$w\leftarrow w-\eta\frac{\partial L}{\partial w},\quad \eta=0.1:\ w=0.55$$

Rumelhart、Hinton、Williams,1986:反向传播与内部表示

训练循环

一批样本输入与目标前向计算损失 L反向求导所有参数梯度更新参数下降一步
重复遍历训练集;用验证集选择设置。

卷积中的局部连接与权重共享

局部像素块位置随窗口移动同一个卷积核参数重复使用响应图记录各位置响应边缘响应局部形状组合任务相关表示

卷积神经网络(Convolutional Neural Network, CNN);示意特征层次。

卷积核的逐位置计算

$$z_{ij}=\sum_{a,b}K_{ab}X_{i+a,j+b}$$

人工像素矩阵;无填充、步长 1;卷积核为设定值。

LeNet 与 AlexNet

AlexNet原论文Figure 2:五个卷积层及三个全连接层,图中分为两条计算路径
代表工作主要对象方法特征
LeNet-5 · 1998手写字符卷积、下采样、反向传播
AlexNet · 2012自然图像分类深层卷积、ReLU、dropout

LeCun 等,1998Krizhevsky 等,2012,Figure 2(原图)

训练结果与泛化评价

训练集更新网络参数验证集选结构与早停测试集一次最终评价
现象排查方向
训练损失难以下降数据、梯度、学习率
训练好、验证差容量、正则化、增强
部署数据变化分布差异、重新评估

监督目标与表示的用途

原始输入数据形式表示 h网络中间输出分类 / 回归任务目标原始输入无人工标签表示 h同样可学习重建 / 预测缺失数据生成目标

代表文献

  1. Rumelhart, Hinton & Williams (1986). Learning representations by back-propagating errors.
  2. LeCun et al. (1998). Gradient-Based Learning Applied to Document Recognition.
  3. Krizhevsky, Sutskever & Hinton (2012). ImageNet Classification with Deep Convolutional Neural Networks.
  4. Ma et al. CS229 Lecture Notes: Deep Learning.