上海大学 机器学习 · 研究生 第 11 讲 特征提取与降维 https://kaizhao.net/teaching/shu-ml-grad
第 11 讲

特征提取与降维

主成分分析 · 投影与重建 · 自动编码器
输入图像、数值或文本表示可计算的特征目标预测与重建

特征选择、提取与降维

操作输入 → 输出保留对象
特征选择面积、房龄、楼层 → 面积、房龄原有列
特征提取像素 → 边缘响应新的表示
降维100 个数 → 2 个数更少坐标
原坐标 xd 个维度变换 f人工定义或学习新坐标 zk 个维度

相关测量与低维结构

长度宽度主要变化方向
两个测量值可能主要沿一个方向变化。

合成点云;直线表示低维结构。

中心化的坐标平移

原样本 x(5, 4)减去均值 μ(3, 2)中心化 x − μ(2, 2)
$$\mu=\frac1n\sum_{i=1}^{n}x_i,\qquad \widetilde x_i=x_i-\mu$$
均值确定中心;方向描述中心附近的变化。

一维投影与重建

x重建点 x̂中心 μ单位方向 u垂直距离 → 丢失的信息
$$z=u^{\mathsf T}(x-\mu),\qquad \hat x=\mu+uz$$

投影方向与重建误差

最大投影方差 ↔ 最小重建误差

主成分分析(Principal Component Analysis, PCA);合成二维数据。

PCA 的最大方差目标

$$\max_{\|u\|=1}\ \frac1n\sum_i\big[u^{\mathsf T}(x_i-\mu)\big]^2$$
选一个单位方向u计算投影坐标每点得到一个 z比较投影方差保留变化最多的方向
约束 $\|u\|=1$,排除任意放大坐标。

CS229:Principal Components Analysis

协方差矩阵与特征向量

$$C=\frac1n\sum_i(x_i-\mu)(x_i-\mu)^{\mathsf T},\qquad Cu=\lambda u$$
$$C=\begin{bmatrix}2&1\\1&2\end{bmatrix},\quad u_1=\frac1{\sqrt2}\begin{bmatrix}1\\1\end{bmatrix},\quad\lambda_1=3$$
最大特征值对应第一主成分

多个主成分的编码与重建

d 维输入xk 维坐标z = Uᵀ(x − μ)d 维重建x̂ = μ + Uz
$$U=[u_1,\ldots,u_k],\qquad U^{\mathsf T}U=I$$
按特征值从大到小,保留 $k$ 个正交方向。

保留维数与信息损失

$$\text{累计解释方差比}=\frac{\lambda_1+\cdots+\lambda_k}{\lambda_1+\cdots+\lambda_d}$$
λ1λ2λ3λ4示例特征值:8,4,2,1
$k=2$ 保留 $12/15=80\%$ 的方差。

示例谱;保留方差不等同于保留任务信息。

测量单位与标准化

$$x_j\leftarrow\frac{x_j-\mu_j}{s_j}$$

同一合成样本;缩放倍数模拟测量单位变化。

方差与类别信息的区别

第一主成分类别区别位于低方差的竖直方向
PCA 使用输入分布,不使用类别标签。

合成反例:保留最多方差的方向可能丢失分类信息。

自动编码器的瓶颈表示

输入 x编码器低维 z解码器重建 x̂
$$\min_{\theta,\psi}\ \frac1n\sum_i\|g_\psi(f_\theta(x_i))-x_i\|^2$$

Hinton & Salakhutdinov,2006:Reducing the Dimensionality of Data with Neural Networks

线性子空间与非线性结构

PCA 限定线性;非线性表示允许更复杂结构。

降维流水线中的数据边界

训练集无标签也有数据边界拟合 μ、U可含标准化参数固定变换处理验证与测试下游模型评价任务指标
跨验证折时,预处理参数也应重新拟合

代表文献

  1. Stanford CS229. Principal Components Analysis.
  2. Hinton & Salakhutdinov (2006). Reducing the Dimensionality of Data with Neural Networks.