上海大学 机器学习 · 研究生 第 8 讲 支持向量机 https://kaizhao.net/teaching/shu-ml-grad
第 8 讲

支持向量机

分类边界、间隔与核函数
支持向量机

二维输入与线性边界

输入 $x=(x_1,x_2)$:两个测量值;标签 $y\in\{-1,+1\}$。

二维二分类点集与线性边界
$$f(x)=w^\top x+b,\qquad \hat y=\begin{cases}+1&f(x)>0\\-1&f(x)\le0\end{cases}$$

支持向量机(Support Vector Machine, SVM);$w$ 为方向参数,$b$ 为偏移。

法向量与几何距离

向量垂直于直线,点投影到边界得到几何距离
$$\|w\|_2=\sqrt{w_1^2+w_2^2},\qquad d(x,\text{边界})=\frac{|w^\top x+b|}{\|w\|_2}$$

$w=(3,4)$ 时,$\|w\|_2=5$;得分 $10$ 对应距离 $2$。

参数缩放与间隔归一化

参数样本得分范数几何距离
$(w,b)$1052
$(2w,2b)$20102
$$\min_i y_i(w^\top x_i+b)=1\quad\Longrightarrow\quad\text{两侧间隔宽度}=\frac{2}{\|w\|_2}$$

严格线性可分时,可缩放参数使最近训练样本的有符号得分为 1。

硬间隔优化

$$\min_{w,b}\ \frac12\|w\|_2^2\qquad\text{s.t.}\quad y_i(w^\top x_i+b)\ge1,\quad i=1,\ldots,n$$
固定归一化后通过最小范数最大化间隔

硬间隔(hard margin):要求每个训练样本均满足间隔约束。

支持向量与边界位置

靠近边界的样本用支持向量圆环突出

支持向量决定最优边界。 远离间隔的点可具有零权重。

$$w=\sum_{i=1}^{n}\alpha_i y_i x_i,\qquad\alpha_i>0\ \Rightarrow\ \text{支持向量}$$

$\alpha_i$ 为训练样本在最优解中的非负系数。

软间隔与惩罚强度

正常分类、进入间隔、跨越边界三种样本
$$\min_{w,b,\xi}\ \frac12\|w\|_2^2+C\sum_{i=1}^{n}\xi_i\quad\text{s.t.}\quad y_i f(x_i)\ge1-\xi_i,\ \xi_i\ge0$$

软间隔(soft margin);$\xi_i$ 表示间隔违反程度,$C>0$ 为惩罚权重。

线性边界与异常点

合成训练点;蓝:$-1$,红:$+1$;品红圈:支持向量;虚线:$f=\pm1$。

hinge loss 与有符号得分

hinge loss 在有符号得分达到1之后为零
$$t_i=y_i f(x_i),\qquad \ell(t_i)=\max(0,1-t_i)$$
有符号得分 $t_i$$-0.5$$0.5$$1.5$
hinge loss$1.5$$0.5$$0$

对偶系数与核展开

$\alpha_i$:第 $i$ 个训练点的系数;$K$:样本相似度。

$$\max_{\alpha}\ \sum_i\alpha_i-\frac12\sum_{i,j}\alpha_i\alpha_j y_i y_j K(x_i,x_j)$$
$$0\le\alpha_i\le C,\qquad\sum_i\alpha_i y_i=0,\qquad f(x)=\sum_i\alpha_i y_iK(x_i,x)+b$$

CS229:支持向量机与对偶推导

非线性映射与可分表示

圆环点在平方半径特征下可线性区分
$$\phi(x)=x_1^2+x_2^2,\qquad f(x)=a\,\phi(x)+b$$

$\phi$ 为特征映射;圆形边界在原空间弯曲,在变换后的坐标上为阈值。

线性核与径向基核

$$K_{\rm linear}(x,z)=x^\top z\qquad K_{\rm RBF}(x,z)=\exp(-\gamma\|x-z\|_2^2)$$
距离 $\|x-z\|_2$$\gamma=0.5$$\gamma=2$
011
10.6070.135
20.1350.00034

径向基函数(Radial Basis Function, RBF);$z$ 为另一输入点,$\gamma>0$ 控制影响范围。

核函数与非线性边界

合成点集;● 训练点,▲ 验证点;底色:预测区域,品红:当前边界与支持向量。

特征尺度与模型选择

训练集估计缩放训练模型验证选择 C、γ测试一次评价
$$\tilde x_j=\frac{x_j-\mu_j}{s_j}$$
来源复用范围
$\mu_j,s_j$当前训练集验证、测试与新输入
$C,\gamma$开发数据中的验证比较定型后训练

scikit-learn:缩放与实用注意事项

分类得分与概率输出

输出含义使用方式
$f(x)$有符号分类得分符号分类、排序
$|f(x)|/\|w\|$线性模型几何距离解释边界相对位置
校准后的概率额外拟合的概率映射概率评价、成本决策

模型得分的尺度由训练目标确定。

支持向量机的得分与概率

支持向量网络的研究脉络

特征空间最大间隔非可分数据支持向量展开
特征空间映射与分类结构

Cortes & Vapnik,1995,Support-vector networks,Machine Learning 20:273–297

间隔、损失与表示

选择表达的偏好可观察结果
范数惩罚较宽的规范化间隔边界与支持向量
惩罚权重 $C$训练违反的代价hinge loss
核与 $\gamma$样本间相似度边界形状与验证误差

原论文 · SVM 方法文档