上海大学 机器学习 · 研究生 第 5 讲 线性分类 https://kaizhao.net/teaching/shu-ml-grad
第 5 讲

线性分类

线性得分、逻辑概率与 Fisher 判别
特征 → 得分 → 类别z = wᵀx + b同一线性形式,不同训练目标

邮件分类中的输入与标签

“优惠”“会议”等词的比例输入 x = [x₁, x₂]ᵀ
类别标签
普通邮件$y=0$
垃圾邮件$y=1$
训练依据:带标签的样本

词比例仅用于说明特征构造;实际邮件分类通常包含更多特征。

线性得分与决策边界

wz < 0z > 0z = 0x₁x₂
$$z=w^\top x+b$$ $$\hat y=\mathbf1[z\geq0]$$
  • $w$ 决定方向
  • $b$ 决定位置

逻辑函数与类别概率

10.500得分 zσ(0) = 0.5
$$p(y=1\mid x)=\sigma(z)$$ $$\sigma(z)=\frac1{1+e^{-z}}$$

逻辑回归(logistic regression)用于分类。

Stanford CS229,§2:Classification and logistic regression

对数几率的线性结构

$$\log\frac{p}{1-p}=w^\top x+b$$
得分 $z$几率 $p/(1-p)$概率 $p$
$-1$$e^{-1}$$0.269$
$0$$1$$0.500$
$1$$e$$0.731$

得分增加 1,几率乘以 $e$

交叉熵与错误置信度

$$\ell(p,y)=-y\log p-(1-y)\log(1-p)$$
真实标签 y = 1p = 0.9p = 0.1损失 0.1052.303−log p

交叉熵(cross-entropy)惩罚对错误类别的高置信预测。

Cox (1958). The Regression Analysis of Binary Sequences.

逻辑回归的训练更新

线性得分
$z_i$
类别概率
$p_i=\sigma(z_i)$
概率误差
$p_i-y_i$
更新参数
$$L=\frac1n\sum_i\ell(p_i,y_i)+\frac\lambda2\|w\|_2^2$$ $$\nabla_wL=\frac1n\sum_i(p_i-y_i)x_i+\lambda w$$

截距梯度为 $\frac1n\sum_i(p_i-y_i)$;截距不参与正则化。

逻辑回归的概率区域与训练

类别 0类别 1当前阈值边界

80 个合成样本;底色按 $p(y=1\mid x)$ 混合;阈值只改变决策,不重新训练。

概率阈值与决策代价

$$\hat y=\mathbf1[p\geq\tau]\quad\Longleftrightarrow\quad w^\top x+b\geq\log\frac{\tau}{1-\tau}$$
00.50.81较低阈值较高阈值概率估计固定判为类别 1 的区域缩小

Fisher 线性判别分析

线性判别分析(Linear Discriminant Analysis, LDA)

类间分开类内集中

Fisher (1936). The Use of Multiple Measurements in Taxonomic Problems.

投影后的类间与类内变化

二维点
$x_i$
沿方向投影
$t_i=w^\top x_i$
类中心 $m_k$
类内变化 $s_k^2$
$$J_F(w)=\frac{(m_1-m_0)^2}{s_0^2+s_1^2}$$

$m_k=\frac1{n_k}\sum_{y_i=k}t_i$,$s_k^2=\sum_{y_i=k}(t_i-m_k)^2$

这里 $s_k^2$ 表示离差平方和;目标比值与方向向量的长度无关。

投影方向与 Fisher 准则

类别 0类别 1投影方向

60 个带标签合成样本;短竖线为类中心,下图展示实际一维投影。

Fisher 方向的矩阵表达

$$S_W=\sum_{k\in\{0,1\}}\sum_{y_i=k}(x_i-\mu_k)(x_i-\mu_k)^\top$$ $$w^*\propto S_W^{-1}(\mu_1-\mu_0)$$
中心差
描述两类平均位置的变化。
类内散度
降低类内分散方向的影响。

条件:$S_W$ 可逆;奇异时可用正则化或伪逆。scikit-learn:LDA 的数学形式

多分类的一对其余策略

一对其余(One-vs-Rest, OvR):为每类训练一个二分类器。

新闻文本体育 / 财经科技体育 vs. 其余财经 vs. 其余科技 vs. 其余比较三个得分选择得分最大类别

softmax 的多类概率

$$z_k=w_k^\top x+b_k$$ $$p_k=\frac{e^{z_k}}{\sum_{j=1}^{K}e^{z_j}}$$

各类概率之和为 1

数值演示仅调整一个样本的三个得分;多类训练通常最小化真实类别的 $-\log p_y$。

分类任务与模型表达能力

异或模式:需要非线性特征或模型
层次具体选择
学习方式有监督学习
任务分类:离散标签
模型逻辑回归、LDA
表达范围由特征与模型共同决定

两种训练目标与参考文献

方法优化依据输出
逻辑回归条件交叉熵类别概率
Fisher 判别类间 / 类内散度判别投影方向