第 5 讲
线性分类
线性得分、逻辑概率与 Fisher 判别
邮件分类中的输入与标签
词比例仅用于说明特征构造;实际邮件分类通常包含更多特征。
线性得分与决策边界
$$z=w^\top x+b$$ $$\hat y=\mathbf1[z\geq0]$$
对数几率的线性结构
$$\log\frac{p}{1-p}=w^\top x+b$$
| 得分 $z$ | 几率 $p/(1-p)$ | 概率 $p$ |
|---|
| $-1$ | $e^{-1}$ | $0.269$ |
| $0$ | $1$ | $0.500$ |
| $1$ | $e$ | $0.731$ |
得分增加 1,几率乘以 $e$。
交叉熵与错误置信度
$$\ell(p,y)=-y\log p-(1-y)\log(1-p)$$
交叉熵(cross-entropy)惩罚对错误类别的高置信预测。
Cox (1958). The Regression Analysis of Binary Sequences.
逻辑回归的训练更新
线性得分
$z_i$
→
类别概率
$p_i=\sigma(z_i)$
→
概率误差
$p_i-y_i$
→
更新参数
$$L=\frac1n\sum_i\ell(p_i,y_i)+\frac\lambda2\|w\|_2^2$$ $$\nabla_wL=\frac1n\sum_i(p_i-y_i)x_i+\lambda w$$
截距梯度为 $\frac1n\sum_i(p_i-y_i)$;截距不参与正则化。
逻辑回归的概率区域与训练
80 个合成样本;底色按 $p(y=1\mid x)$ 混合;阈值只改变决策,不重新训练。
概率阈值与决策代价
$$\hat y=\mathbf1[p\geq\tau]\quad\Longleftrightarrow\quad w^\top x+b\geq\log\frac{\tau}{1-\tau}$$
投影后的类间与类内变化
二维点
$x_i$
→
沿方向投影
$t_i=w^\top x_i$
→
类中心 $m_k$
类内变化 $s_k^2$
$$J_F(w)=\frac{(m_1-m_0)^2}{s_0^2+s_1^2}$$
$m_k=\frac1{n_k}\sum_{y_i=k}t_i$,$s_k^2=\sum_{y_i=k}(t_i-m_k)^2$
这里 $s_k^2$ 表示离差平方和;目标比值与方向向量的长度无关。
投影方向与 Fisher 准则
60 个带标签合成样本;短竖线为类中心,下图展示实际一维投影。
Fisher 方向的矩阵表达
$$S_W=\sum_{k\in\{0,1\}}\sum_{y_i=k}(x_i-\mu_k)(x_i-\mu_k)^\top$$ $$w^*\propto S_W^{-1}(\mu_1-\mu_0)$$
中心差
描述两类平均位置的变化。
类内散度
降低类内分散方向的影响。
条件:$S_W$ 可逆;奇异时可用正则化或伪逆。scikit-learn:LDA 的数学形式
多分类的一对其余策略
一对其余(One-vs-Rest, OvR):为每类训练一个二分类器。
softmax 的多类概率
$$z_k=w_k^\top x+b_k$$ $$p_k=\frac{e^{z_k}}{\sum_{j=1}^{K}e^{z_j}}$$
数值演示仅调整一个样本的三个得分;多类训练通常最小化真实类别的 $-\log p_y$。
分类任务与模型表达能力
| 层次 | 具体选择 |
|---|
| 学习方式 | 有监督学习 |
| 任务 | 分类:离散标签 |
| 模型 | 逻辑回归、LDA |
| 表达范围 | 由特征与模型共同决定 |
两种训练目标与参考文献
| 方法 | 优化依据 | 输出 |
|---|
| 逻辑回归 | 条件交叉熵 | 类别概率 |
| Fisher 判别 | 类间 / 类内散度 | 判别投影方向 |
第 5 讲结束
← → 翻页 · o 总览 · s 演讲者视图 ·
f 全屏 · 网址后加 ?print-pdf 可导出 PDF