上海大学 机器学习 · 研究生 第 12 讲 图像无标注预训练 https://kaizhao.net/teaching/shu-ml-grad
第 12 讲

图像无标注预训练

增强视图 · 对比学习 · 遮挡重建 · 下游迁移
输入图像、数值或文本表示可计算的特征目标预测与重建

自监督学习的训练信号

无人工标签图像原始像素构造预测任务配对关系或缺失像素更新图像编码器可迁移表示
自监督学习(self-supervised learning):目标来自数据本身。

同图增强产生正对

同一张图像原始 x随机增强 t₁裁剪、颜色变换随机增强 t₂另一组随机参数视图 x₁保持有用语义视图 x₂保持有用语义正对
增强规则定义模型应忽略哪些变化。

Chen 等,2020:增强组合与对比学习

同一图像的两种增强视图

共同来源确定正对,像素可以明显不同。

程序生成的图像;像素差为实时计算,不代表语义相似度。

SimCLR 的编码器与投影头

SimCLR原论文Figure 2:一张图像经过两次增强,共享编码器和投影头
编码器 f
图像 → 表示 h
投影头 g
表示 h → 对比向量 z
预训练同时更新 f、g;
下游通常保留 f。

Chen 等,2020,Figure 2(原图);视觉表示的简单对比学习框架(A Simple Framework for Contrastive Learning of Visual Representations, SimCLR)。

一个锚点的对比损失

锚点 z当前视图候选相似度点积或余弦正对的概率softmax 归一化
$$L=-\log\frac{\exp(s_+/\tau)}{\exp(s_+/\tau)+\sum_j\exp(s_j^-/\tau)}$$
$s_+$:正对相似度;$s_j^-$:负对相似度;$\tau>0$:温度。

SimCLR:式 (1)

向量夹角、温度与对比损失

概率来自全部候选的相对相似度。

教学设定的二维单位向量;实时计算单个锚点损失。

MoCo 的队列与动量编码器

当前视图输入图像查询编码器梯度更新查询向量 q与字典比较另一视图同图正对动量编码器平滑更新队列中的键新键入队、旧键出队
$$\theta_k\leftarrow m\theta_k+(1-m)\theta_q$$

He 等,2019 / CVPR 2020:Momentum Contrast (MoCo)

表示坍塌与约束

所有输入 → 同一个向量
仅拉近正对
常量表示也能满足。
对比学习:负对提供区分约束。
自蒸馏:需专门的防坍塌设计。

DINO 的教师与学生

图像视图 A局部或全局学生网络梯度更新概率分布 pₛ拟合教师目标图像视图 B全局视图教师网络学生参数移动平均概率分布 pₜ停止梯度
$$L=-\sum_k p_t(k)\log p_s(k)$$

Caron 等,2021:无标签自蒸馏(self-DIstillation with NO labels, DINO)

图块与位置编码

12345678910111213141516每块映射为向量加入位置编码图块 token 序列
视觉 Transformer(Vision Transformer, ViT)处理图块序列。

图块数量与向量维度为结构示意;Dosovitskiy 等,2020 / 2021:Vision Transformer

MAE 的非对称结构

MAE原论文Figure 1:只对可见图块编码,在轻量解码器中加入mask token重建图像
编码器处理可见块;解码器预测缺失块。

He 等,2021 / CVPR 2022,Figure 1(原图);掩码自动编码器(Masked Autoencoder, MAE)。

遮挡重建的输入、目标与损失

可见图块随机遮挡后的输入编码器 + 解码器可训练参数缺失像素预测与原图比较
$$L=\frac1{|M|}\sum_{j\in M}\|\hat x_j-x_j\|^2$$
$M$:被遮挡图块集合;目标 $x_j$ 来自原图。

MAE:Reconstruction target

被遮挡位置的重建损失

$$L(c)=\frac1{|M|}\sum_{j\in M}(c-x_j)^2$$

合成灰度矩阵;常数预测器演示遮挡损失及梯度更新。

预训练后的两种迁移方式

预训练编码器输入完整图像冻结参数提取固定表示线性分类器只训练新分类器预训练编码器输入完整图像允许参数更新编码器参与训练任务输出头联合微调
线性探测(linear probing)与微调(fine-tuning)。

三类自监督目标的对应关系

方法输入训练目标
SimCLR / MoCo同图增强视图识别正对
DINO同图不同视图匹配教师分布
MAE可见图块恢复缺失像素
预训练目标塑造表示;下游任务检验表示。

预训练数据与迁移边界

数据收集图像来源去重与筛选分布与质量预训练学习表示下游评估独立测试
背景偏差、重复样本与域变化会影响迁移。

代表文献

  1. Chen et al. (2020). A Simple Framework for Contrastive Learning of Visual Representations.
  2. He et al. (2019; CVPR 2020). Momentum Contrast for Unsupervised Visual Representation Learning.
  3. Caron et al. (2021). Emerging Properties in Self-Supervised Vision Transformers.
  4. He et al. (2021; CVPR 2022). Masked Autoencoders Are Scalable Vision Learners.
  5. Dosovitskiy et al. (2020; ICLR 2021). An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.