上海大学 机器学习 · 研究生 第 13 讲 语言模型预训练 https://kaizhao.net/teaching/shu-ml-grad
第 13 讲

语言模型预训练

token 表示 · attention · 掩码预测 · 自回归生成
输入图像、数值或文本表示可计算的特征目标预测与重建

文本自身产生预测目标

原文今天 天气 晴朗输入上下文今天 天气目标 token晴朗原文今天 天气 晴朗带掩码输入今天 天气 [MASK]目标 token晴朗

大型语言模型(Large Language Model, LLM);分词为教学示意。

token 化与嵌入向量

文本学习机器学习token 编号[17, 203, 17]嵌入向量每个编号查一行参数
$$e_t=E[\mathrm{id}_t]+p_t$$
编号用于索引;向量参数承载表示。

attention 的查询、键与值

查询 q当前位置需求与各键 k 比较相关性得分权重 α总和为 1加权汇总值 v得到上下文表示
$$\alpha_j=\frac{\exp(q^{\mathsf T}k_j/\sqrt d)}{\sum_l\exp(q^{\mathsf T}k_l/\sqrt d)},\quad h=\sum_j\alpha_jv_j$$

Vaswani 等,2017:Scaled Dot-Product Attention

attention 权重与因果掩码

因果掩码限制可读取的位置

三 token、二维设定向量;实际计算 softmax 与加权和。

Transformer 块的结构

输入表示token + 位置多头 attention跨位置汇总逐位置前馈网络逐位置非线性输出表示供下一层处理残差连接:保留输入并加上新计算加法与层归一化加法与层归一化
多头:多组查询、键、值并行计算。

Attention Is All You Need,2017

BERT 的双向预训练

BERT原论文Figure 1:无标注文本预训练及多个下游任务微调
用左右上下文,预测被选中的原始 token。

Devlin 等,2018 / 2019,Figure 1(原图);双向 Transformer 编码表示(Bidirectional Encoder Representations from Transformers, BERT)。

掩码语言模型的训练目标

原文 token猫 坐在 垫子 上选中若干位置猫 [MASK] 垫子 上预测原编号坐在
$$L_{\mathrm{MLM}}=-\sum_{t\in M}\log p_\theta(x_t\mid\widetilde x)$$
只在选中位置计算预测损失。

掩码语言模型(Masked Language Modeling, MLM);BERT §3.1

GPT 的自回归预训练

2018年GPT论文Figure 1:Transformer结构、语言模型目标以及下游任务输入格式
左侧上下文 → 下一 token 的概率。

Radford 等,2018:Improving Language Understanding by Generative Pre-Training,Figure 1(原图);生成式预训练 Transformer(Generative Pre-trained Transformer, GPT)。

下一 token 预测的序列分解

$$p_\theta(x_1,\ldots,x_T)=\prod_{t=1}^{T}p_\theta(x_t\mid x_{
$$L=-\sum_{t=1}^{T}\log p_\theta(x_t\mid x_{输入 token今天 / 天气因果 Transformer只能读取左侧及当前右移一位的目标天气 / 晴朗

预测位置与交叉熵损失

$$L_t=-\log p_\theta(\text{正确 token})$$

人工 token 序列与候选得分;实时计算单位置交叉熵。

预训练语料与数据处理

代表工作论文描述的语料
GPT · 2018BooksCorpus
BERT · 2018 / 2019BooksCorpus、英文 Wikipedia
GPT-3 · 2020网页、书籍、Wikipedia 等混合语料
收集文本来源范围清洗与去重质量与重复token 化离散编号构造训练序列输入与目标

GPT §4.1BERT §3.1GPT-3 §2.2

GPT-3 与上下文学习

任务说明英译中少量示例cat → 猫新输入dog →继续生成
上下文学习:给出示例,保持模型参数不变

Brown 等,2020:Language Models are Few-Shot Learners;图示为任务格式示例。

预训练与后训练

预训练原文预测目标监督微调指令与示范回答偏好对齐偏好数据
阶段训练信号
监督微调示范回答上的 token 损失
偏好对齐回答比较或奖励信号

监督微调(Supervised Fine-Tuning, SFT);Ouyang 等,2022:Training language models to follow instructions with human feedback

温度采样与生成分布

$$p_i=\frac{e^{s_i/\tau}}{\sum_j e^{s_j/\tau}}$$

固定四 token 得分;实时采样同一位置,不调用语言模型。

生成能力与可靠性边界

上下文有限窗口概率分布模型预测采样 token可能多种结果追加到上下文继续下一步
语言概率衡量续写倾向;事实正确性需要外部检验。

掩码预测与因果预测的对照

维度BERT 式掩码预测GPT 式因果预测
可用上下文两侧可见 token左侧 token
损失位置选中的位置各下一 token 位置
直接训练用途恢复被选中 token预测后续 token
下游使用编码表示、任务微调续写、提示、任务微调
架构限制信息流;目标规定要预测的内容。

代表文献

  1. Vaswani et al. (2017). Attention Is All You Need.
  2. Devlin et al. (2018; NAACL 2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.
  3. Radford et al. (2018). Improving Language Understanding by Generative Pre-Training.
  4. Brown et al. (2020). Language Models are Few-Shot Learners.
  5. Ouyang et al. (2022). Training language models to follow instructions with human feedback.