上海大学 机器学习 · 研究生 第 1 讲 机器学习基本概念 https://kaizhao.net/teaching/shu-ml-grad
上海大学

机器学习 Machine Learning

课程性质
研究生课程
上课安排
周一下午 · 09/14—11/02
先修要求
线性代数、概率论、多元微积分
https://kaizhao.net/teaching/shu-ml-grad

全部课件在此发布,可在线放映,也可导出 PDF。

考核方式

总成绩构成 平时成绩占 50%,包括考勤 10%、presentation 30%、QA 10%;开卷考试占 50%。 10% 30% 10% 50% 总成绩 100%
平时成绩 50%
考勤10% presentation30% QA10%
开卷考试50%
可带教材与笔记

各项比例均占总成绩;QA(Questions and Answers)为问答环节。

参考教材

机器学习
机器学习
周志华 著
清华大学出版社
覆盖面广,例子直观。本课章节与之对照
统计学习方法
统计学习方法
(第 2 版)
李航 著
清华大学出版社
推导完整、记号严谨。公式细节以此书为准

课程安排

2026 年秋季 · 周一下午 · 7 次到课(含考试)

日期课堂安排
09/14教师讲授 3 节 + 分组 1 节
09/21教师讲授 2 节 + 4 组汇报 2 节
09/28教师讲授 2 节 + 4 组汇报 2 节
10/05国庆节放假 · 停课一次
10/12教师讲授 2 节 + 4 组汇报 2 节
10/19教师讲授 2 节 + 4 组汇报 2 节
10/26教师讲授 2 节 + 4 组汇报 2 节
11/024 组汇报 90 分钟 + 考试 2 小时

学生汇报

每组控制在 15 分钟
其中 10 分钟 PPT 汇报,剩余时间提问交流

结合研究方向,讲解一篇近五年的研究型论文。
选题与讲解要求 →
课程分组共享文档二维码,扫码填写分组信息

填写分组信息

26—27 学年研究生机器学习课程微信群二维码,扫码加入课程微信群

加入课程微信群

每节课 45 分钟;11/02 的开卷考试为完整 2 小时。

学生汇报要求

结合组员兴趣与研究方向,选取近五年的一篇交叉领域研究型论文
机器学习 × 感兴趣的研究方向;不接受综述论文。

时间安排:每组 15 分钟,其中 10 分钟 PPT 汇报,剩余时间提问交流。

① 应用背景

实际问题是什么?为什么值得解决?
用一个具体场景说明研究动机。

② 任务与学习方式

输入 → 输出:分类、回归、聚类或决策。
有监督、无监督或强化学习:训练信号从哪里来?

③ 模型如何工作

用一个样本走完:输入 → 关键步骤 → 输出。
解释模型的核心机制与设计理由。

例如:卷积神经网络、支持向量机、Transformer。

④ 结果与自己的理解

与什么方法比较?改善了什么?
选取关键结果,说明适用条件与局限。

费曼学习法:用自己的话,从具体例子讲起,先解释必要术语。
讲解的标准:没有该领域背景的研一同学也能听懂

任课教师

赵凯
赵 凯 Kai Zhao
上海大学 · 副教授
kz@kaizhao.net
机器学习计算机视觉

教育背景

2017—2020
南开大学 计算机科学与技术 博士 · 导师 程明明 教授
2014—2017
上海大学 硕士 · 导师 沈为 教授
2010—2014
上海大学 本科

工作经历

2025.08—至今
上海大学 副教授
2022.03—2025.07
加州大学洛杉矶分校(UCLA) 博士后
2020.10—2022.02
腾讯优图实验室 高级研究员 · 校招 T9 技术专家
2018.09—2019.01
松下研发中心(新加坡) 研究实习

课程内容

  1. 1机器学习基本概念
  2. 2学习问题的形式化
  3. 3模型评估与选择
  4. 4有监督学习:线性回归
  5. 5线性分类:判别分析与多分类学习
  6. 6决策树
  7. 7贝叶斯分类器
  8. 8支持向量机与核方法
  9. 9无监督学习:聚类与 EM 算法
  10. 10神经网络与特征提取
  11. 11特征降维与表示
  12. 12图像的无标注预训练
  13. 13语言模型的无标注预训练
第 1 讲

机器学习基本概念

基本概念、发展历程与应用领域
概念与模型 · 发展历程 · 学习方式与工具 · 应用领域

本讲内容

  1. 概念与模型:输入、输出与待学习的参数
  2. 发展历程:学习程序、统计学习、深层网络与预训练
  3. 学习方式与工具:训练信号与编程流程
  4. 应用与适用边界:数据领域、典型案例与适用条件

机器学习的定义

朴素的说法

机器学习是从数据中确定规则的方法。
人规定候选规则的范围与评判优劣的标准, 程序依据数据确定具体的规则,并用于处理未见过的输入。
人给什么机器给什么
传统编程规则处理结果
机器学习数据 + 标准规则
一般程序 · 规则驱动 vs 机器学习程序 · 数据驱动

Mitchell 的形式定义(1997)

一个程序在完成任务 T 时,其由指标 P 度量的性能, 随着经验 E 的积累而改善,则称该程序就 T 和 P 而言,从 E 中学习
垃圾邮件过滤
T 任务把邮件判为垃圾/正常
P 指标判对的比例
E 经验用户标记过的历史邮件

该定义使"学习"成为可测量的对象:缺少 P 则无法判定是否发生了学习。

边界:判据只有一条

把程序的行为拆成人写死的代码从数据里定出来的参数两部分。
后者存在,而且对行为起决定作用 —— 就是机器学习。
程序是否 ML为什么
快速排序 行为完全由代码决定,与所见数据无关
用高斯消元解线性方程组 精确算法,答案由输入唯一确定,没有"参数"可言
风控规则库:if 月收入<5000 and 逾期次数>2: 拒绝 阈值由业务专家设定;改变行为需修改代码
同一套风控,但阈值由历史坏账数据拟合而来 代码不变,数据改变则行为改变
统计每个词在垃圾邮件中的出现频率,据此打分 朴素贝叶斯(naive Bayes)。参数就是数据的统计量(第 7 讲)
人工整定参数的 PID 控制器参数由人工整定
数据库查询优化器,代价模型是人写的公式
同一个优化器,代价模型从执行历史学出来

后四行两两成对:任务与代码结构相同,差别仅在于参数的来源

房价预测:模型与参数

训练房屋 测试房屋 当前预测 曲面高度与颜色:预测总价
$\hat y=\sum_{i+j\le n}w_{ij}x_1^i x_2^j=W^\top X$
次数 $n$:人工设定;系数 $w_{ij}$:从训练数据学习
参数对应项学到的数值

机器学习的发展历程

从1950年代学习程序到预训练的上升时间线,七个节点分别配有方法示意图

年份间距为示意;上升表示方法与应用的发展。

1950 年代:从经验中调整规则

Frank Rosenblatt · 1958

感知机(perceptron):学习分类权重

Arthur Samuel · 1959

跳棋程序:学习局面评分

感知机调整权重与跳棋程序学习评分函数

1986—1995:表示学习与统计学习

反向传播 · 1986

Rumelhart · Hinton · Williams

支持向量机 · 1995

Cortes · Vapnik

多层神经网络反向传播和最大间隔分类边界

2006—2012:深层网络与图像识别

Hinton · Osindero · Teh:深度信念网络的逐层预训练

2006逐层预训练流程和2012图像分类的数据模型算力组合

AlexNet:Krizhevsky · Sutskever · Hinton,2012

A fast learning algorithm for deep belief nets (2006) · ImageNet Classification with Deep Convolutional Neural Networks (2012)

2017—2022:注意力与无标注预训练

Vaswani 等:Transformer,2017 · 用数据自身构造学习目标

Transformer衔接文本掩码预测和图像遮挡重建

Attention Is All You Need (2017) · BERT (Devlin et al., 2018/2019) · Masked Autoencoders (He et al., 2021/2022)

学习方式与训练信号

有监督学习

supervised learning
面积 · 距离↓ 配对成交总价

给定输入与标签 $(x,y)$

学习输入到输出的映射

无监督学习

unsupervised learning

给定数据 $x$

发现结构、分组或表示

强化学习

reinforcement learning
智能体 → 动作 → 环境↑ 奖励与新状态 ↲

通过交互获得奖励

学习长期回报更高的策略
分类 / 回归描述预测任务;有监督 / 无监督 / 强化描述学习方式。

回归与分类

同一套房屋的特征 $x$:面积、位置、户型……

回归 regression

连续数值:预测数值大小

房屋总价 328.5 万元 200250300350400
输出 $y$:一个数值

分类 classification

离散类别:判断类别归属

房屋用途 住宅 住宅商铺办公
输出 $y$:一个类别标签
按预测目标 $y$ 划分任务;回归与分类都可以用有监督学习完成。

自监督学习:从数据自身获得目标

自监督学习(self-supervised learning)

原始文本今天的天气很好
隐藏一部分今天的天气很 [MASK]
预测原内容目标:好
预训练
用大量无人工标注数据学习表示
下游任务
用已有表示完成分类、回归或生成

半监督学习(semi-supervised learning):同时利用少量有标签样本与大量无标签样本。

机器学习的编程工具

开发环境 Python · JupyterLab · VS Code · Conda语言 / 交互笔记本 / 编辑器 / 环境管理
01 → 数据

整理与数值计算

pandas表格、清洗、统计

NumPy多维数组与数值运算

SciPy优化、积分、统计方法

02 → 模型

建模与训练

scikit-learn回归、分类、聚类与评估

PyTorch张量、自动求导、神经网络

TensorFlow神经网络训练与部署

03 → 实验

观察与复现

Matplotlib画数据、误差与结果

MLflow记录参数、指标、模型

Git代码版本与协作

CUDA NVIDIA GPU 并行计算平台为支持 GPU 的训练框架提供计算加速

不同的输入数据与应用领域

机器学习从各领域的 $x$ 中学习规律,服务于不同任务。

图像与视频
街道中的车辆:计算机视觉处理的图像输入

计算机视觉

Computer Vision · CV

目标识别 · 图像分割

语言与文本
这篇论文研究什么?从文本中提取信息

自然语言处理

Natural Language Processing · NLP

翻译 · 问答 · 文本生成

语音与音频

语音与音频处理

Speech & Audio Processing

语音识别 · 合成 · 分离

蛋白质与分子序列
M A L W M R L LP L L A L L A L氨基酸序列示意

计算生物学

Computational Biology

结构预测 · 分子设计

领域决定数据与问题,机器学习提供学习模型的方法

前沿应用:六个案例

① 蛋白质结构预测
序列 → 结构
② 小分子药物发现
分子筛选
③ 个体化癌症疫苗
抗原排序
④ 数值天气预报
预报
⑤ 自动驾驶
感知 · 规划
⑥ 大语言模型
文本生成

① 蛋白质结构预测

蛋白质的功能与其化学组成、氨基酸序列及三维结构密切相关。 由氨基酸序列推定三维结构是生物学悬置半个世纪的问题。

1基因测序得到氨基酸序列
2预测三维结构序列 → 原子坐标
3推断功能活性位点、结合口袋
4下游应用药物设计、酶工程
蛋白质的一级到四级结构
从序列到形状一级结构(序列)决定最终的三维折叠
结构预测得到的三维模型
预测出的三维结构输入只有序列,输出是原子坐标

ML 替代了什么

  • 第 2 步原先依赖实验测定(X 射线晶体学、冷冻电镜 cryo-EM)
  • 单个蛋白耗时数月至数年,且大量蛋白无法结晶
  • 现可在数分钟内完成,覆盖此前无法测定的绝大多数蛋白

本质上是什么学习问题

输入 x
氨基酸序列 + 同源序列比对
输出 y
每个原子的三维坐标
训练数据
已有实验结构数据库(约 20 万个)
关键设计
把"两个残基的相对位置"作为预测对象, 使模型对整体平移旋转不敏感
蛋白质结构预测与蛋白质设计相关工作获2024 年诺贝尔化学奖

② 小分子药物发现

新药研发周期约 十年,投入达 十亿美元量级,九成以上于临床阶段失败。

1选靶点哪个蛋白该被抑制
2虚拟筛选10⁹ 级化合物库排序
3性质预测毒性、溶解度、代谢(合称 ADMET 性质)
4合成与实验只做排在前面的几十个
5临床试验人体
小分子与靶点蛋白的结合
分子与靶点的结合模型要预测的就是这个结合有多强
高通量筛选的实验机械臂
湿实验筛选机械臂一次几百孔,仍远不够穷举

靶点 · HIV · 血红蛋白

机器学习解决什么问题

  • 承担第 2、3 步。类药分子空间约 1060,无法逐一实验
  • 模型的任务是排序,选出最值得合成的数十个候选
  • 第 4、5 步仍由实验与人体试验承担,药效与安全性只能由其判定

本质上是什么学习问题

输入 x
分子的图结构(原子为点,化学键为边)
输出 y
结合亲和力、毒性、口服吸收率……
难点
正样本极少;评价指标为前 k 个候选中的命中数

已有多个由 AI 参与靶点发现与分子设计的候选药物进入临床试验。

③ 个体化癌症疫苗 Moderna · Merck

1取材肿瘤组织 + 血样
2测序找出体细胞突变
3预测呈递哪些突变肽能被展示
4排序筛选最多 34 种新抗原
5合成 mRNA编码入一条链
6注射体内翻译出这些肽

呈递:细胞把抗原片段展示在表面,让 T 细胞识别。

机器学习承担第 3、4 步

  • 每位患者具有不同的肿瘤突变
  • V940 编码最多 34 种肿瘤新抗原
  • 优先筛选可能激活免疫反应的候选

新抗原:肿瘤突变产生、可供免疫系统识别的蛋白片段。

学习任务

输入
肿瘤突变 + 患者免疫特征
输出
被呈递的概率
形态
排序,筛选候选新抗原
Moderna 与默沙东联合开发的个体化癌症疫苗 V940 与免疫治疗联用,在三期试验中较单用免疫治疗, 延长了黑色素瘤(一种皮肤癌)患者术后未复发、未发生远处转移的生存时间。

来源:Moderna 与默沙东联合公告,2026-08-19

④ 数值天气预报

传统做法

观测同化卫星、探空 → 初始场
解偏微分方程逐步推进,超算数小时

机器学习做法

观测同化这一步未变
神经网络推进学"当前场 → 6 小时后"
输入 x
当前全球网格上的气压、温度、湿度、风场
输出 y
数小时后同一网格上的同一批量
训练数据
四十余年的再分析资料(reanalysis)
热带气旋
热带气旋路径预报提升最明显
全球云系
全球观测模型输入即此类网格
欧洲中期天气预报中心的机器学习预报 2025 年 2 月转入业务运行; 热带气旋路径等指标提升可达约 20%,算力低几个数量级。

⑤ 自动驾驶:感知与预测

1传感器摄像头、激光雷达
2感知目标识别与定位
3预测未来运动轨迹
Waymo 摄像头画面中的车辆与行人检测框
图像中的目标识别
Waymo 激光雷达点云中的三维目标
点云中的三维目标

计算机视觉(Computer Vision, CV)

环节模型输出
感知类别、位置、速度
预测未来轨迹分布
配备多种传感器的 Waymo 自动驾驶车辆
Waymo · 多传感器融合

图与技术说明:Waymo Driver Handbook · Perception

⑤ 自动驾驶:决策与 planning

环节输出
决策让行、跟车、变道
规划(planning)位置与速度轨迹
控制转向、加速、制动

强化学习(Reinforcement Learning, RL)

状态
动作
新状态与奖励
在仿真交互中优化驾驶策略
避碰 · 行驶进度 · 舒适性
NVIDIA 自动驾驶强化学习流程:仿真器提供传感器数据,模型产生驾驶动作,根据交互结果更新模型参数
NVIDIA AlpaGym · 仿真交互与策略更新

图与案例:NVIDIA · 自动驾驶模型的闭环强化学习训练

⑥ 大语言模型

ChatGPT
ChatGPT
OpenAI
Claude
Claude
Anthropic
Gemini
Gemini
Google DeepMind
DeepSeek
DeepSeek
深度求索

常见训练流程

预训练海量文本上预测下一个 token,无需人工标注
监督微调少量高质量问答示范
偏好对齐人工成对比较 → 奖励模型 → 强化学习

奖励模型依据人工偏好比较学习评分。

关键学习环节

训练目标预测下一个 token
训练方法梯度更新参数
注意力机制利用上下文信息
后训练改善指令遵循与回答质量

什么问题适合用机器学习

适用性判断的四个方面:

条件反例
① 存在模式 彩票号码、公平硬币的下一次结果
② 模式无法显式表述 判断闰年、算圆面积、求最短路
③ 有代表性的数据
训练分布 ≈ 部署分布
最常被低估的一条
④ 错误可承受 统计模型必然产生错误
能够凭经验做到,但是无法准确描述
准确描述 形式逻辑 closed form(闭式表达)

补充阅读:Borwein & Crandall, Closed Forms: What They Are and Why We Care(PDF)

什么问题不该用机器学习

情形为什么该用什么
问题可以精确求解 确定性算法具有正确性保证,机器学习仅给出统计意义上的近似 数值方法、组合优化
拿不到数据,或数据与部署场景分布差很远 训练分布与使用分布不一致时,验证集上的成绩不具参考价值 先解决数据问题
每个决定都必须能逐条解释、可追责 信贷拒绝、司法量刑、医疗诊断有法律和伦理要求 可解释模型,或作为辅助而非决策者
样本极少,且没有可用的先验知识 估计误差占主导,所得模型主要反映噪声 机理模型、专家规则
目标本身定义不清 如"提升用户幸福感"缺少可测量的 P,无法优化,亦无法判定成败 先把目标变成可测量的东西
系统的输出会反过来改变数据分布 推荐系统改变用户行为、交易策略被对手学习,训练时的分布不再成立 因果推断、在线学习、博弈论
最后一项的代价最大,且最易被忽视:模型上线后即成为未来数据的成因之一, 独立同分布(independent and identically distributed, i.i.d.)假设自此不再成立(第 2 讲)。

本讲小结

  • 核心:从数据中学习模型
  • 发展:学习规则、学习表示、迁移预训练模型
  • 任务:预测、筛选、生成与决策
  • 适用:规律可学、数据可用、效果可检验

延伸阅读

教材对应章节

  • 周志华《机器学习》
    第 1 章 1.1–1.2:基本术语与研究对象
  • 李航《统计学习方法》
    第 1 章 1.1–1.2:统计学习的定义与三要素

本讲案例的原始来源

案例可核查的出处
蛋白质结构预测 2024 年诺贝尔化学奖公告(瑞典皇家科学院)
个体化癌症疫苗 三期试验 INTerpath-001(NCT05933577)结果公告;
二期 KEYNOTE-942,The Lancet 2024
机器学习天气预报 欧洲中期天气预报中心(ECMWF)业务化运行公告,2025-02
自动驾驶 Waymo Driver HandbookNVIDIA AlpaGym 技术文档