
8 月 10 日,2026 夏季 InfiniTensor 训练营训练系统方向第五课《强化学习基础与 DeepSeek 训练介绍》开讲。
前置课程《训练框架编程基础》讲解了 PyTorch Tensor、动态自动求导 autograd、网络模块、优化器与标准训练循环等内容;并介绍了 checkpoint、混合精度、梯度累积等工程工具以及 Megatron-LM 大模型框架。
本节课将讲解强化学习核心理论与经典算法,涵盖马尔可夫决策过程、Q-Learning、DQN、策略梯度、Actor-Critic及 PPO 等关键知识点,同时介绍 DeepSeek V3 至 V4 的架构演进。
强化学习基础
强化学习概述
1. 强化学习特点及应用场景

2. 核心定义
- 强化学习是一种让机器通过与环境之间的不断交互,来学习如何实现目标的计算方法。
- 不给机器提供标准答案,而是让它像一个探索者一样,在尝试中学习哪些行为带来好的结果、哪些导致惩罚,从而逐步学会做出更优决策。
3. 强化学习要素

交互闭环:
- 智能体观察状态 → 选择动作 → 动作作用于环境 → 环境返回新状态 + 即时奖励 → 循环
马尔可夫过程

1. 马尔可夫性质
- 定义:当且仅当某一时刻的状态只取决于上一时刻的状态时,该随机过程具有马尔可夫性质
- 含义:当前状态是未来的充分统计量,下一个状态只取决于当前状态,不受过去状态影响
- 链式传递:T+1 时刻状态只与 T 时刻有关,但 T 时刻状态实际包含了所有 T-1 时刻的信息
- 优势:大大简化运算,只需当前状态即可决定未来
2. 马尔可夫过程的描述
- S:有限数量的状态集合
- P:状态转移矩阵(第 i 行第 j 列代表从 Sᵢ 转移到 Sⱼ 的概率)
- 从每个状态出发,转移到其他状态的概率总和为 1
- 终止状态:没有概率转移到其他状态(以概率 1 转移到自身)
3. 采样
- 给定马尔可夫过程,从某一状态出发,根据状态转移矩阵生成状态序列
马尔可夫奖励过程

1. MRP 的四元组定义:(S, P, R, γ)
- S:有限状态集合
- P:状态转移概率矩阵
- R:奖励函数——处于状态 S 时获得即时奖励的期望值
- γ :折扣因子(取值范围 [0, 1]),用于计算未来奖励的现值
2. 折扣因子 γ 的三大作用
- 风险控制:越遥远的未来不确定性越大,对未来奖励打折是合理的风险控制
- 时间偏好:反映"宁愿现在拿 100 元也不愿一年后拿 110 元"的现实偏好
- 数学必要性:防止无限持续过程的累积奖励发散至无穷,保证回报总和有界
3. 回报 Gₜ

- 从时间 T 开始,所有未来奖励按折扣因子 γ 衰减后的累加总和
- γ → 0:智能体更关注眼前利益
- γ → 1:智能体更重视长期回报
4. 价值函数 V(s)
- 定义:从状态 S 出发所能获得的期望回报,反映处于该状态有多好
- 贝尔曼方程 (Bellman Equation):

5. 价值函数的求解
- 解析解:整理为线性方程组,可直接算出每个状态的准确价值
- 迭代算法(适用于大规模 MRP):
- 动态规划
- 时序差分学习
马尔可夫决策过程

1.MDP 的五元组定义:(S, A, P, R, γ)
- 在 MRP 基础上加入 A(动作集合)
- 状态转移函数和奖励函数都多了动作作为自变量
- 存在智能体来执行动作,是一个与时间相关的、智能体与环境不断交互的循环过程
2. 策略 (Policy) π
- π(a|s):在状态 S 下采取动作 A 的概率
- 确定性策略:每个状态只输出一个确定动作(概率为 1)
- 随机性策略:输出动作的概率分布,根据分布采样得到动作
- 由于马尔可夫性质,策略只需与当前状态有关
3. 状态价值函数 与 动作价值函数

4. 最优策略 (Optimal Policy)

- 策略优劣比较:对所有状态 s,若 V^π*(s) ≥ V^π(s),则 π* 不差于 π
- 有限状态、有限动作的 MDP 中至少存在一个最优策略
- 最优策略可能有多个,但最优价值函数唯一
- 贝尔曼最优方程:最优价值函数可用自身递归表示 —— 状态价值 = 当前奖励 + 折扣后的未来最优价值
经典强化学习算法

Q-Learning
1. 核心思想
- 维护一张 Q 表 (Q-Table),Q(s, a) 表示在状态 S 下执行动作 A 长期来看能获得多少回报
- 不需要提前建立环境模型(Model-Free),通过与环境交互不断修正 Q 值
2. 更新机制
- 计算 Target Q 值:即时奖励 R + γ × max Q(s', a')
- 计算 TD Error(时序差分误差):Target - 当前 Q 值,反映之前估计是偏高还是偏低
- 更新 Q 值:Q(s,a) ← Q(s,a) + α × TD Error(α 为学习率,控制每次调整幅度)
3. 完整学习流程
初始化 Q 表 → 观察状态 S → 选择动作 A → 执行 A → 获得奖励 R + 新状态 S'
→ 计算 Target → 更新 Q(s,a) → S' 作为新状态 → 重复经过大量交互后,在每个状态下选择 Q 值最大的动作即为最优策略
DQN 算法 (Deep Q-Network)

1. 从 Q 表到神经网络
- Q 表的局限:状态/动作空间大或连续时无法枚举(如游戏画面的每个像素变化)
- DQN 核心思想:用神经网络近似 Q 函数,输入当前状态,输出各动作对应的 Q 值向量
2. 目标网络 (Target Network)
- 问题:TD 目标依赖 Q 网络自身输出,直接用同一网络会导致训练目标频繁变动、训练不稳定
- 解决方案:使用两套网络
- 主网络:用于预测 Q 值并持续更新
- 目标网络:用于计算 Target Q 值,参数暂时固定,定期同步
3. 应用实例:Flappy Bird
- 使用 PyTorch 实现

基于策略的方法——策略梯度

1. 参数化策略:策略表示为带参数 θ 的函数,输入状态,输出各动作概率
2. 轨迹 (Trajectory) τ:从初始状态开始,经历一系列状态和动作形成的序列
3. 轨迹概率:由初始状态分布、策略选择的动作、环境状态转移三部分决定
4. 优化目标:调整参数 θ,使模型更容易生成高回报的轨迹
5. 核心思想:不学习 Q 值再决定动作,而是直接参数化策略,通过优化 θ 提高高回报轨迹出现的概率
Actor-Critic(演员-评论家算法)

1. 整体框架
- 本质仍属于基于策略的方法,但同时学习策略函数和价值函数
- Actor(演员):做决策、选动作、输出策略 π_θ
- Critic(评论家):评价决策好不好,学习状态价值函数 V(s)
2. 优势函数
- 定义:A(s, a) = Q(s, a) - V(s)
- 衡量在当前状态下选择某个动作相比平均表现好多少
- A > 0:该动作优于平均水平 → 提高选择概率
- A < 0:该动作低于平均水平 → 降低选择概率
3. 用 TD Error 近似优势函数
- 实际中无法直接计算准确的 Q 值,用 TD Error 近似
- TD Error = 用于衡量实际获得结果与 Critic 当前估计之间的差异
- TD Error > 0:实际结果比预期好
- TD Error < 0:实际结果比预期差
- 双重作用:
- Critic 利用 TD Error 修正价值估计
- 作为 Actor 更新策略的优势信号
PPO(近端策略优化)

1.核心思想:
- 结合优势函数(告诉策略往哪个方向更新)和裁剪机制(限制更新幅度)
- 通过多次小幅度稳定更新,逐步提升策略性能
2. 在大语言模型训练中的应用

3. 优化阶段的两大约束机制
- 参考模型 (Reference Model):通常为冻结的 SFT 模型,用于约束当前策略模型不要偏离原始语言能力,通过 KL 散度控制策略变化幅
- KL 散度约束:衡量当前模型与参考模型的差别,差别太大则减少更新幅度
- 目的:让模型进步,但不能一次变化太多
DeepSeek 架构演进

DeepSeek V3
1. MoE(混合专家模型)
- 超大规模参数 + 稀疏激活
- 总参数量 671B,每个 token 仅激活 37B 参数
- 在保持超大模型容量的同时控制单 token 的实际计算成本

2. MLA(多头潜在注意力)
- 将 Key 和 Value 压缩到更低维的潜在表示再存入 KV Cache
- 使用时通过投影恢复
- 核心作用:显著降低推理过程中 KV Cache 的显存占用
DeepSeek R1

- 对于数学、代码等具有明确验证标准的任务,可以通过规则获得可验证奖励,从而减少对人工评分的依赖
- 与强化学习理论的对应:模型生成推理过程和答案 → 环境给出可验证奖励 → 强化学习调整策略
DeepSeek V3.2

1. DSA(稀疏注意力 - DeepSeek Sparse Attention)
(1)背景问题:
- 常规 Attention 中当前 token 关注所有历史 token,计算复杂度关于序列长度呈平方增长
- 序列越长,计算和显存成本飞速增长,KV Cache 压力巨大
(2)经典方法——滑动窗口注意力:
- 当前 token 只关注最近 W 个 token,复杂度降至 O(L×W)
- 局限:仅按位置固定选择,不知道哪些历史信息真正重要

(3)DSA 的创新:
- 与滑动窗口的区别:根据内容相关性动态选择(而非按位置固定选择)
- 两大组件:
- Lightning Indexer(索引器):根据当前 Query 和历史 Token 的表示计算相关性分数
- Token Selector(选择器):根据分数挑选相关 Token,仅在选中的 Token 上执行 Attention 计算
- 若选中 K 个历史 Token(K ≪ L),复杂度降至 O(L×K)
- 核心思想:让模型学习哪些历史 Token 相关度最高、最值得计算

DeepSeek V4

- 面向百万级长上下文的整体计算和存储效率
加入训练营
📺完整课程内容,请观看直播或查看课程回放:
InfiniTensor 官网: https://www.infinitensor.com
B站直播: InfiniTensor 官方直播间
视频号直播: InfiniTensor 视频号预约
答疑交流: 训练营官方社群⬇️

关注与交流

