2026 夏季 InfiniTensor 训练营训练系统 5:《强化学习基础与 DeepSeek 训练介绍》
2026 夏季 InfiniTensor 训练营《强化学习基础与 DeepSeek 训练介绍》系统讲解强化学习核心理论与经典算法,涵盖马尔可夫决策过程、Q-Learning、DQN、策略梯度、Actor-Critic 及 PPO 等关键知识点。同时深入解析 DeepSeek V3 至 V4 的架构演进,包括 MoE、MLA、DSA、CSA/HCA 等设计及其在百万级长上下文场景下的优化思路。