学习资料
2026 夏季 InfiniTensor 训练营前沿模型 1:《大模型学习方法》

7 月 17 日,2026 夏季 InfiniTensor 训练营前沿模型方向第一课《大模型学习方法》开讲。

本节课我们将沿着 AI 发展的历史脉络,深入拆解大模型时代的三大核心学习范式:预训练(Pre-training)、监督微调(SFT)以及基于人类反馈的强化学习(RLHF)。

人工智能发展史与核心命题

AI 的核心命题

  • 起源:1956 年达特茅斯会议标志着 AI 诞生。

  • 永恒问题:怎样让机器掌握完成复杂任务所需的知识?以何种形式存储?如何应用于新任务?

  • AI 发展的三次浪潮与起伏

知识学习的三个代表性阶段

阶段 核心方法 知识存储形式 优势 局限性
符号智能 专家手写规则 规则库/知识库 清晰、可解释 难以穷举,无泛化能力
专用智能 数据驱动机器学习 小模型参数 自动学习规律,有一定泛化性 依赖标注数据,局限于特定任务
通用智能 自监督预训练 大模型参数 利用海量无标注数据,支持通用任务 计算效率挑战

大模型的特点与能力涌现

  1. 序列化建模:文本、图像、音频等多模态信息转化为序列。
  2. 量变到质变:数据规模↑ → 参数规模↑ → 算力需求↑ → 知识累积 → 智能涌现
  3. 可扩展性:通过 scaling 获得能力提升,但面临计算效率瓶颈(GPT-3至今参数量级未呈指数级爆炸,受限于效率)。

预训练 (Pre-training)

Scaling Law(尺度律)

  1. 核心规律:在一定范围内,损失函数与参数量、数据量均呈现对数线性下降(幂次趋势)。
  2. 指导意义
    • 预测大模型性能,支持训练决策。
    • 预估给定算力下的最优“参数-数据”配比。
  3. Chinchilla 定律:参数与数据应以几乎相等的比例进行扩展,而非单一维度的堆叠。

  1. 关于“涌现”的争议:阶跃性涌现可能是观测指标的局限,全方位持续观测下能力增长可能是连续的。

3. 数据质量的重要性

  1. Textbooks Are All You Need:高质量数据可极大改变 Scaling Law 曲线形状。仅用 1/100 数据量的 1.3 B 模型,代码性能可超越 GPT-3.5。

  1. 小模型的潜力:MiniCPM (2B) 性能超越Llama 13B,接近 Gemma 7B。证明通过优化数据工程和算法,可将更高知识密度压缩进小模型。

监督微调(SFT)

SFT 的核心目标

  • 在广博世界知识基础上,快速强化高级能力。
  • 约束模型回答偏好,使其符合人类期望。

指令微调(Instruction Tuning)

1.让模型从“续写者”变为“交互工具”,增强意图理解与泛化能力。

2.指令微调特性:形式自由

  • InstructGPT:引入对话形式微调 + 真实用户指令,是 ChatGPT 的前身。
  • Alpaca:Self-Instruct 思路,用大模型构造问答对。
  • Vicuna:使用 ShareGPT 真实用户数据,效果优于合成数据(真实数据更多样)。
  • 数量 vs 质量之争

  • LIMA:仅用 1000 条精选高质量数据微调 65B 模型,效果优于大量数据训练的模型。盲目增加数据量对生成质量无收益。
  • UltraChat:解决“0-60 分”到“60-100 分”的跨越。定义三大任务维度(信息获取、创造、转化),通过可控设计实现可扩展的多样性

  • Orca:从 Flan 数据集筛选 500 万条输入,用 GPT-4 重写输出。兼顾输入广度与输出质量。

SFT 的本质理解

  1. 0 → 60 分:学习对话模板与指令遵循,激活预训练知识。
  2. 60 → 100 分:提升推理、生成、知识性及对齐能力,需要更高质量的数据工程。

RLHF —— 基于人类反馈的强化学习

为什么需要 RLHF?

  • SFT 的局限:只能学习“标准答案”,但开放性问题(如写诗、创作)不存在唯一Golden Answer。
  • RLHF 的优势:通过人类对多个候选答案的比较与偏好排序,让模型学习“什么是更好的回答”。
  • 长远意义:从环境/用户反馈中持续学习是智能体的必备能力(适用于多智能体、具身智能等场景)。

RLHF 的实践与挑战

1.OpenAI 的探索:从 Summarization → WebGPT → InstructGPT。每条 Prompt 生成 4-9 个回复,构建约 20 万条偏好数据;提供详细多维度标注文档辅助人工打分。

2.开源社区的追赶

  • LLaMA 2:标注 140 万偏好数据,混合开源数据训练奖励模型,成为开源 RLHF 里程碑。

  • 痛点:开源偏好数据少、质量低;小模型做 Reward Model 效果不佳;大模型标数据与顶级专家仍有差距。

UltraFeedback:开源 RLHF 的新标杆

  1. 数据构建:收集 65K Prompts(来源多样),由 4 个不同模型生成回复以保证多样性。
  2. 高质量标注:使用 GPT-4 从四个维度进行比较打分并给出解释,形成 38 万条高质量偏好数据。
  3. 正向循环:UltraFeedback → 训练UltraRM(超越其他开源奖励模型)→ PPO 训练UltraLM → 在多项对话评测中取得了明显提升。

加入训练营

📺完整课程内容,请观看直播或查看课程回放:

InfiniTensor 官网https://www.infinitensor.com

B站直播: InfiniTensor 官方直播间

视频号直播: InfiniTensor 视频号预约

答疑交流: 训练营官方社群⬇️

关注与交流