学习资料
2026 夏季 InfiniTensor 训练营大咖课 4:清华大学陈键飞副教授——《大模型量化》

随着大模型参数规模与应用需求持续增长,计算成本、显存占用与推理效率逐渐成为制约模型落地的重要因素。如何在有限的硬件资源下,实现更高效的计算,同时尽可能保持模型性能,成为大模型系统优化的重要课题。量化通过降低模型参数与计算的数值精度,在精度、效率与资源消耗之间寻找新的平衡,为大模型降本增效提供了重要技术路径。

8 月 12 日晚,2026 夏季 InfiniTensor 大模型与人工智能系统训练营邀请清华大学计算机系陈键飞副教授,带来第四期大咖课 ——《大模型量化》。本次课程聚焦大模型量化技术,从基础理论、核心方法到前沿算法,解析低位宽计算如何助力大模型降本增效,为训练与推理带来新的技术路径。

讲师介绍

陈键飞 | 清华大学计算机科学与技术系 副教授

  • 2014 年获清华大学计算机学士学位,2019 年获博士学位。入选 2022 年度 CCF 青年人才发展计划,曾获中国计算机学会优秀博士学位论文奖、清华大学水木学者等荣誉。
  • 主要从事高效机器学习研究,重点关注低位宽与量化神经网络、深度学习优化、概率推理及大模型高效计算。近年来在训练后量化、量化感知训练、全量化训练以及 NVFP4 等低精度计算技术开展理论与算法研究。
  • 相关成果发表于 ICML、NeurIPS、ICLR 等国际会议,发布了 ActNN、WarpLDA、ZhuSuan、SageAttention 等多个开源软件。

为什么要做低精度计算?

1.硬件算力的「精度天花板」

(1)MFU 瓶颈:随着系统层面的并行、通信和算子融合等优化不断深入,进一步提升实际计算效率仍面临一定挑战
(2)位宽决定峰值算力:同一款 GPU 上,不同精度对应的峰值算力差异巨大
(3)底层原理:低位宽运算所需芯片面积更小,硬件厂商在同样面积内塞入了更多低精度计算单元

2. 存储层面的收益

  • 降低数值精度(如 FP16 → 1-bit),显著节省模型存储空间
  • 对推理速度和显存占用均有正面影响

低精度数值格式基础

IEEE 754 浮点数表示

  • 三部分构成:符号位 + 指数位 + 尾数位
  • 常见格式对比:

  • 指数位与尾数位的分配决定了数值表示范围
  • 不同格式适用于不同数值分布的张量

低精度张量

直接类型转换的失败

  • 矩阵 A(权重矩阵):数值范围 ±0.001 → 强制转换后全零(下溢)
  • 矩阵 B(激活矩阵):数值范围 ±10000 → 强制转换后严重溢出(上溢)
  • 根本原因:数值格式表示范围固定,而深度学习张量数值范围不固定

缩放(Scaling)与量化

  • 缩放因子(Scale):以对称 INT8 量化为例,常可根据张量最大绝对值确定缩放因子,例如 scale = max(|x|) / 127;实际量化方案还包括非对称量化以及 per-channel、per-group、per-token 等不同粒度的缩放方式。
  • 量化(Quantization):高精度 ÷ 缩放因子 → 归一化到 [-127, 127] → 取整
  • 反量化(Dequantization):低精度 × 缩放因子 → 恢复高精度
  • 本质:低精度表示通常由低精度数值与 Scale 共同构成

低精度矩阵乘法

  • 原始:高精度矩阵 A × 高精度矩阵 B(慢)
  • 量化后:

大模型中的量化

  • 场景不同→瓶颈不同→量化不同

训练后量化

  • 对于部分模型和场景,8-bit PTQ(如 FP8 或 INT8)通常能够在较小精度损失下实现部署,但具体效果需要结合模型、量化粒度、校准数据和目标硬件进行验证。
  • 量化误差可能在网络层间传播,并在部分模型和任务中造成累积或放大,因此需要通过逐层分析和端到端评测验证量化后的精度影响。

离群值(Outlier)问题

  • 部分 LLM 激活中存在幅值显著高于其他元素的离群值。
  • 若采用由最大值决定的统一缩放因子,可能导致大量普通元素的量化分辨率不足,从而造成较大的量化误差。

解决方案 1.非均匀量化

  • 在小数值区域密集分布量化点,大数值区域稀疏分布
  • 浮点格式的可表示数值在不同数量级上的间隔并不均匀,因此对动态范围较大的张量通常具有一定优势;具体效果仍取决于张量分布和量化方案
  • 整数量化在硬件支持成熟、计算效率高的场景具有优势
  • 信息熵视角:最优量化应使每种取值的元素数量相当,打满信息熵

解决方案 2. 细粒度缩放

(1)分块缩放

  • 将矩阵切分为小块,每块独立计算缩放因子
  • 类比:航母的密闭舱设计,一块"进水"不影响全局

(2)微缩放

  • 每 16~32 个元素组成一个量化块,并共享缩放因子,可显著降低局部离群值对量化精度的影响,在精度和额外 Scale 开销之间取得较好的平衡。

解决方案 3. 旋转

  • 在矩阵乘法中插入正交矩阵
  • 使原本难量化的矩阵变得更容易量化
  • 代表方法
    • SmoothQuant:P 取对角阵,平衡 Activation 和 Weight 的量化难度
    • 哈达玛变换:通过正交旋转重新分布不同维度上的数值,使异常值更加均匀地分散,从而降低量化难度

典型应用场景

仅权重量化

  • 将权重从 BF16 转为 NVFP4 / INT4
  • 存储空间大幅缩减(如 1.6T 参数模型:BF16 需 3.2TB → FP4 仅需 800GB)
  • 加速解码(Decode):减少权重读取带来的 HBM 带宽压力,通常能够降低 Decode 阶段的计算/访存开销并提升生成吞吐;对 TTFT 的改善则取决于具体模型、输入长度和硬件实现

权重 + 激活量化

  • 权重和激活均量化为 FP8 / FP4
  • 不仅加速 Decode,还能加速 Prefill 阶段

Attention 量化

  • Attention = Q×K(矩阵乘)→ Softmax → P×V(矩阵乘)
  • 难点:Softmax 对精度敏感
  • 解决方案:SageAttention 系列(最新 SageAttention 3)

KV Cache 量化

  • 随序列长度增长,KV Cache 显存需求成倍增加
  • 降低 KV Cache 比特数 → 成倍降低推理系统显存需求

低精度训练

量化感知训练

  • 核心思想:训练时就让网络"知道"自己会被量化
  • 前向传播使用量化后的网络,优化量化网络的 Loss
  • 消除训推不一致

训练加速:全量化训练 / 混合精度训练

  • 前向传播 1 个矩阵乘法 + 反向传播 2 个矩阵乘法,全部低精度
  • 当前效果
    • FP8 训练:验证了超大规模 FP8 混合精度训练的可行性和有效性,在合理的数值格式、量化策略和训练方案下能够保持良好的模型性能
    • FP4 全量化训练:FP4 全量化训练对数值稳定性和训练精度要求更高,具体精度损失高度依赖模型、量化格式及训练策略;近年来基于 Microscaling 等技术的 FP4 训练已取得接近 FP8/BF16 的结果。
  • 挑战:三个矩阵乘法均为低精度,精度控制难度显著提升

QA 精选答疑

Q1:大模型量化落地中,哪种位宽综合性价比最高?
A: 8-bit 基本在所有场景下都是安全且成熟的选择。4-bit 需分场景看待:权重量化可行(严肃应用建议配合量化感知训练);Attention 量化在视频生成等特定场景可行;激活量化与 KV Cache 量化存在风险,需具体验证;训练中直接使用 4-bit 会有精度损失。

Q2:选择 FP8 还是 INT8,是否取决于硬件支持?
A: 是的。优先确认硬件是否支持 Microscaling,若不支持 Microscaling 通过其他技术弥补;若仅支持 INT8,同样可用上述技术,但需更精细地控制精度损失。

Q3:训练后量化和量化感知训练如何选择?
A: 二者是递进关系。始终先尝试训练后量化,它至少可作为 Baseline;若精度不满足需求,再考虑量化感知训练。注意量化感知训练门槛较高,需要额外的算力、数据,更适合有研发资源的大模型团队,学术研究者通常难以对大语言模型执行量化感知训练。

Q4:ActNN 这类开源量化工具上手门槛高吗?
A: ActNN 代码较老,直接套用意义不大,但其核心思想仍具参考价值。若确认瓶颈确实是激活显存占用且无法通过 Activation Checkpointing 或流水线并行解决,可借鉴其思路,借助 AI Coding Agent 快速实现适配当前负载的量化 Kernel。

Q5:低位宽计算未来有哪些潜力研究方向?
A: 两大分支:一是工程落地,弥合理论无精度损失与实际仍用高精度之间的 Gap,研究 4-bit 训练动力学及精度保持技术;二是算子-硬件协同设计(Co-Design),低精度矩阵乘法速度极快后,其他部分会成为新瓶颈的问题。

Q6:新格式(如 NVFP4)的硬件适配难点在哪?
A: 核心难点在于算力失衡。以 B300 为例,Tensor Core(NVFP4)算力是 CUDA Core 的约 200 倍,任何微小的地址计算、Scale 计算或类型转换指令都会成为瓶颈,抵消 Tensor Core 带来的性能收益,对 Kernel 编写提出极高要求。

Q7:量化压缩会影响模型的幻觉问题吗?
A: 会有影响,尤其是未经过全链路严格 QAT 的后训练量化模型。在复杂推理、长轨迹任务中,量化模型的性能下降会更明显。但使用 8-bit 量化通常不会出现此类问题。

加入训练营

📺完整课程内容,请观看直播或查看课程回放:

InfiniTensor 官网https://www.infinitensor.com

B站直播: InfiniTensor 官方直播间

视频号直播: InfiniTensor 视频号预约

答疑交流: 训练营官方社群⬇️

关注与交流