
随着大模型参数规模与应用需求持续增长,计算成本、显存占用与推理效率逐渐成为制约模型落地的重要因素。如何在有限的硬件资源下,实现更高效的计算,同时尽可能保持模型性能,成为大模型系统优化的重要课题。量化通过降低模型参数与计算的数值精度,在精度、效率与资源消耗之间寻找新的平衡,为大模型降本增效提供了重要技术路径。
8 月 12 日晚,2026 夏季 InfiniTensor 大模型与人工智能系统训练营邀请清华大学计算机系陈键飞副教授,带来第四期大咖课 ——《大模型量化》。本次课程聚焦大模型量化技术,从基础理论、核心方法到前沿算法,解析低位宽计算如何助力大模型降本增效,为训练与推理带来新的技术路径。
讲师介绍
陈键飞 | 清华大学计算机科学与技术系 副教授
- 2014 年获清华大学计算机学士学位,2019 年获博士学位。入选 2022 年度 CCF 青年人才发展计划,曾获中国计算机学会优秀博士学位论文奖、清华大学水木学者等荣誉。
- 主要从事高效机器学习研究,重点关注低位宽与量化神经网络、深度学习优化、概率推理及大模型高效计算。近年来在训练后量化、量化感知训练、全量化训练以及 NVFP4 等低精度计算技术开展理论与算法研究。
- 相关成果发表于 ICML、NeurIPS、ICLR 等国际会议,发布了 ActNN、WarpLDA、ZhuSuan、SageAttention 等多个开源软件。
为什么要做低精度计算?
1.硬件算力的「精度天花板」

(1)MFU 瓶颈:随着系统层面的并行、通信和算子融合等优化不断深入,进一步提升实际计算效率仍面临一定挑战
(2)位宽决定峰值算力:同一款 GPU 上,不同精度对应的峰值算力差异巨大
(3)底层原理:低位宽运算所需芯片面积更小,硬件厂商在同样面积内塞入了更多低精度计算单元
2. 存储层面的收益
- 降低数值精度(如 FP16 → 1-bit),显著节省模型存储空间
- 对推理速度和显存占用均有正面影响
低精度数值格式基础

IEEE 754 浮点数表示
- 三部分构成:符号位 + 指数位 + 尾数位
- 常见格式对比:

- 指数位与尾数位的分配决定了数值表示范围
- 不同格式适用于不同数值分布的张量
低精度张量
直接类型转换的失败

- 矩阵 A(权重矩阵):数值范围 ±0.001 → 强制转换后全零(下溢)
- 矩阵 B(激活矩阵):数值范围 ±10000 → 强制转换后严重溢出(上溢)
- 根本原因:数值格式表示范围固定,而深度学习张量数值范围不固定
缩放(Scaling)与量化
- 缩放因子(Scale):以对称 INT8 量化为例,常可根据张量最大绝对值确定缩放因子,例如 scale = max(|x|) / 127;实际量化方案还包括非对称量化以及 per-channel、per-group、per-token 等不同粒度的缩放方式。
- 量化(Quantization):高精度 ÷ 缩放因子 → 归一化到 [-127, 127] → 取整
- 反量化(Dequantization):低精度 × 缩放因子 → 恢复高精度
- 本质:低精度表示通常由低精度数值与 Scale 共同构成

低精度矩阵乘法
- 原始:高精度矩阵 A × 高精度矩阵 B(慢)
- 量化后:

大模型中的量化
- 场景不同→瓶颈不同→量化不同

训练后量化

- 对于部分模型和场景,8-bit PTQ(如 FP8 或 INT8)通常能够在较小精度损失下实现部署,但具体效果需要结合模型、量化粒度、校准数据和目标硬件进行验证。
- 量化误差可能在网络层间传播,并在部分模型和任务中造成累积或放大,因此需要通过逐层分析和端到端评测验证量化后的精度影响。
离群值(Outlier)问题

- 部分 LLM 激活中存在幅值显著高于其他元素的离群值。
- 若采用由最大值决定的统一缩放因子,可能导致大量普通元素的量化分辨率不足,从而造成较大的量化误差。
解决方案 1.非均匀量化

- 在小数值区域密集分布量化点,大数值区域稀疏分布
- 浮点格式的可表示数值在不同数量级上的间隔并不均匀,因此对动态范围较大的张量通常具有一定优势;具体效果仍取决于张量分布和量化方案
- 整数量化在硬件支持成熟、计算效率高的场景具有优势
- 信息熵视角:最优量化应使每种取值的元素数量相当,打满信息熵
解决方案 2. 细粒度缩放
(1)分块缩放

- 将矩阵切分为小块,每块独立计算缩放因子
- 类比:航母的密闭舱设计,一块"进水"不影响全局
(2)微缩放:

- 每 16~32 个元素组成一个量化块,并共享缩放因子,可显著降低局部离群值对量化精度的影响,在精度和额外 Scale 开销之间取得较好的平衡。
解决方案 3. 旋转

- 在矩阵乘法中插入正交矩阵
- 使原本难量化的矩阵变得更容易量化
- 代表方法:
- SmoothQuant:P 取对角阵,平衡 Activation 和 Weight 的量化难度
- 哈达玛变换:通过正交旋转重新分布不同维度上的数值,使异常值更加均匀地分散,从而降低量化难度


典型应用场景
仅权重量化

- 将权重从 BF16 转为 NVFP4 / INT4
- 存储空间大幅缩减(如 1.6T 参数模型:BF16 需 3.2TB → FP4 仅需 800GB)
- 加速解码(Decode):减少权重读取带来的 HBM 带宽压力,通常能够降低 Decode 阶段的计算/访存开销并提升生成吞吐;对 TTFT 的改善则取决于具体模型、输入长度和硬件实现
权重 + 激活量化

- 权重和激活均量化为 FP8 / FP4
- 不仅加速 Decode,还能加速 Prefill 阶段
Attention 量化

- Attention = Q×K(矩阵乘)→ Softmax → P×V(矩阵乘)
- 难点:Softmax 对精度敏感
- 解决方案:SageAttention 系列(最新 SageAttention 3)


KV Cache 量化
- 随序列长度增长,KV Cache 显存需求成倍增加
- 降低 KV Cache 比特数 → 成倍降低推理系统显存需求

低精度训练
量化感知训练

- 核心思想:训练时就让网络"知道"自己会被量化
- 前向传播使用量化后的网络,优化量化网络的 Loss
- 消除训推不一致
训练加速:全量化训练 / 混合精度训练

- 前向传播 1 个矩阵乘法 + 反向传播 2 个矩阵乘法,全部低精度
- 当前效果:
- FP8 训练:验证了超大规模 FP8 混合精度训练的可行性和有效性,在合理的数值格式、量化策略和训练方案下能够保持良好的模型性能
- FP4 全量化训练:FP4 全量化训练对数值稳定性和训练精度要求更高,具体精度损失高度依赖模型、量化格式及训练策略;近年来基于 Microscaling 等技术的 FP4 训练已取得接近 FP8/BF16 的结果。
- 挑战:三个矩阵乘法均为低精度,精度控制难度显著提升

QA 精选答疑
Q1:大模型量化落地中,哪种位宽综合性价比最高?
A: 8-bit 基本在所有场景下都是安全且成熟的选择。4-bit 需分场景看待:权重量化可行(严肃应用建议配合量化感知训练);Attention 量化在视频生成等特定场景可行;激活量化与 KV Cache 量化存在风险,需具体验证;训练中直接使用 4-bit 会有精度损失。
Q2:选择 FP8 还是 INT8,是否取决于硬件支持?
A: 是的。优先确认硬件是否支持 Microscaling,若不支持 Microscaling 通过其他技术弥补;若仅支持 INT8,同样可用上述技术,但需更精细地控制精度损失。
Q3:训练后量化和量化感知训练如何选择?
A: 二者是递进关系。始终先尝试训练后量化,它至少可作为 Baseline;若精度不满足需求,再考虑量化感知训练。注意量化感知训练门槛较高,需要额外的算力、数据,更适合有研发资源的大模型团队,学术研究者通常难以对大语言模型执行量化感知训练。
Q4:ActNN 这类开源量化工具上手门槛高吗?
A: ActNN 代码较老,直接套用意义不大,但其核心思想仍具参考价值。若确认瓶颈确实是激活显存占用且无法通过 Activation Checkpointing 或流水线并行解决,可借鉴其思路,借助 AI Coding Agent 快速实现适配当前负载的量化 Kernel。
Q5:低位宽计算未来有哪些潜力研究方向?
A: 两大分支:一是工程落地,弥合理论无精度损失与实际仍用高精度之间的 Gap,研究 4-bit 训练动力学及精度保持技术;二是算子-硬件协同设计(Co-Design),低精度矩阵乘法速度极快后,其他部分会成为新瓶颈的问题。
Q6:新格式(如 NVFP4)的硬件适配难点在哪?
A: 核心难点在于算力失衡。以 B300 为例,Tensor Core(NVFP4)算力是 CUDA Core 的约 200 倍,任何微小的地址计算、Scale 计算或类型转换指令都会成为瓶颈,抵消 Tensor Core 带来的性能收益,对 Kernel 编写提出极高要求。
Q7:量化压缩会影响模型的幻觉问题吗?
A: 会有影响,尤其是未经过全链路严格 QAT 的后训练量化模型。在复杂推理、长轨迹任务中,量化模型的性能下降会更明显。但使用 8-bit 量化通常不会出现此类问题。
加入训练营
📺完整课程内容,请观看直播或查看课程回放:
InfiniTensor 官网: https://www.infinitensor.com
B站直播: InfiniTensor 官方直播间
视频号直播: InfiniTensor 视频号预约
答疑交流: 训练营官方社群⬇️

关注与交流

