
7 月 31 日,2026 夏季 InfiniTensor 训练营推理引擎方向第四课《大模型计算优化与分布式推理》开讲。
前三课依次讲解 AI 模型导论、Transformer 底层结构、单卡 KV Cache 对话推理完整流程,铺垫基础生成逻辑与 Prefill / Decode 双阶段机制。
本节课解决超大模型单卡放不下、推理速度慢的工程痛点,聚焦大模型推理系统的核心优化技术与分布式部署方案。
回顾:推理系统的挑战
文本生成机制

- Prefill 阶段:填充 KV Cache,避免重复计算
- Decode 阶段:自回归生成 Token 直至停止符
- Template 机制:通过身份标识实现多轮 AI 对话
Scaling Law 带来的困境

- 模型尺寸激增:FP16 下 1B 参数 ≈ 2GB 显存,实际推理还需额外考虑 KV Cache,2.8T 参数需海量显卡
- KV Cache 膨胀:长上下文场景下 Cache 大小可能超越模型本身
- 计算延迟上升:算子数量与张量规模同步增长
- 推理优化的“不可能三角”

数据类型优化:低精度推理基础

1.浮点数类型详解
- FP32:1 符号位+ 8 指数位 + 23 小数位
- FP16 vs BF16:同为 16bit,指数位与小数位分配不同
- TF32(NVIDIA 特有):采用 FP32 的 8 位指数位和 10 位尾数位
2.低精度推理

- 权重存储相比 FP32 减半,同时降低部分激活与缓存存储开销
- 硬件加速支持(Tensor Core 等)
- 敏感算子处理:
rms_norm、softmax等自动回退 FP32 计算
量化推理

1.量化基本原理
- 浮点到整数的映射:利用参数正态/长尾分布特性
- W/A 命名规范:W4A16 = 权重 INT4 + 激活值 FP16
2.两大量化范式
- PTQ(训练后量化):主流方案,适用于已训好模型
- QAT(训练时量化):训练中同步量化
3.量化示例(Qwen3-235B-A22B)
- FP8 -E4M3:权重 FP8 + Scale 还原,支持 W8A16/W8A8

- GPTQ -INT4:每行8个 INT4 组成 INT32,Group=128 共享 scale/qzero,支持重排

- AWQ -INT4:按输出维度量化,原理类似 GPTQ

- Quark-MXFP4:4bit浮点+E8M0 Scale,极小表示范围

模型结构优化

1.从 MHA 到 MQA、GQA
- MQA:多个 Query head 共享同一个 KV head,从而减少 KV Cache 存储量
- GQA(分组查询注意力):折中方案,当前主流
2.MoE(混合专家模型)

- 稠密 MLP 拆分为多个专家子网络
- 动态路由选择 Top-K 专家激活
- 效果:保持更大模型容量的同时,仅激活部分专家,从而降低单 Token 推理计算量
计算层优化
1.融合算子
- QKV 矩阵乘融合:减少访存与 Kernel 发射

2.Flash Attention

- 问题:标准 Attention 虽然可以分块计算,但通常需要显式存储 Attention Score 矩阵,导致大量 HBM 读写。FlashAttention 利用 Online Softmax 实现 IO-aware 分块计算,避免生成完整 Attention Matrix
- 解法:Online Softmax 算法实现分块计算
- 收益:数据驻留 SRAM,消除 Score 矩阵反复读写

3.投机采样
- 核心思路:小模型生成 + 大模型纠错
- 变体:MTP 模块(DeepSeek)、EAGLE、DSpark 等

分布式推理:突破单机显存瓶颈

并行策略概览
- 数据并行:提升吞吐,不解决单模型过大问题
- 模型并行:流水线并行(层间) + 张量并行(层内)
张量并行详解

- 张量状态:Replication / Partition / Partial Sum
2.分布式矩阵乘

- MLP 层切分:gate_proj 和 up_proj 通常按 intermediate_size 维度切分,down_proj 按对应输入维度切分,并通过 AllReduce 汇总结果

- Attention 层切分:

流水线并行(PP)与混合部署

- 推理场景特点:主要用于解决跨机显存
- 主流混合并行策略:节点内 TP + 节点间 PP
- 跨机通信优化:send/recv 切分传输 + 节点内 AllGather,降低带宽压力
加入训练营
📺 完整课程内容,请观看直播或查看课程回放:
InfiniTensor 官网: https://www.infinitensor.com
B 站直播: InfiniTensor 官方直播间
视频号直播: InfiniTensor 视频号预约
答疑交流: 训练营官方社群 ⬇️

关注与交流

