学习资料
2026 夏季 InfiniTensor 训练营推理引擎 4:《大模型计算优化与分布式推理》

7 月 31 日,2026 夏季 InfiniTensor 训练营推理引擎方向第四课《大模型计算优化与分布式推理》开讲。
前三课依次讲解 AI 模型导论、Transformer 底层结构、单卡 KV Cache 对话推理完整流程,铺垫基础生成逻辑与 Prefill / Decode 双阶段机制。

本节课解决超大模型单卡放不下、推理速度慢的工程痛点,聚焦大模型推理系统的核心优化技术与分布式部署方案。

回顾:推理系统的挑战

文本生成机制

  1. Prefill 阶段:填充 KV Cache,避免重复计算
  2. Decode 阶段:自回归生成 Token 直至停止符
  3. Template 机制:通过身份标识实现多轮 AI 对话

Scaling Law 带来的困境

  1. 模型尺寸激增:FP16 下 1B 参数 ≈ 2GB 显存,实际推理还需额外考虑 KV Cache,2.8T 参数需海量显卡
  2. KV Cache 膨胀:长上下文场景下 Cache 大小可能超越模型本身
  3. 计算延迟上升:算子数量与张量规模同步增长
  4. 推理优化的“不可能三角”

数据类型优化:低精度推理基础

1.浮点数类型详解

  • FP32:1 符号位+ 8 指数位 + 23 小数位
  • FP16 vs BF16:同为 16bit,指数位与小数位分配不同
  • TF32(NVIDIA 特有):采用 FP32 的 8 位指数位和 10 位尾数位

2.低精度推理

  • 权重存储相比 FP32 减半,同时降低部分激活与缓存存储开销
  • 硬件加速支持(Tensor Core 等)
  • 敏感算子处理:rms_normsoftmax 等自动回退 FP32 计算

量化推理

1.量化基本原理

  • 浮点到整数的映射:利用参数正态/长尾分布特性
  • W/A 命名规范:W4A16 = 权重 INT4 + 激活值 FP16

2.两大量化范式

  • PTQ(训练后量化):主流方案,适用于已训好模型
  • QAT(训练时量化):训练中同步量化

3.量化示例(Qwen3-235B-A22B)

  • FP8 -E4M3:权重 FP8 + Scale 还原,支持 W8A16/W8A8

  • GPTQ -INT4:每行8个 INT4 组成 INT32,Group=128 共享 scale/qzero,支持重排

  • AWQ -INT4:按输出维度量化,原理类似 GPTQ

  • Quark-MXFP4:4bit浮点+E8M0 Scale,极小表示范围

模型结构优化

1.从 MHA 到 MQA、GQA

  • MQA:多个 Query head 共享同一个 KV head,从而减少 KV Cache 存储量
  • GQA(分组查询注意力):折中方案,当前主流

2.MoE(混合专家模型)

  • 稠密 MLP 拆分为多个专家子网络
  • 动态路由选择 Top-K 专家激活
  • 效果:保持更大模型容量的同时,仅激活部分专家,从而降低单 Token 推理计算量

计算层优化

1.融合算子

  • QKV 矩阵乘融合:减少访存与 Kernel 发射

2.Flash Attention

  • 问题:标准 Attention 虽然可以分块计算,但通常需要显式存储 Attention Score 矩阵,导致大量 HBM 读写。FlashAttention 利用 Online Softmax 实现 IO-aware 分块计算,避免生成完整 Attention Matrix
  • 解法:Online Softmax 算法实现分块计算
  • 收益:数据驻留 SRAM,消除 Score 矩阵反复读写

3.投机采样

  • 核心思路:小模型生成 + 大模型纠错
  • 变体:MTP 模块(DeepSeek)、EAGLE、DSpark 等

分布式推理:突破单机显存瓶颈

并行策略概览

  1. 数据并行:提升吞吐,不解决单模型过大问题
  2. 模型并行:流水线并行(层间) + 张量并行(层内)

张量并行详解

  1. 张量状态:Replication / Partition / Partial Sum
    2.分布式矩阵乘

  1. MLP 层切分:gate_proj 和 up_proj 通常按 intermediate_size 维度切分,down_proj 按对应输入维度切分,并通过 AllReduce 汇总结果

  1. Attention 层切分

流水线并行(PP)与混合部署

  1. 推理场景特点:主要用于解决跨机显存
  2. 主流混合并行策略:节点内 TP + 节点间 PP
  3. 跨机通信优化:send/recv 切分传输 + 节点内 AllGather,降低带宽压力

加入训练营

📺 完整课程内容,请观看直播或查看课程回放:

InfiniTensor 官网https://www.infinitensor.com

B 站直播: InfiniTensor 官方直播间

视频号直播: InfiniTensor 视频号预约

答疑交流: 训练营官方社群 ⬇️

关注与交流