
7 月 17 日,2026 夏季 InfiniTensor 训练营 CPU 并行编程方向第一课《CPU 性能优化导论》开讲。
本课程将带你从底层原理出发,完整拆解 CPU 多级缓存、局部性原理、SIMD 向量指令、多线程并行、矩阵分块、模型量化六大核心优化手段,搭配真实工程案例讲解,掌握 Agent 时代的 CPU 性能优化方法论。
Agent 时代的计算新范式
1.从 Chatbot 到 Agent 的负载变迁
- 传统 Chatbot:单次请求 - 响应模式,侧重模型推理。
- Agent 模式:工具调用 + 本地/云侧数据处理 + 循环执行,侧重全链路编排。

2.为什么 CPU 依然是核心?

- 复杂计算负载的调度中枢(浏览器操作、文件访问、API 调用)。
- 长期在线与完整工具链运行的算力基石。
- 传统架构痛点:CPU/GPU 内存通常不互通,数据搬运开销大。
- 统一内存优势:CPU/GPU/NPU 共享内存池,上下文切换效率高(以 Mac mini 为例)。
- 潜在挑战:多计算单元共享带来的资源竞争问题。
3. CPU 性能优化的核心维度

时间维度的拆解
- 计算时间:CPU 负载是否有效拉满?避免无效空转。
- 等待时间:减少内存等待与 I/O 等待(IO Bound 问题)。
- 异步处理策略:在等待网络/IO 时合理调度其他任务。
硬件性能的充分释放
- 寄存器、Cache 与内存的数据交换效率。
- 端侧 AI 设备的多传感器与计算单元协同。
- 核心理念:理解基础原理是写出高效代码的前提。

存储层级与局部性原理
CPU 多级缓存结构回顾

- 存储金字塔:寄存器 → L1/L2/L3 Cache → 内存 → 硬盘。
- 访问延迟差异与“备菜理论”(数据预取的重要性)。
局部性原则(Locality Principle)

- 时间局部性:刚被访问的数据很可能再次被访问。
- 空间局部性:连续内存访问效率远高于跨步/随机访问。
- 目标:最大化 Cache Hit,最小化 Cache Miss。
- 二维矩阵存储布局:
- 行主序(Row-major)vs 列主序(Column-major)的区别。
- 循环嵌套顺序对 Cache 命中的影响。
- 调用高性能计算库(BLAS)时的内存排布注意事项。
指令集加速与并行计算
SIMD 向量指令集

- Single Instruction Multi Data 原理:一条指令处理多个数据。
- 位宽与吞吐量:128bit/256bit 指令集具有理论性能倍增效果。
- FMA(融合乘加)指令在矩阵运算中的应用。

多线程并行技术

- 线程池机制:避免频繁创建/销毁线程的开销
- 任务分配策略:独立任务的并行执行与负载均衡。
- 线程同步与并发安全
- 临界区与数据竞争问题。
- 同步机制:互斥锁(Mutex)、信号量、Barrier。
- 算子融合与大模型推理中的同步设计模式。
矩阵运算深度优化
分块(Blocking/Tiling)技术

- 将矩阵切分为适配 L1/L2 Cache 的小块。
- 减少数据搬运,提升计算单元利用率。
- 内外循环设计与分块矩阵乘法理论验证。
数据量化与精度优化
1. 量化基础

- 高精度计算向低精度表示转换,包括 FP16、BF16 等低精度浮点计算,以及 INT8、INT4 等模型量化形式。
- 收益:体积缩减 + 计算周期缩短。
- 容错率:神经网络参数和激活通常存在一定数值冗余,模型对有限的舍入误差具有一定容忍能力,可通过校准或量化感知训练降低精度损失。
2. 主流量化方法

- PTQ(训练后量化):校准数据集 + 权重映射。
- QAT(量化感知训练):在训练过程加入了模拟量化。
- 常见量化组合(W x A x)
- W4A16 / W8A16 / W8A8 等权重-激活值组合。
- 硬件指令集对量化运算的支持情况。
3.其他优化方法
内存对齐(Alignment)
- 非对齐访问导致的 Cache 抖动与性能损耗。
- 强制对齐指令与编译器优化。
非一致性内存访问 NUMA
- 多路服务器跨节点访问的高延迟问题。
- 高速互联技术下的数据编排策略。

开源框架

加入训练营
📺完整课程内容,请观看直播或查看课程回放:
InfiniTensor 官网: https://www.infinitensor.com
B站直播: InfiniTensor 官方直播间
视频号直播: InfiniTensor 视频号预约
答疑交流: 训练营官方社群⬇️

关注与交流

