
8 月 11 日,2026 夏季 InfiniTensor 训练营推理引擎方向第六课《InfiniLM》开讲。
前置课程《大模型服务系统》讲了对话前端、OpenAI 标准接口、KV Cache 内存管理、批量调度等内容
本节课是推理方向最后一节课,聚焦 InfiniLM,解析作业与项目所需的工程架构,介绍实现路径与评审标准,并解析 InfiniCore 与 InfiniLM。
关键时间节点(Deadline)
请务必关注以下时间点,逾期提交可能影响评审:

作业工程 LLAI SYS 解析
LLAI SYS (Let’s Learn AI System) 是专为教学设计的轻量级推理框架,集成了数据调度、资源管理与算子实现,便于理解全貌。
项目结构

include 核心模块
- 张量 (
tensor.h):生命周期管理、信息获取、视图变换、维度重排。 - 运行时 (
runtime.h):设备生命周期、启动流程、流、内存管理。 - 算子 (
ops.h):RMS_Norm, RoPE, Softmax, Linear , Add , Argmax 等。 - 模型 (Models):Qwen2-1.5B 推理实现,包括权重加载、配置读取、KV Cache 管理及推理生命周期。

作业具体要求
Task 0: 环境准备
- 安装编译器与基础依赖库。
- Fork 指定个人仓库,构建并运行基础测试。
- 下载指定模型。
Task 1: 张量

Task 2: 算子
- 必做:Argmax,Embedding, Linear, RMS_Norm, RoPE, Attention, Swiglu 。
- 选做:Rearrange(张量重排)。
Task 3: Qwen-1.5B 文本生成
- Python 前端 (
python/qwen2.py) + C++ 后端实现。 - 完善
ctypes封装与 KV Cache 管理。 - 通过
python test/test_infer.py验证(CPU 推理速度较慢属正常现象)。
Task 4: 异构加速适配(重点)
新要求:作业阶段即要求实现硬件加速,作为项目晋级筛选门槛。
- 平台要求:NVIDIA (必选) + 天数智芯/摩尔线程/沐曦 (三选一)。

项目阶段选题指南
核心原则:为 InfiniLM 主仓库贡献有意义、干净、独立的代码。避免喧宾夺主或过度侵入式修改。
选题方向推荐
1. 新模型/新结构适配(高价值)

- MLA (Multi-head Latent Attention):DeepSeek 系列结构,通过低秩压缩显著降低 KV Cache 的存储开销。(注:勿直接复用旧版 DeepSeek V2 代码,建议基于新接口实现。)
- MTP (Multi-token Prediction):通过额外预测后续多个 Token,为投机解码等推理加速方案提供基础。参考 MiniCPM4 + MiniCPM-1Go 实现。
- MoE (Mixture of Experts):性能优化、新平台适配或引入新 MoE 模型(如 Qwen3-MoE, DeepSeek-V2)。
- NSA / Mamba / RWKV:长文本优势结构或 SSM 类模型。
- 高难度模型:UltraMem, Titans, Minimax(基础分更高)。
2. 性能优化
- 离线优化:算子实现、调度策略。
- 服务优化:降低空泡、高效计算。
- ⚠️ 注意:控制改动范围,避免侵入式修改导致验证成本过高。
3. 框架与功能完善
- 流式输出
- Response API 支持
- 诊断工具
4. 量化与低精度推理
- 权重量化、KV Cache 量化/压缩、混合精度执行。
- 目标:良好的量化兼容性(如 W8A8 无缝切换)。
5. 可靠性与工程工具
- Profiler 辅助工具(尤其针对缺乏 Nsight 的国产平台)。
- 错误诊断与性能采集工具。
提交与评判
- 提交目标:
- 作业 → Fork 的个人仓库
- 项目 → InfiniLM 主仓库
- 报告规范:PR Comment 或 Markdown 文件,必须包含清晰复现步骤。

项目工程 InfiniLM/InfiniCore 概览
InfiniCore (底层支撑)
- InfiniOP:提供算子。
- InfiniCCL:通信库(AllReduce, Send/Recv for PP)。
- InfiniRT:运行时、CUDA Graph 支持。
- InfiniCore 封装层:对底层算子及运行时能力进行封装,提供更简洁的调用接口,并通过缓存机制复用相关资源。

InfiniLM (推理框架)
- Pybind11:Python/C++ 绑定。
- Engine:基础引擎、分布式 Worker、边界保护。
- Layers:通用模块(Attention, Linear, MLP, Quantization)。
- Models:模块化模型实现(复用 Layers,纯添加式修改)。
- Processor (Python):文本处理、EOS/ChatTemplate 隔离封装。

推理方向的征程已进入实战阶段。希望大家利用好 LLAI SYS 夯实基础,在 InfiniLM 项目中展现创造力与工程能力。预祝各位在作业与项目中取得优异成绩!
加入训练营
📺完整课程内容,请观看直播或查看课程回放:
InfiniTensor 官网: https://www.infinitensor.com
B站直播: InfiniTensor 官方直播间
视频号直播: InfiniTensor 视频号预约
答疑交流: 训练营官方社群⬇️

关注与交流

