学习资料
2026 夏季 InfiniTensor 训练营推理引擎 6:《InfiniLM》

8 月 11 日,2026 夏季 InfiniTensor 训练营推理引擎方向第六课《InfiniLM》开讲。
前置课程《大模型服务系统》讲了对话前端、OpenAI 标准接口、KV Cache 内存管理、批量调度等内容

本节课是推理方向最后一节课,聚焦 InfiniLM,解析作业与项目所需的工程架构,介绍实现路径与评审标准,并解析 InfiniCore 与 InfiniLM。

关键时间节点(Deadline)

请务必关注以下时间点,逾期提交可能影响评审:

作业工程 LLAI SYS 解析

LLAI SYS (Let’s Learn AI System) 是专为教学设计的轻量级推理框架,集成了数据调度、资源管理与算子实现,便于理解全貌。

项目结构

include 核心模块

  • 张量 (tensor.h):生命周期管理、信息获取、视图变换、维度重排。
  • 运行时 (runtime.h):设备生命周期、启动流程、流、内存管理。
  • 算子 (ops.h):RMS_Norm, RoPE, Softmax, Linear , Add , Argmax 等。
  • 模型 (Models):Qwen2-1.5B 推理实现,包括权重加载、配置读取、KV Cache 管理及推理生命周期。

作业具体要求

Task 0: 环境准备

  • 安装编译器与基础依赖库。
  • Fork 指定个人仓库,构建并运行基础测试。
  • 下载指定模型。

Task 1: 张量

Task 2: 算子

  • 必做:Argmax,Embedding, Linear, RMS_Norm, RoPE, Attention, Swiglu 。
  • 选做:Rearrange(张量重排)。

Task 3: Qwen-1.5B 文本生成

  • Python 前端 (python/qwen2.py) + C++ 后端实现。
  • 完善 ctypes 封装与 KV Cache 管理。
  • 通过 python test/test_infer.py 验证(CPU 推理速度较慢属正常现象)。

Task 4: 异构加速适配(重点)

新要求:作业阶段即要求实现硬件加速,作为项目晋级筛选门槛。

  • 平台要求:NVIDIA (必选) + 天数智芯/摩尔线程/沐曦 (三选一)。

项目阶段选题指南

核心原则:为 InfiniLM 主仓库贡献有意义、干净、独立的代码。避免喧宾夺主或过度侵入式修改。

选题方向推荐

1. 新模型/新结构适配(高价值)

  • MLA (Multi-head Latent Attention):DeepSeek 系列结构,通过低秩压缩显著降低 KV Cache 的存储开销。(注:勿直接复用旧版 DeepSeek V2 代码,建议基于新接口实现。
  • MTP (Multi-token Prediction):通过额外预测后续多个 Token,为投机解码等推理加速方案提供基础。参考 MiniCPM4 + MiniCPM-1Go 实现。
  • MoE (Mixture of Experts):性能优化、新平台适配或引入新 MoE 模型(如 Qwen3-MoE, DeepSeek-V2)。
  • NSA / Mamba / RWKV:长文本优势结构或 SSM 类模型。
  • 高难度模型:UltraMem, Titans, Minimax(基础分更高)。

2. 性能优化

  • 离线优化:算子实现、调度策略。
  • 服务优化:降低空泡、高效计算。
  • ⚠️ 注意:控制改动范围,避免侵入式修改导致验证成本过高。

3. 框架与功能完善

  • 流式输出
  • Response API 支持
  • 诊断工具

4. 量化与低精度推理

  • 权重量化、KV Cache 量化/压缩、混合精度执行。
  • 目标:良好的量化兼容性(如 W8A8 无缝切换)。

5. 可靠性与工程工具

  • Profiler 辅助工具(尤其针对缺乏 Nsight 的国产平台)。
  • 错误诊断与性能采集工具。

提交与评判

  1. 提交目标
    • 作业 → Fork 的个人仓库
    • 项目 → InfiniLM 主仓库
  2. 报告规范:PR Comment 或 Markdown 文件,必须包含清晰复现步骤

项目工程 InfiniLM/InfiniCore 概览

InfiniCore (底层支撑)

  • InfiniOP:提供算子。
  • InfiniCCL:通信库(AllReduce, Send/Recv for PP)。
  • InfiniRT:运行时、CUDA Graph 支持。
  • InfiniCore 封装层:对底层算子及运行时能力进行封装,提供更简洁的调用接口,并通过缓存机制复用相关资源。

InfiniLM (推理框架)

  • Pybind11:Python/C++ 绑定。
  • Engine:基础引擎、分布式 Worker、边界保护。
  • Layers:通用模块(Attention, Linear, MLP, Quantization)。
  • Models:模块化模型实现(复用 Layers,纯添加式修改)。
  • Processor (Python):文本处理、EOS/ChatTemplate 隔离封装。

推理方向的征程已进入实战阶段。希望大家利用好 LLAI SYS 夯实基础,在 InfiniLM 项目中展现创造力与工程能力。预祝各位在作业与项目中取得优异成绩!

加入训练营

📺完整课程内容,请观看直播或查看课程回放:

InfiniTensor 官网https://www.infinitensor.com

B站直播: InfiniTensor 官方直播间

视频号直播: InfiniTensor 视频号预约

答疑交流: 训练营官方社群⬇️

关注与交流