学习资料
2026 夏季 InfiniTensor 训练营推理引擎 5:《大模型服务系统》

8 月 6 日,2026 夏季 InfiniTensor 训练营推理引擎方向第五课《大模型服务系统》开讲。
上节课聚焦推理底层算子与分布式并行,解决单卡显存不足、单 Token 推理延迟高问题。本节课转向线上生产服务完整工程链路,覆盖对话业务功能、流式接口、KV Cache 内存池、多请求调度整套落地方案。

本节课从线上服务落地视角,讲解对话前端、OpenAI 标准接口、KV Cache 内存管理、批量调度、连续批次等完整服务架构。

大模型对话产品业务功能梳理

基础交互能力

  1. 逐 Token 流式输出,实时展示生成内容;
  2. 推理中断:支持随时终止当前回答;
  3. 多轮上下文记忆,支持历史对话编辑、回溯分支;
  4. 多会话隔离:新建、切换、删除不同话题会话。

底层推理循环基础逻辑

单次推理循环流程:输入上下文 → Prefill 填充 KV Cache → 循环 Decode 生成 Token → 触发终止符/长度上限/用户断连后退出推理。

推理服务标准接口:OpenAI API 规范

同步非流式接口

请求路径:/v1/chat/completions

  • 请求字段:model、messages(system/user/assistant 角色数组)、超参数;
  • 返回:完整一次性对话结果,finish_reason 标记停止原因(stop / length)。

流式推理服务

请求增加 stream: true 标识:

  1. 按生成过程持续返回增量内容;
  2. 用户断连后后端自动终止推理,节省算力;
  3. 解决长等待无反馈、中途放弃浪费资源问题。

服务端 Handler 实现

基于 FastAPI 等 Web 框架搭建 POST 接口,解析 JSON 请求,转发至底层推理引擎,同步/流式封装返回数据包。

多会话核心:KV Cache 内存管理机制

方案一:会话绑定完整 KV Cache

每个会话独立分配一整块最大长度 KV Cache;

  • 优点:上下文前缀 100% 复用,无需重算;
  • 缺点:会话数量受显存严格限制,分支场景内存膨胀严重。

方案二:KV Cache 全局池 + 前缀匹配

共用固定 Cache 内存池,新请求匹配最长历史前缀复用缓存块;

  • 优点:相比固定 Cache 分配方式,可以显著提高显存利用率,支持更多并发会话;
  • 缺点:无匹配时覆盖旧缓存,部分场景需重复计算。

分页式 Paged Attention(工业主流方案)

1. 核心思想

借鉴操作系统虚拟内存分页,不分配整块 Cache,拆分为固定大小 Page 小块,通过映射表拼接逻辑上下文。

2. 复用与分支逻辑

多会话共享相同前缀 Page,采用引用计数管理:

  1. 共享块引用计数 +1;
  2. 当多个会话共享同一 Page,后续请求需要修改该 Page 内容时,通过 Copy-on-Write 创建新的 Page,避免影响其他会话。
  3. 会话销毁时引用计数 -1,计数为 0 回收 Page 内存。

3. 内存扩容兜底策略

Page 池耗尽时,可将闲置 Page Offload 至 CPU / NVME 磁盘释放 GPU 显存。

4. 显存占用现状

7 B / 13 B 模型推理场景,KV Cache 通常占用超过 30% 单卡显存,分页机制大幅提升并发会话上限。

多请求批量调度方案演进

方案1:串行单请求处理

请求排队依次推理;

  • 缺陷:GPU 算力空置,吞吐极低,无法支撑线上并发。

方案2:固定批次 Padding 批处理

同一轮合并多条请求,短请求补零对齐张量;

  • 缺陷:短请求等待长请求,Padding 带来无效算力开销;Prefill / Decode 请求难以进行高效混合调度。

方案3:逐轮动态重批(基础优化)

每轮 Decode 结束后重新从请求池组合 Batch,完成请求直接退出;

  • 改善短请求等待问题,但仍存在大量 Padding 无效计算。

方案4:连续批次 Continuous Batching(工业最优)

1.分层计算拆分

  • 无依赖算子(Linear / RMSNorm / RoPE):可通过连续批处理方式减少 Padding 开销.
  • Attention 层根据各请求的 block table 访问对应 KV Cache,通过批量化 Kernel 完成不同请求 Attention 计算。

2.整体收益

消除无效 Padding,GPU 硬件利用率大幅提升;支持 Prefill、Decode 请求混合调度,适配线上随机流量。

标准推理服务三层分离架构

前端接入模块

Web 接口服务,接收 HTTP 请求、解析 OpenAI JSON、流式数据包推送。

调度管理模块

  1. 全局请求池维护;
  2. 每轮构造连续批次;
  3. Paged Attention KV Cache 块分配、引用计数、内存回收;
  4. 绑定 IO 管线,管理每路用户流式输出。

底层推理引擎模块

执行 Prefill / Decode 推理循环,提供算子、分布式推理底层能力。

模块隔离优势

三模块通过异步队列进行解耦,使请求接收、调度管理和模型计算能够尽可能并行执行,提高系统吞吐。

加入训练营

📺完整课程内容,请观看直播或查看课程回放:
InfiniTensor 官网https://www.infinitensor.com

B站直播: InfiniTensor 官方直播间

视频号直播: InfiniTensor 视频号预约

答疑交流: 训练营官方社群⬇️

关注与交流