学习资料
2026 夏季 InfiniTensor 训练营 AI 编程与智能体应用 9:《麒麟 Agent 运行时系统和智算软件栈优化方法》

8 月 11 日,2026 夏季 InfiniTensor 训练营 AI 编程与智能体应用第九课《麒麟 Agent 运行时系统和智算软件栈优化方法》开讲。
上一课《大模型自主智能体》从理论层面讲解大模型自主智能体技术链路,包含 ReAct 循环、三类工具学习范式、X-Agent、ChatDev 多角色协作等通用框架相关内容。

本节课从操作系统视角解析 Agent 运行时与 OS 的关系及软件栈优化方法,介绍麒麟软件产品体系,讲解智算操作系统如何屏蔽异构算力差异、AI 软件栈等内容。

麒麟软件与国产操作系统产品体系

麒麟发展历程

  1. 源头:银河巨型机时代自研系统;863 专项孵化银河麒麟;
  2. 分支:中标麒麟面向通用桌面、服务器场景;
  3. 整合:2020 年银河麒麟与中标麒麟合并为麒麟软件,多次斩获国家科技进步一等奖。

核心操作系统产品

  1. OpenKylin 开源社区:商业版上游开源基座,内置 wlcom 显示合成器、UKUI 桌面。

  1. 银河麒麟桌面 V11:磐石架构、KSAF 可编程安全框架、原生 AI PC 端侧 AI 适配。

  1. 银河麒麟服务器 V11:深度融合 AI 能力,支持虚拟化、资源调度等服务器场景。

  1. 星光麒麟万物智联系统:面向万物智联场景的智能终端操作系统,采用统一应用框架,支持多种国产移动 SoC。

  1. 银河麒麟工业操作系统:轻量桌面、实时隔离、原子更新,适配产线嵌入式设备。

  1. 银河麒麟智算操作系统:面向人工智能大模型训练和推理场景。支持异构混训

生态适配规模

智算操作系统和智算软件栈

国家政策环境

国家 AI+ 行动、政务大模型适配指引要求算力一地建设、多地复用,需操作系统提供统一异构调度、数据安全隔离能力。

国产 AI 软件栈发展现状

  1. 国产异构芯片算力存在差距;

  1. 各厂商编程框架、推理引擎、算子库、通信接口不统一,应用迁移成本极高;

  1. 多卡跨节点通信无标准化方案,混合训练推理吞吐损失严重。

智算操作系统核心目标

构建屏蔽部分硬件差异的统一 AI 软件底座,降低模型在不同芯片平台上的适配与部署成本。

1.银河麒麟深度学习框架 KylinDLA

  • 统一适配多版本 PyTorch,兼容英伟达、AMD、国产各类异构加速卡,抹平框架版本差异。

2.面向国产 CPU+GPU 的算子优化

  • 算子融合:合并连续计算,削减 HBM 访存读写;
  • 内存调度:KV Cache 分页、张量复用,降低峰值显存占用;
  • CPU/GPU 协同分工,均衡负载;
  • 已完成多个国产 GPU 专用算子深度调优。

3. 异构加速卡统一通信库

分层模块化设计,分为策略层、模型层、机制层:

  • 同芯片:调用厂商原生通信接口;
  • 跨异构芯片: 通过 RDMA 等高速互联技术实现不同计算设备间的数据传输与通信优化;
  • 内置 AllReduce / AllGather 集合通信优化,支持多卡混合训练、推理。

4. 麒麟智算操作系统

  • 独立开发沐曦、天枢、海光等芯片专属算子库,支持 FP 8 / INT 8 量化、GQA / MQA 注意力、矩阵乘,7B / 72 B 大模型推理性能较原厂提升显著。

上层模型生态适配

  • 已适配大语言、多模态视觉、语音、推荐等200+ 主流模型,配套智算生态网站一键部署。

基于全国产智算底座的一体机解决方案

  1. 数字员工一体机:问答、文档处理、翻译、会议多场景封装,私有化部署;
  2. AI 教学一体机:配套训练推理实操题目,适配训练营课程开发调试;
  3. 编程助手一体机:内网代码生成、工作流自动化、代码评审;
  4. 智慧客服一体机:专属知识库、多轮对话、工单自动生成。

端侧 AI 软件栈和 Agent 运行时系统

端侧 AI 架构

端侧硬件约束:算力有限、带宽低、显存小,侧重功耗与算力平衡。

端侧 MoE 模型推理优化

1. 降低路由 TopK:减少专家激活数量,降低计算量;

2. 缩小单个专家:

3. 路由算法优化:简单输入少激活专家,复杂输入多专家协同;

4. 推理部署优化:专家卸载;推测解码。

推理性能 Profiler 分析工具

算子级追踪 Kernel 耗时、访存开销,自动给出剪枝、量化、算子融合优化建议,适配全系列国产 NPU / GPU。

注意力算子优化(面向 GQA / MQA)

重构内存排布,合并单 Block 内多头计算,提升 Warp 归约效率,访存下降,整体性能提升 20% +。

Sampler 采样算子融合

整合 TopK / TopP / Temperature 全套逻辑,消除多次 Load / Store 访存冗余,Batch 越大加速效果越明显。

量化访存优化(GPTQ、AWQ)

加入训练营

📺完整课程内容,请观看直播或查看课程回放:

InfiniTensor 官网https://www.infinitensor.com

B站直播: InfiniTensor 官方直播间

视频号直播: InfiniTensor 视频号预约

答疑交流: 训练营官方社群⬇️

关注与交流