学习资料
2026 夏季 InfiniTensor 训练营通信与并行 3、推理引擎 7、训练系统 6:《基于九源平台的国产化集群应用实践及优化》

8 月 12 日,2026 夏季 InfiniTensor 训练营通信与并行方向第三课、推理引擎方向第七课、训练系统方向第六课《基于九源平台的国产化集群应用实践及优化》开讲。
前置课程《大模型并行策略与通信优化》拆解大模型分布式训练各类并行方案、集合通信算子底层原理、通信性能优化核心手段;《InfiniLM》聚焦 InfiniLM,解析作业与项目所需的工程架构,介绍实现路径与评审标准,并解析 InfiniCore 与 InfiniLM;《强化学习基础与 DeepSeek 训练介绍》讲解强化学习核心理论与经典算法及 DeepSeek V3 至 V4 的架构演进;

本节课以科普+实操为核心,介绍国产 DCU 硬件架构以及一站式 AI 开发环境,讲解曙光智算超算互联网平台与九源 InfiniTensor 的融合应用。

AI 功能简介

AI 服务产品架构

1. 硬件资源层

  • 异构算力支持:CPU(Intel/AMD/海光)、GPU、国产 DCU
  • 存储产品:支持弹性扩容与高速协同加载

2. 计算服务中台

  • K8s 容器编排:适配 AI 个性化环境需求,集成 Notebook 工具
  • Slurm 调度系统:面向高性能计算,支持弹性算力队列与容器化任务
  • 模型推理服务:私有化一键部署,保障数据敏感场景下的 Token/提示词安全

3. 平台服务

  • HPC 服务与运营运维管理:支持团队资源分配与监控
  • 通用场景交付:物理机交付、线上共享资源、云主机等

4.内容服务

  • AI 社区:教学视频、课程文档、前沿论文解读
  • 模型中心:一站式模型托管与调用,替代传统外部下载方式
  • 创空间(原应用广场):自定义 AI 应用(如 ComfyUI)网页化发布与分享

资源类型丰富

1. CPU 资源:海光芯片多规格可选(主频/内存弹性配置)

2. GPU 资源:英伟达系列及配套 CPU 资源筛选

  • 重点:国产 DCU 加速卡
    • Z 系列(子房):16G/32G 显存起步
    • K 系列(孔明):K100 等迭代型号
    • BW 系列(伯温):当前主力 64G 显存,后续 BW 系列产品提供更大显存规格
      以古代先贤命名,寓意“智者算力”

深算三号 BW1000

DeepAI 深算智能引擎

1. 底层工具套件 DTK

  • 对标 CUDA 的算子覆盖度超过 99%
  • 代码格式无缝迁移,降低国产化适配门槛

2. DAS AI 软件栈

  • 预置 PyTorch/TensorFlow/Triton 等框架优化版
  • 社区提供轮子包(Wheel),pip 安装即用(当前版本 v1.6)

3. 行业应用场景

  • AI 推理/训练、云服务、政务、自动驾驶、材料科学、能源勘探、生物医药等

Notebook、模型训练和模型部署

Notebook 启动

  1. 登录控制台 → 人工智能 → Notebook
  2. 选择资源组(DCU 型号/显存/DTK 版本)
  3. 选择镜像(基础镜像/社区镜像/我的镜像)
  4. 创建容器 → 进入 JupyterLab / Terminal
  5. 文件管理:通过 Private Data 上传/访问数据
  6. 监控面板:实时查看 CPU/内存使用率 + TensorBoard 训练监控
  7. 自定义服务:端口映射至公网,分享 ComfyUI 等应用链接
    8.关机前务必“保存环境”以便复用

模型训练

镜像管理

AI 环境搭建

集群 AI 相关数据路径

DAS 工具包

DAS 专用软件包安装

  • 注意事项:严格匹配软件版本、DTK 版本、Python 版本

实操演示

九源 InfiniTensor 快速接入

  • 路径:AI 社区 → 搜索“九源”或“InfiniTensor”
  • 两种使用方式:
    • 免费试用:基础功能体验
    • 实例创建:选择资源+模型包+镜像,一键进入推理/计算环境
  • 支持克隆模型权重/应用程序至控制台直接使用

加入训练营

📺完整课程内容,请观看直播或查看课程回放:

InfiniTensor 官网https://www.infinitensor.com

B站直播: InfiniTensor 官方直播间

视频号直播: InfiniTensor 视频号预约

答疑交流: 训练营官方社群⬇️

关注与交流