2025年冬季InfiniTensor大模型与人工智能系统训练营
已结束

主办方:启元实验室

赞助方:新华三技术有限公司

时间:2025-12-24 ~ 2026-03-27

报名人数

0

专业阶段
2025年冬季InfiniTensor大模型与人工智能系统训练营
通过直播课程与作业实践,掌握各技术方向的核心知识体系,为项目阶段奠定专业基础
时间: 2026-01-03 - 2026-02-05
签到人数: 0

人工智能系统专业知识


    学习目标

通过直播课程与作业实践,掌握各技术方向的核心知识体系,为项目阶段奠定专业基础。


    学习路径

■ 课程研习

    • 采用 直播授课 + 编程实践 形式
    • 支持跨方向自由选课(鼓励并行研修多门课程)

■  硬件支持

    • 部分课程需特定硬件环境完成作业
    • 提供 免费算力资源(使用规则可参考指南)


    晋级机制

  • 完成任意一个可晋级的专业方向,并满足该方向的晋级要求
  • 成功晋级的学员会受邀加入项目研发群
  • 具体晋级规则和相关细节可参考指南


课表

交互课表可见:

https://gxtctab8no8.feishu.cn/wiki/Qn9MwPf9mi97KakvgxtcfD0Qnjh?from=from_copylink

该课表支持:

  • 在表头进行多条件筛选,例如按课程方向、授课时间段或授课教师等维度进行快速查找;
  • 还可借助课表中的 “前置” 列查看课程的前置要求,并一键跳转至对应的前置课程,便于系统性规划学习顺序与路径。


课程简介

    CUDA 编程

CUDA 并行编程 (CUDA Programming)
课程内容简介课程从零开始构建 GPU 并行计算思维,通过“问题驱动→分析瓶颈→优化实现→定量评估”的实战闭环逻辑,逐步深入 CUDA 核心知识与工业级优化技术。课程将深入 GPU 硬件架构与编程模型,并重点攻克性能瓶颈分析与调优:包括 Roofline 模型诊断算子的访存/计算瓶颈、内存合并与向量化优化、共享内存分块策略、Bank Conflict 规避、Swizzling 索引重构等关键技术。课程深度结合英伟达官方工具链(Nsight Compute/Systems)进行性能热点定位与优化验证。
在此之上,课程将扩展至系统级优化:通过多流并行、CUDA Graph 静态调度等实现计算-传输重叠,运用动态并行处理不规则任务,实践多 GPU 协同通信等。最后聚焦工业部署场景,涵盖低精度量化、 PTX 指令级调优和 CUDA 官方库应用等技能。
课程预期目标通过本课程学员可以:
1. 建立并行计算与高性能计算的思维逻辑,具备持续适应技术演进的核心能力;
2. 具备从单一算子至多 GPU 环境运行的复杂系统的设计、实现与优化能力;
3. 系统性的掌握 GPU 硬件架构、CUDA 编程模型、Nsight 性能工具使用以及工业级部署与调优能力;
4. 具备业界所需的 CUDA 开发能力;
学时共 7 小时
预备知识需 C++ 基础,最好有计算机体系结构的背景知识
授课方式讲课、实验/实践、项目
课程简称课时详细课程名称
CUDA11 小时第一课时. “众人拾柴火焰高”——并行编程导论与 CUDA 入门
CUDA21 小时第二课时. “墙壁上的行军图”——性能模型与逐元素优化
CUDA31 小时第三课时. “从山巅到海床”——内存模型与规约优化
CUDA41 小时第四课时. “乾坤大挪移”——分块与不规则访存
CUDA51 小时第五课时. “时间折叠术”——异步并行、底层控制与系统优化
CUDA61 小时第六课时. “精益求精”——量化与工业级调优部署
CUDA71 小时CUDA 程序迁移至天数智芯 GPU

    训练系统

训练系统 (Training System)
课程内容简介课程围绕大模型训练系统的关键技术展开,结合实际工程框架,系统介绍训练基础理论、并行加速技术、通信优化策略与框架编程实践,帮助学员掌握从单机训练到分布式多机多卡训练的完整体系。
课程预期目标通过本课程,学员将能够:
1. 理解神经网络训练的基本原理,掌握从单机单卡到多机多卡的训练范式演进路径;
2. 系统掌握分布式训练的主流策略,包括数据并行、模型并行、混合并行等方法及其优化思路;
3. 掌握从 PyTorch 编写基础训练代码到使用 Megatron 等框架实现大模型训练的完整流程,具备阅读、复用、调试大规模训练框架代码的能力;
4. 掌握强化学习训练中的核心技术路线与系统设计,理解其在大规模训练系统中的特殊挑战与解决方案。
学时共 5 小时
预备知识C++,Python,微积分
授课方式讲课、项目
课程简称课时详细课程名称
训练11 小时第一课时 “训练基础介绍”
训练21 小时第二课时 “分布式训练”
训练31 小时第三课时 “大模型训练中的显存优化”
训练41 小时第四课时 “训练框架编程基础”
训练51 小时第五课时 “强化学习基础与 DeepSeek 训练介绍”

    大模型推理服务系统

大模型推理服务系统 (LLM inference and Serving System)
课程内容简介课程将讲解大模型基本原理、学习大模型推理的相关知识,了解大模型推理系统的优化方式以及分布式推理方式,通过实践学习从零搭建大模型推理服务
课程预期目标理解大模型基本原理、学习大模型推理的相关知识,了解大模型推理系统的优化方式以及分布式推理方式,通过实践学习从零搭建大模型推理服务
学时共 7 小时
预备知识C++、Python、PyTorch、Git、CUDA
授课方式讲课、项目
课程简称课时详细课程名称
推理11 小时AI模型导论与推理基础原理
推理21 小时大模型原理与结构
推理31 小时从大模型推理到AI对话
推理41 小时大模型计算优化与分布式推理
推理51 小时大模型服务系统
推理61 小时InfiniLM
推理71 小时vLLM-Ascend 大模型推理

    AI 编译器

AI 编译器 (AI Compiler)
课程内容简介本课程内容涵盖传统编译器与AI编译器的核心区别、AI编译器的完整工作流程及主流生态。重点探讨AI编译器前端技术,包括模型导入与图优化,并梳理以PyTorch为代表的动态计算图优化演进路线。同时,系统介绍后端流程中的运行时、算子调用与相关优化方法。课程最后将聚焦于 InfiniTensor 推理框架的使用。
课程预期目标本课程旨在帮助学生深入理解AI编译器的核心原理与设计方法,系统掌握现代AI编译技术栈的关键组件和优化手段,培养开发高性能、可移植AI模型编译优化的工程实践能力。课程结束后,学生将能够深入理解AI编译器的核心流程和技术体系:
1.掌握从高层计算图(如PyTorch FX Graph/ONNX)到底层硬件代码的全链路编译流程;
2.学习计算图优化技术,包括常量折叠、冗余节点消除、算子融合等基础优化;
3.熟悉内存优化策略,涵盖内存分配、布局转换、内存复用等关键技术
学时共 7 小时
预备知识建议学生具备以下基础: 1. 编程基础:熟悉Python和C++,了解基本的算法与数据结构。 2. 机器学习基础:理解神经网络模型(如CNN/Transformer)的结构与推理流程。 3. 编译原理入门:了解词法分析、语法分析、中间表示(IR)等基本概念。 4. 硬件基础(可选):对CPU/GPU/TPU的架构特性有基本认知,有助于理解后端优化。
授课方式讲课、实验/实践、项目
课程简称课时详细课程名称
AI编译器11 小时AI编译器概述
AI编译器21 小时AI编译器中的前端优化
AI编译器31 小时PyTorch中图优化
AI编译器41 小时AI编译器中的后端优化
AI编译器51 小时Stable Diffusion 在 InfiniTensor 推理框架中的适配与工程实践
AI编译器61 小时(MLIR) AscendNPU IR 编译堆栈
AI编译器71 小时拓展 Triton 深度学习编译器——DLCompiler

    Triton & 九齿

Triton & 九齿(Triton & NineToothed)
课程内容简介Triton 的入门与实践。介绍什么是 Triton,如何用 Triton 实现各种常见的计算内核。九齿的入门与实践。介绍什么是九齿,如何用九齿实现各种常见的计算内核,以及怎样将九齿应用到大模型推理当中。
课程预期目标通过本课程,学员将学会如何使用 Triton 进行并行编程,并通过实践进行一系列计算内核的开发,以此了解定制化计算内核的效果与必要性。
通过本课程,学员将学会如何使用九齿进行并行编程,并通过实践进行一系列计算内核的开发,以此了解定制化计算内核的效果与必要性。
学时共 7 小时
预备知识Python
授课方式讲课、实验/实践、项目
课程简称课时详细课程名称
Triton & 九齿11 小时Triton 练气术
Triton & 九齿21 小时九齿一重:初窥
Triton & 九齿31 小时九齿二重:渐悟
Triton & 九齿41 小时九齿三重:天通
Triton & 九齿51 小时天数智芯 Triton 实战
Triton & 九齿61 小时Triton-Ascend 编程
Triton & 九齿71 小时DLCompiler 的高性能算子开发实践

    OpenCL 编程

OpenCL 编程(OpenCL Programming)
课程内容简介本课程面向移动SoC与Intel平台,深入讲解OpenCL运行时架构与编程模型,并结合GGUF量化与TVM自动化调优技术,系统讲解基于OpenCL的高性能大模型通用算子开发、实现与深度优化实战
课程预期目标学习使用OpenCL编写内核;了解gguf量化知识;能够开发大模型通用算子并能够根据硬件相关扩展支持对算子进行深度优化。
学时共 3 小时
预备知识C/C++,大模型基础知识
授课方式讲课、实验/实践、项目
课程简称课时详细课程名称
OpenCL11 小时OpenCL概述及运行时
OpenCL21 小时OpenCL编程抽象和基础语法
OpenCL31 小时OpenCL算子的实现与优化

    CPU 并行编程

CPU 并行编程 (CPU Parallel Programming)
课程内容简介主要介绍基于CPU的GEMM加速技术,对性能优化有一个初步的认知,并引申出在端侧的应用,基于端侧部署的需求详细介绍如何在cpu进行指令集加速实战
课程预期目标通过本课程的学习,学员将学会CPU的GEMM加速技术,对性能优化有一个初步的认知,并了解其在端侧的应用,学习如何通过指令集实现加速
学时共 3 小时
预备知识C++,计算机基础
授课方式讲课
课程简称课时详细课程名称
CPU11 小时CPU 性能优化导论
CPU21 小时CPU 指令集加速实战
CPU31 小时鲲鹏 CPU 矩阵加速与特性介绍

    通信与并行优化

通信与并行优化 (Communication & Parallel Optimization)
课程内容简介课程从硬件到软件全面剖析支撑现代人工智能的核心——AI集群与通信。内容涵盖从硬件互联到软件优化的全链路知识,重点解析AI集群中“算网协同”的关键技术与设计思想。课程将深入探讨PCIe、NVLink等硬件互联方案,智算中心网络拓扑、拓展模式与超节点架构,InfiniBand、RoCEv2 等高速通信协议,以及各类通信操作、并行策略和算法等软件层关键技术与模式,介绍在各类并行模式中涉及的通信操作。
课程预期目标通过本课程的学习,学员可以:
1. 理解AI基础设施中通信技术的发展脉络与“算网协同”的核心价值
2. 掌握智算中心硬件互联、网络架构及通信协议的核心概念与技术选型的基础依据
3. 区分点对点与集合通信的特性,并理解其在AI并行策略中的关键作用
3. 了解主流集合通信操作与优化算法,具备初步的通信瓶颈分析与优化能力
4. 建立从硬件互联到软件通信的完整知识框架,为从事AI系统优化奠定基础
学时共 2 小时
预备知识C++ 基础,最好有计算机体系结构的背景知识
授课方式讲课
课程简称课时详细课程名称
通信与并行11 小时“星星之火,可以燎原”——互联、集群与通信
通信与并行21 小时大模型并行策略与通信优化

    大模型前沿技术

大模型前沿技术(Advanced Models)
课程内容简介本课程聚焦大模型时代的前沿模型形态、系统架构与应用范式,系统梳理当前主流大模型技术的发展脉络与未来趋势。课程以大语言模型(LLM)为主线,逐步扩展至检索增强模型(RAG)、自主智能体(Agent)、多模态大模型以及科学多模态模型等前沿方向,全面覆盖当前主流大模型形态及其衍生能力,深入解析模型结构演进、能力构成与应用扩展方式。
课程预期目标通过本课程的学习,学员可以理解大模型与前沿模型技术的发展背景、演进路径及其在人工智能体系中的核心地位,掌握大语言模型、多模态模型等主流前沿模型的基本架构思想与能力特征,并建立对前沿模型“模型结构—系统架构—应用范式”协同演进的整体认知,为后续模型应用、系统设计与工程实践打下基础
学时共 6 小时
预备知识
授课方式讲课
课程简称课时详细课程名称
前沿模型11 小时大模型学习方法
前沿模型21 小时检索增强的语言模型
前沿模型31 小时大模型前沿架构
前沿模型41 小时大模型自主智能体
前沿模型51 小时多模态智能及其应用
前沿模型61 小时科学多模态大模型

神秘嘉宾授课

   大咖课会邀请来自学术界与工业界的一线专家与技术负责人,围绕前沿技术进展、产业实践经验与未来发展趋势进行分享,帮助学员拓展技术视野,理解真实产业场景中的系统设计与落地挑战。学员能有机会同业内大咖进行 Q&A。大咖课的具体时间会在授课阶段适时公布。

课程依赖与学习路线

学员可结合上方课程依赖图,清晰了解各门课程之间的依赖关系与前置要求,从而根据自身背景与兴趣方向,有针对性地选择学习内容,合理规划所需的前置课程与循序渐进的学习路线,逐步构建完整的 AI 系统知识体系。