学习资料
2026 夏季 InfiniTensor 训练营大咖课 1:天数智芯 AI 与加速计算负责人单天逸——《AI and AI Chip》

8 月 5 日晚,2026 夏季 InfiniTensor 大模型与人工智能系统训练营迎来第一期大咖课。

  • 为什么 AI 崛起后出现了专用 AI 芯片,而非单纯提升传统 CPU/FPGA 性能?这是偶然还是必然?
  • 为什么 HBM、高速互联、AI 软件栈成为标配?
  • AI 芯片的设计为何不追求单点峰值,而强调系统性权衡?

InfiniTensor 训练营特邀天数智芯 AI 与加速计算负责人单天逸老师,带来《AI and AI Chip》主题分享。该分享从计算范式的百年演进切入,拆解 AI 与芯片相互迭代、共同演化的底层逻辑。

讲师介绍

单天逸,天数智芯 AI 与加速计算负责人

  • 参与天垓系列产品的架构设计,负责天垓 300 及后续通用 GPU 芯片的架构规划与核心方案设计;
  • 参与天数智芯软件栈、加速库等关键技术研发,致力于 AI 计算芯片的架构创新与工程落地。

计算范式的三次跃迁

1. 串行计算(Serial Computing)

  • 定义:指令依次执行,前一步完成后才能进行下一步。

  • 优势:擅长复杂控制、分支预测、不规则任务;低延迟响应。

  • 历史贡献:推动了现代操作系统、数据库、通信系统以及科学计算的发展,使复杂物理模型能够通过数值模拟和计算方法进行验证与探索。

  • 瓶颈:受限于指令依赖(Dependency),无法通过堆砌硬件破除先后顺序。

2. 并行计算(Parallel Computing)

  • (1)诞生三大驱动力
    • 物理墙:频率与功耗达到瓶颈,Dennard 缩放定律失效。
    • 需求爆炸:数据量与仿真精度增速远超单核性能增速。
    • 算法特性:大量算法(如 Sort、Allreduce、矩阵运算)存在独立操作,无强依赖。
  • (2)CPU vs GPU 设计哲学
    • CPU(延迟优先):全能专家,复杂控制单元 + 大 Cache+ 高频,适合复杂业务与 OS。
    • GPU(吞吐优先)::大量并行执行单元,通过海量线程隐藏计算与访存延迟;相比 CPU,其控制逻辑占比较低,更强调计算吞吐而非单线程低延迟。
  • (3)编程桥梁:CUDA 将 GPU 从图形设备转变为通用并行计算平台。

3. 加速计算(Accelerated Computing)

  • 核心理念:让合适的硬件做合适的事(Hardware-Software Co-design)。
  • 典型模块:Tensor Core(矩阵乘)、Transformer/Attention 算子优化单元、CNN 卷积单元、专用数据流加速单元。

  • Trade-off:以牺牲灵活性和通用性为代价,换取高吞吐、低延迟、低功耗与高性价比。
  • 时代意义:20 世纪是“测量世界”(Measure),21 世纪是“生成与创造”(Generate/Create)。

AI 基础设施的“存算连”演化史

核心技术 最初目的 AI 时代的“无心插柳” 关键价值
GPU 游戏图形渲染(画三角形) 深度学习矩阵运算的完美载体 高吞吐并行架构
HBM 提升内存带宽并降低高带宽存储接口功耗(3D 堆叠) 大模型参数与 KV Cache 的“兵家必争之地” 高带宽+大容量+低能耗
NVLink HPC 高性能计算 大规模 AI 训练中的 GPU 通信基础设施 高速互联+系统级拓扑
LPU 面向低延迟 AI 推理设计的新型处理架构 利用静态调度和确定性执行优化 Transformer 推理 低延迟+确定性执行
  • 芯片设计:不要将当前模型结构固化为唯一答案,应识别相对稳定的能力(高效数据搬运、可扩展并行、灵活数据类型、可编程性)。

AI 芯片架构设计的核心目标与权衡

1. 三大核心指标(不可兼得的三角)

  • Price Performance(性价比):完成相同任务的成本。
  • Ease of Programming(可编程性):生态壁垒与用户粘性(如CUDA)。
  • Flexibility(延展性):支持当前及未来不同模型架构的能力。

2. 四大经典架构 Trade-off

  • (1)NUMA vs UMA
    • NUMA:本地内存访问快,远端慢,扩展性好(如 Grace CPU Superchip)。
    • UMA:统一内存地址,通用性强。

  • (2)Load/Store vs Push Pull
    • Load/Store:灵活通用,适合不规则访问(CPU/GPU 主流)。
    • Push/Pull:数据流架构的一类设计思想,通过减少显式访存控制降低开销,适用于规则计算密集任务(部分 AI 加速器采用)。

  • (3)Crossbar vs Mesh
    • Crossbar:提供高连接自由度和较低通信冲突,适合小规模高带宽互联,但面积和功耗成本随规模快速增加。
    • Mesh:连线少、功耗低,适合 AllReduce,但延迟不均,灵活性差。

  • (4)Runtime vs Compile Time
    • Runtime:动态调度,容错高,但执行时间不确定。
    • Compile-time:静态排程,极致高效可预测,但容错差、灵活性低。

AI 发展的三个阶段展望

1. 信息智能(Information Intelligence):理解、生成、转换信息(Token/图片/视频)。

2. 行动智能(Agent Intelligence):基于信息理解,独立完成复杂任务(Vibe Coding/OpenClaw)。

3.探索智能(Exploration Intelligence):自主提出假设、设计实验,探索未知规律(新材料/新元素发现),效率提升万倍以上。

飞机隐喻:AI 的发展不应止于表面模仿人类(像鸟拍翅膀),而应深入理解智能的底层规律(空气动力学),通过计算与记忆构建可理解的智慧。

Q&A 精选答疑

Q1:如何看待 CuTe 这类底层开发工具?
A:CuTe 是介于 CUDA C 与 Library 之间的矩阵编程工具。当原生 CUDA 太难、官方 Library 又无法满足细粒度优化需求时,CuTe 提供了更精细的矩阵编程能力,降低了 H100/B100 等新架构的编程门槛。

Q2:蒸馏/量化等算法会减轻芯片压力吗?
A:不会。硬件公司的目标是“用满芯片”而非“减轻压力”。模型越大效果越好,硬件迭代的动力正是为了让更大的模型跑得动、跑得好,从而释放 AI 更大潜力。

Q3:国产 GPU 适配主流框架的最大阻碍是什么?
A:核心是积累不足。不仅是软件库和开发者生态的差距,硬件设计本身的历史迭代经验也影响了算子泛化性与执行效率。这需要时间沉淀,非一日之功。

Q4:如何预判未来新算子?流片后算法变了怎么办?
A:不预判具体算子,只实现完备的数学原语所有算法都由基础运算组成,只要原语齐全+吞吐/延迟设计合理,就能支持未来算法。流片后无法补救算子,靠的是通用性与迭代能力。

Q5:小模型爆发对 GPU 架构有何挑战?
A:小模型对算力要求不高,传统 GPU 即可满足。当前先进芯片研发重心仍在大模型,小模型更多依赖存量硬件,尚未构成对前沿架构的核心挑战。

Q6:优先保证算子兼容还是拉高峰值算力?
A:优先峰值算力。编程模型是为硬件服务的,先有吞吐优先的架构,再有 CUDA 等编程范式。性能与灵活性是根基,兼容性是在此基础上的软件工程问题。

加入训练营

📺完整课程内容,请观看直播或查看课程回放:

InfiniTensor 官网https://www.infinitensor.com

B站直播: InfiniTensor 官方直播间

视频号直播: InfiniTensor 视频号预约

答疑交流: 训练营官方社群⬇️

关注与交流