
8 月 5 日晚,2026 夏季 InfiniTensor 大模型与人工智能系统训练营迎来第一期大咖课。
- 为什么 AI 崛起后出现了专用 AI 芯片,而非单纯提升传统 CPU/FPGA 性能?这是偶然还是必然?
- 为什么 HBM、高速互联、AI 软件栈成为标配?
- AI 芯片的设计为何不追求单点峰值,而强调系统性权衡?
InfiniTensor 训练营特邀天数智芯 AI 与加速计算负责人单天逸老师,带来《AI and AI Chip》主题分享。该分享从计算范式的百年演进切入,拆解 AI 与芯片相互迭代、共同演化的底层逻辑。
讲师介绍
单天逸,天数智芯 AI 与加速计算负责人
- 参与天垓系列产品的架构设计,负责天垓 300 及后续通用 GPU 芯片的架构规划与核心方案设计;
- 参与天数智芯软件栈、加速库等关键技术研发,致力于 AI 计算芯片的架构创新与工程落地。
计算范式的三次跃迁
1. 串行计算(Serial Computing)

定义:指令依次执行,前一步完成后才能进行下一步。
优势:擅长复杂控制、分支预测、不规则任务;低延迟响应。
历史贡献:推动了现代操作系统、数据库、通信系统以及科学计算的发展,使复杂物理模型能够通过数值模拟和计算方法进行验证与探索。
瓶颈:受限于指令依赖(Dependency),无法通过堆砌硬件破除先后顺序。
2. 并行计算(Parallel Computing)

- (1)诞生三大驱动力:
- 物理墙:频率与功耗达到瓶颈,Dennard 缩放定律失效。
- 需求爆炸:数据量与仿真精度增速远超单核性能增速。
- 算法特性:大量算法(如 Sort、Allreduce、矩阵运算)存在独立操作,无强依赖。
- (2)CPU vs GPU 设计哲学:
- CPU(延迟优先):全能专家,复杂控制单元 + 大 Cache+ 高频,适合复杂业务与 OS。
- GPU(吞吐优先)::大量并行执行单元,通过海量线程隐藏计算与访存延迟;相比 CPU,其控制逻辑占比较低,更强调计算吞吐而非单线程低延迟。
- (3)编程桥梁:CUDA 将 GPU 从图形设备转变为通用并行计算平台。
3. 加速计算(Accelerated Computing)
- 核心理念:让合适的硬件做合适的事(Hardware-Software Co-design)。
- 典型模块:Tensor Core(矩阵乘)、Transformer/Attention 算子优化单元、CNN 卷积单元、专用数据流加速单元。

- Trade-off:以牺牲灵活性和通用性为代价,换取高吞吐、低延迟、低功耗与高性价比。
- 时代意义:20 世纪是“测量世界”(Measure),21 世纪是“生成与创造”(Generate/Create)。
AI 基础设施的“存算连”演化史

| 核心技术 | 最初目的 | AI 时代的“无心插柳” | 关键价值 |
|---|---|---|---|
| GPU | 游戏图形渲染(画三角形) | 深度学习矩阵运算的完美载体 | 高吞吐并行架构 |
| HBM | 提升内存带宽并降低高带宽存储接口功耗(3D 堆叠) | 大模型参数与 KV Cache 的“兵家必争之地” | 高带宽+大容量+低能耗 |
| NVLink | HPC 高性能计算 | 大规模 AI 训练中的 GPU 通信基础设施 | 高速互联+系统级拓扑 |
| LPU | 面向低延迟 AI 推理设计的新型处理架构 | 利用静态调度和确定性执行优化 Transformer 推理 | 低延迟+确定性执行 |
- 芯片设计:不要将当前模型结构固化为唯一答案,应识别相对稳定的能力(高效数据搬运、可扩展并行、灵活数据类型、可编程性)。
AI 芯片架构设计的核心目标与权衡
1. 三大核心指标(不可兼得的三角)

- Price Performance(性价比):完成相同任务的成本。
- Ease of Programming(可编程性):生态壁垒与用户粘性(如CUDA)。
- Flexibility(延展性):支持当前及未来不同模型架构的能力。
2. 四大经典架构 Trade-off

- (1)NUMA vs UMA:
- NUMA:本地内存访问快,远端慢,扩展性好(如 Grace CPU Superchip)。
- UMA:统一内存地址,通用性强。

- (2)Load/Store vs Push Pull:
- Load/Store:灵活通用,适合不规则访问(CPU/GPU 主流)。
- Push/Pull:数据流架构的一类设计思想,通过减少显式访存控制降低开销,适用于规则计算密集任务(部分 AI 加速器采用)。

- (3)Crossbar vs Mesh:
- Crossbar:提供高连接自由度和较低通信冲突,适合小规模高带宽互联,但面积和功耗成本随规模快速增加。
- Mesh:连线少、功耗低,适合 AllReduce,但延迟不均,灵活性差。

- (4)Runtime vs Compile Time:
- Runtime:动态调度,容错高,但执行时间不确定。
- Compile-time:静态排程,极致高效可预测,但容错差、灵活性低。

AI 发展的三个阶段展望

1. 信息智能(Information Intelligence):理解、生成、转换信息(Token/图片/视频)。
2. 行动智能(Agent Intelligence):基于信息理解,独立完成复杂任务(Vibe Coding/OpenClaw)。
3.探索智能(Exploration Intelligence):自主提出假设、设计实验,探索未知规律(新材料/新元素发现),效率提升万倍以上。
飞机隐喻:AI 的发展不应止于表面模仿人类(像鸟拍翅膀),而应深入理解智能的底层规律(空气动力学),通过计算与记忆构建可理解的智慧。
Q&A 精选答疑
Q1:如何看待 CuTe 这类底层开发工具?
A:CuTe 是介于 CUDA C 与 Library 之间的矩阵编程工具。当原生 CUDA 太难、官方 Library 又无法满足细粒度优化需求时,CuTe 提供了更精细的矩阵编程能力,降低了 H100/B100 等新架构的编程门槛。
Q2:蒸馏/量化等算法会减轻芯片压力吗?
A:不会。硬件公司的目标是“用满芯片”而非“减轻压力”。模型越大效果越好,硬件迭代的动力正是为了让更大的模型跑得动、跑得好,从而释放 AI 更大潜力。
Q3:国产 GPU 适配主流框架的最大阻碍是什么?
A:核心是积累不足。不仅是软件库和开发者生态的差距,硬件设计本身的历史迭代经验也影响了算子泛化性与执行效率。这需要时间沉淀,非一日之功。
Q4:如何预判未来新算子?流片后算法变了怎么办?
A:不预判具体算子,只实现完备的数学原语所有算法都由基础运算组成,只要原语齐全+吞吐/延迟设计合理,就能支持未来算法。流片后无法补救算子,靠的是通用性与迭代能力。
Q5:小模型爆发对 GPU 架构有何挑战?
A:小模型对算力要求不高,传统 GPU 即可满足。当前先进芯片研发重心仍在大模型,小模型更多依赖存量硬件,尚未构成对前沿架构的核心挑战。
Q6:优先保证算子兼容还是拉高峰值算力?
A:优先峰值算力。编程模型是为硬件服务的,先有吞吐优先的架构,再有 CUDA 等编程范式。性能与灵活性是根基,兼容性是在此基础上的软件工程问题。
加入训练营
📺完整课程内容,请观看直播或查看课程回放:
InfiniTensor 官网: https://www.infinitensor.com
B站直播: InfiniTensor 官方直播间
视频号直播: InfiniTensor 视频号预约
答疑交流: 训练营官方社群⬇️

关注与交流

