
随着大模型参数规模持续增长,模型能力不断提升,但计算成本、显存占用和部署效率等挑战也日益突出。
量化技术通过降低模型计算与存储所需的位宽,在减少资源消耗的同时尽可能保持模型性能,为大模型高效训练与推理提供了关键技术路径。
今天(8 月 12 日) 17:00 ,2026 夏季 InfiniTensor 训练营邀请清华大学计算机科学与技术系副教授陈键飞,带来专题课程《大模型量化》。课程将围绕大模型量化的基本原理展开,解析低位宽计算技术在训练与推理加速中的应用,并探讨如何在提升计算效率的同时保持模型精度,帮助大家了解大模型高效部署背后的关键技术路径。

讲师介绍
陈键飞 | 清华大学计算机科学与技术系 副教授
🔹2014 年获清华大学计算机学士学位,2019 年获博士学位。入选 2022 年度 CCF 青年人才发展计划,曾获中国计算机学会优秀博士学位论文奖、清华大学水木学者等荣誉。
🔹主要从事高效机器学习研究,重点关注低位宽与量化神经网络、深度学习优化、概率推理及大模型高效计算。近年来在训练后量化、量化感知训练、全量化训练以及 NVFP4 等低精度计算技术开展理论与算法研究。
🔹相关成果发表于 ICML、NeurIPS、ICLR 等国际会议,发布了 ActNN、WarpLDA、ZhuSuan、SageAttention 等多个开源软件。
课程亮点
在本次课程中,陈键飞老师将围绕以下核心内容展开分享:
1️⃣ 介绍大模型量化的基本原理与核心技术;
2️⃣ 讲解低位宽量化技术如何提升神经网络训练与推理效率;
3️⃣ 探讨如何在降低计算和存储开销的同时,保持大模型的计算精度。
课程直播信息
📅直播时间:8 月 12 日(周三) 17:00
🖥️参与方式:
InfiniTensor 官网: https://www.infinitensor.com
B 站直播: InfiniTensor 官方直播间
视频号直播: InfiniTensor 视频号
⬇️扫描下方二维码加入训练营官方社群
关注与交流

