7 月 17 日至 7 月 20 日,2026 世界人工智能大会暨人工智能全球治理高级别会议(WAIC 2026) 在上海举行。
本届 WAIC 采用“三地四馆”联动模式,在上海浦东新区和徐汇区同步举办,以 “智能伙伴 共创未来” 为主题,由外交部、国家发改委、工业和信息化部、教育部、科技部、国务院国资委、国家互联网信息办公室、中国科学院、中国科协和上海市人民政府共同主办。
九源智能计算系统生态联合体(以下简称“九源联合体”) 亮相本次大会,助力上海人工智能实验室KernelSwift 算子创新大赛,并受邀走进沐曦开源工坊。从 AI4S 前沿赛道的命题布局,到异构算力性能提升的实测验证,九源联合体正以实际行动推动国产算力软件栈的开源协同。
助力 KernelSwift 算子创新大赛启动,推动 AI4S 人才培养
为推动国产智能计算软件生态发展,上海人工智能实验室依托 DeepLink 开源社区打造了 KernelSwift 智能算子迁移平台。该平台面向国产多元芯片生态,支持 PyTorch 算子一键跨硬件迁移与性能调优,致力于解决算子迁移难、优化成本高、复用性差等行业痛点。依托 KernelSwift 平台,上海人工智能实验室发起 KernelSwift 算子创新大赛。
7 月 19 日,九源联合体副秘书长吕墨尘老师参加上海浦江实验室生态论坛,并作为合作伙伴代表之一,共同见证了 KernelSwift 算子创新大赛正式启动。

聚焦 AI4S,推动国产软件生态共建
KernelSwift 算子创新大赛是面向国产多元芯片适配的专业赛事,大赛主题为 “KernelSwift 算子迁移・Agent 优化・国产适配”,核心目的是建立统一算子标准,加速国产芯片在 AI4S 等前沿大模型场景适配与应用。
作为合作单位之一,九源联合体将参与合作赛道,聚焦 AI4S 方向进行命题,围绕智能计算驱动科学发现、算子优化及国产软件生态建设等方向,与产业界和学术界共同推动更多开发者参与国产基础软件创新实践,持续培养智能计算领域人才。
受邀走进 WAIC 2026 沐曦开源工坊,共建国产智能计算开源生态
WAIC 2026 期间,九源联合体受邀走进沐曦开源工坊,围绕国产智能计算软件栈建设,展示了在编程语言、训练框架、推理技术、人才培养及生态建设等方面的实践成果,包括:
- 九齿(NineToothed): 九源领域编程语言
- InfiniLM: 九源大模型推理框架
- InfiniTrain: 九源训练引擎
- InfiniCCL: 面向异构 AI 集群的统一集合通信基础设施
- InfiniSpec: 弹性多级投机推理技术
- InfiniTensor 大模型与人工智能系统训练营: 普及 AI 全栈知识技术,培养工程实践和创新型人才,推广国产软硬件技术生态
- 人工智能大赛: 面向全国人工智能领域开发者、科研人员及高校学生的赛事


异构部署验证,释放国产算力协同潜力
随着大模型推理规模持续增长,Prefill-Decode(PD)分离架构正逐渐成为提升系统吞吐、优化资源利用的重要技术方向。基于 九源大模型推理框架 InfiniLM,InfiniTensor 团队持续推进面向国际主流加速卡与沐曦加速卡的异构 PD 分离能力建设,可根据不同业务场景灵活配置 Prefill 节点与 Decode 节点,使不同硬件充分发挥各自优势,并通过 RDMA 通信实现跨节点高效协同,为构建大规模异构推理集群提供了稳定支撑。
相关性能验证表明,采用 “国际主流加速卡 + 沐曦加速卡” 的异构部署方案,相较于纯国际主流加速卡的同构方案,在 TP2/1P1D、TP4/2P2D、TP8/4P4D 等多种典型部署配置下均取得了更优的推理性能。其中,输出吞吐 和 总吞吐 在不同配置下均实现提升,在并行场景中最高提升超过 2 倍;同时,平均 Token 间延迟(ITL) 在部分典型场景下降幅明显,显著提升推理响应效率。
该方案充分发挥了 PD 分离架构在资源调度与异构协同方面的优势,验证了国产算力与主流 AI 软件生态协同运行的可行性,为异构算力在大模型推理场景中的规模化应用提供了实践参考。
百卡模型训练优化验证,持续提升国产算力训练效率
近日,InfiniTensor 团队在沐曦智算集群上完成大规模模型训练优化验证。测试集群由 32 个计算节点组成,每节点配置 8 张加速卡,总规模达到 256 卡。基于 Megatron 分布式训练框架,成功支撑 9G 80B、Qwen 235B 及 DeepSeek V3.1 满血版等模型稳定训练。
针对大规模数据并行过程中梯度同步数据量大、跨节点通信开销高等问题,团队以 DGC(深度梯度压缩)算法 为基础,通过重要梯度筛选、梯度稀疏化等机制减少梯度同步过程中的有效传输数据量,并结合沐曦集群的节点、设备及网络拓扑特征,进一步优化通信分组、数据传输路径和跨节点交互策略,在 256 卡训练场景下实现平均通信时延降低 10% 以上。
同时,InfiniTensor 团队研发 拓扑驱动的模型并行与流水线调度算法,结合理论显存分析,评估不同流水阶段的显存占用、算子计算量及通信负载,动态优化模型切分、阶段映射及微批次调度方案,在保障显存安全的同时减少流水线空泡和阶段负载不均,实现端到端训练吞吐量提升 10% 以上,为国产智算平台高效开展超大规模模型训练提供了有力技术支撑。
生态共建:与国际主流社区并列,走完 Token 全生命周期
知名科技媒体“量子位”对 WAIC 2026 的探展报道中提到,九源联合体作为 “十大开源社区”之一,与 vLLM、PyTorch 基金会、SGLang 等国际主流开源社区并肩亮相沐曦展台。从训练推理框架到开源生态治理,九源联合体与沐曦等核心成员深度共建,共同走完了一个 Token 从生成到落地的完整生命周期。
(量子位:https://mp.weixin.qq.com/s/f3yUmIo3cPspKmiPfjD3pQ )
作为国内智能计算系统生态的重要力量之一,九源联合体将持续推动国产算力软件栈的开源协同,让每一个 Token 背后的开源协作真正落地生根。
写在最后
从助力 KernelSwift 算子创新大赛启动,到受邀参与 WAIC 2026 沐曦开源工坊,九源联合体始终致力于构建开放、协同、高性能的智能计算系统生态。
未来,九源联合体将继续携手产业伙伴和开源社区,坚持开放协同的发展理念,持续完善国产智能计算软件栈,推动更多技术成果在科研和产业场景中落地应用,共同促进国产智能计算生态持续发展。
Description
九源智能计算系统生态联合体亮相 WAIC 2026,助力 KernelSwift 算子创新大赛启动,聚焦 AI4S 方向开展赛题合作;受邀走进沐曦开源工坊,展示九源编程语言、InfiniTrain、InfiniLM 等成果积累,以及异构 PD 分离部署、百卡训练优化等实践进展,持续推动国产智能计算软件栈开源协同发展。
关注与交流

