九源联合体在 KernelSwift 算子创新大赛设立合作赛道,聚焦 AI4S 和新型模型架构算子优化
发表于:2026.08.04

近日,由上海人工智能实验室 DeepLink 团队主办的 KernelSwift 算子创新大赛 正式启动!大赛设置 Triton 算子优化赛道、Clike 算子优化赛道、 AI4S 和新型模型架构算子优化赛道三大方向。诚邀全球开发者、高校师生及产业工程师同台竞技,共同推动国产基础软件创新实践!

赛道三—— “AI4S 和新型模型架构算子优化赛道” 中的启元赛道,由九源智能计算系统生态联合体(以下简称“九源联合体”)负责赛题设计、命题与评测工作。该赛道聚焦 AI for Science(AI4S)科学智能计算场景,面向科研 AI 模型开展算子优化与国产算力适配。

⏰ 赛事日程

  • 正式比赛阶段: 2026 年 8 月 1 日 - 8 月 31 日
  • 报名截止日期: 2026 年 8 月 21 日⚠️
  • 赛事评审阶段: 2026 年 8 月 21 日 - 9 月 15 日

🏆 赛题设置

九源领域编程语言(NineToothed) 是一门深度学习领域特定语言(DSL),旨在简化高性能计算内核的开发。它通过引入面向张量的元编程(tensor-oriented metaprogramming),抽象掉了指针算术运算和内存访问等底层细节,能够降低并行编程的门槛。九齿能够让开发者使用少量简洁的代码实现较高性能的计算内核,并且可以提高代码的可读性和可维护性。

参赛者将使用九源联合体推出的九齿领域特定语言进行开发,并可申请海光、天数等国产算力资源支持,在实战中体验国产软硬协同的独特魅力!

赛道三—— AI4S 和新型模型架构算子优化赛道(启元赛道)说明

本赛题面向新⼀代⼤模型推理中的低精度计算、门控归⼀化和压缩 KV Cache 等热点负载,要求参赛者在九齿新版 SSA 编译器基础上完成四个算⼦的优化。

本赛道包含 4 道独立赛题:

题号 赛题名称 主要推理场景 对齐的开源接口
Task 01 MXFP4 W4A16 分组专家矩阵乘 低精度 MoE 专家计算 PyTorch scaled_grouped_mm(并参考 vLLM MXFP4 编码)
Task 02 Block-scaled FP8 矩阵乘 FP8 线性层、MoE 与 Attention 投影 PyTorch scaled_mm
Task 03 Gated RMSNorm 融合算子 KDA、门控线性 Attention 和新型序列模型 vLLM RMSNormGated
Task 04 MLA RoPE 与压缩 KV Cache 写入融合 MLA 解码与长上下文推理 vLLM concat_and_cache_mla 及 MLA fusion

每道赛题单独评奖,共 4 个优胜奖,单题奖金 3500 元(税前)

具体赛题要求、评测规则及报名方式,请前往 KernelSwift 算子创新大赛官方网站 (https://deeplink.org.cn/kernelswift_competition) 查看,或点击文末 【阅读原文】 跳转至官方网站报名。

📢 报名须知

  • 参赛规则: 团队参赛,团队人数 2-5人,需指定一名队长(同一人仅限参加一个队伍)。
  • 报名截止: 2026 年 8 月 21 日
  • 报名入口: KernelSwift 算子创新大赛官方网站(https://deeplink.org.cn/kernelswift_competition),或点击文末 【阅读原文】 跳转至官方网站报名
  • 算力支持: 参赛期间可申请海光、天数算力资源。

详细赛题说明、统一技术要求、提交方式以及评测规则等内容,请登录官网报名后查看完整文档。

⚠️距离报名截止仅剩不到三周,立即组队报名,用 NineToothed 书写国产算子的新篇章!

关注与交流