上周GOSIM Paris2026大会「Open Compute for Agentic AI」分论坛上,FlagOS 社区开启了KernelGen 24 Hour Bounty Challenge(KernelGen 24 小时全球赏金挑战赛)。当倒计时 24 小时亮起的那一刻,一群人死死盯着屏幕,手指在键盘上飞舞。排行榜上的数字每隔几分钟就跳动一次,有人刚提交了一个更快的算子,分数被反超;对方立刻又刷出新高,反超回来。同一时刻,全球各地的开发者也在各自屏幕前紧张敲击键盘。

01反套路实战赛场:24 小时挑战、黑盒环境、多硬件全域适配

KernelGen 24 小时全球赏金挑战赛由众智 FlagOS 社区发起,是一次“真刀真枪”的工程实战。3 道硬核赛题、3000 美元奖金池、线上线下同步开战,参赛者需要在24小时内,使用 Triton 或 Triton-TLE,为华为昇腾、天数、海光、摩尔线程、沐曦五款 AI 芯片平台编写高性能算子,并在保证正确性的前提下尽可能提升计算速度。比的不是单一芯片最快,而是五款 AI 芯片全都稳、准、快。

“最刺激的就是盯着排行榜,熬了一个通宵反复调试提交,自己分数往上涨,对手分数也在涨,根本不敢停。”

—— 赛题三现场获奖者张文清

这场比赛没有 “舒服的开发环境”,全程黑盒评测,看不到底层耗时分布,只能靠提交、观察、猜瓶颈、再重构。不少选手坦言:写快算子不难,难的是五款硬件全跑对。

图:颁奖现场

02 三大赛题燃情收官:线上线下开启、6 位开发者登顶

赛题1:Sparse Attention 算子优化

赛题2:DeepSeek mHC 算子优化

赛题3:Fused MoE 算子优化

三大赛题各设 GOSIM 现场奖与全球线上奖,6 位开发者在极限时间里杀出重围,用代码交出惊艳答案。获奖名单如下。

1.黑盒环境攻坚:无性能剖析工具,如何实现极致优化?

对于参赛者来说,KernelGen 挑战赛最特殊的地方在于它的“黑盒”评估环境。选手提交代码后仅能查看榜单分数变化,无法获取性能剖析数据,必须在有限反馈下定位瓶颈、验证优化效果。

这种设计并非刻意提高难度,而是真实还原产业界跨平台算子开发的典型困境—— 当内核需要在多款芯片上规模化部署时,很难为每一款硬件配备完整调试工具链。

赛题一(Sparse Attention 算子优化)获奖者 Bokai(远程参与)对这一点感受最深。他在赛后表示:最大的挑战是数值精度对齐问题——基线依赖 FP32 中间状态,而优化后的内核使用 BF16/FP32 混合精度。这个看似细微的差异,在不同硬件后端上反复导致正确性验证失败。

更棘手的是硬件差异带来的不稳定。Bokai 发现,复杂的二维跨步内存加载在某些架构上会直接触发错误。他的解决方案是向量化加载策略,配合显式类型转换(如p.to(tl.bfloat16)),确保代码在昇腾和 Iluvatar 硬件上都能兼容。

“比赛改变了我对性能工程的看法,”Bokai 总结道,“在异构加速器之间构建可移植且可靠的内核,往往比针对单个设备进行优化更难。”在比赛的最后几个小时,他的排名依然不稳定——精度检查在不同后端上反复失败,直到接近结束他才部分解决了这个问题。

视频:获奖者 Bokai

赛题二(DeepSeek mHC 算子优化)获奖者 Hyun-Min Chang(远程参与)在赛后提到:“Triton 提供了一个非常强大的通用编程模型,这次比赛让我清楚地认识到,可移植性仅仅是第一步,跨设备的正确性是一个问题,在每个架构上都实现强性能,则是另一个完全不同且更难的问题。”

Hyun-Min Chang 特别提到了实时排行榜的独特价值——它不仅是一个竞争工具,更是一个认知工具。“起初,领先的成绩给了我一个具体的追赶目标。后来,当有人提交了一个远远超出我最初认为可能的结果时,它彻底改变了我对性能上限的看法。”那一刻,他重新审视自己的假设,更仔细地研究架构,寻找更好利用硬件的优化方法。

2. MoE 优化真相:瓶颈藏在细节,冠军惊险逆袭

赛题三(Fused MoE 算子优化)获奖者吴建锋(远程参与)用“惊险”两个字概括自己的夺冠之路。

突破发生在赛道三。吴建锋指出,真正影响 MoE 推理性能的,远不止 GEMM 本身。那些容易被忽略的环节——token-to-expert 分桶、scatter/reduce、kernel launch 开销、中间张量读写,以及小 batch 场景下调度成本的占比,往往才是性能的真正瓶颈。通过多轮实验和调优,他更直观地理解了 Triton block size、top‑k路由、专家负载均衡以及内存访问模式对最终性能的影响。

“相比单纯追求某一个 kernel 在单个平台上的极限速度,”吴建锋说,“我更加认识到,高性能算子优化往往需要结合评测环境、硬件特性、稳定性要求和容错策略,设计整体方案。”

他特别强调了三点:稳定性、可移植性和针对性优化。“这同样是高性能计算竞赛中非常关键的能力。”

视频:获奖者吴建锋

3.赛场直击:最真实的开发者心声

KernelGen 挑战赛现场的紧张氛围,让参赛选手都印象深刻。张文清是现场获奖选手之一,她形容那24小时的感觉是“紧张又上头”。

张文清坦言,自己本来是抱着学习的心态来试试,没想到最后拿了奖。“感觉非常幸运。虽然过程累,但每次看到分数有突破也都值了。”

让她印象最深的是,这次比赛让她真正接触到了“五个不同的多元AI芯片平台”。她感谢主办方“给了一次难得的实战机会”,也感谢“一起熬夜卷分数的对手们,让整个体验既紧张又有趣”。

视频:获奖人张文清

图:张文清社交平台截图

邹永康目前在欧洲初创企业担任 AI 工程师,日常工作聚焦多 Agent 系统与 AI 产品落地。本次 KernelGen 大赛,是他首次面向多元 AI 芯片平台开展算子优化。凭借对 AI Infra 与底层硬件的浓厚兴趣,他一路冲刺,最终在 GOSIM 现场斩获Sparse Attention 赛道第一。

他谈到,不同芯片各具特性,优化过程如同做多 Agent 系统,需要并行探索、多源检索、快速实验迭代,一边查阅平台文档与开源实现,一边不断试错总结、理解硬件细节,再结合算法实现把性能推到更高。

“每看到排名提升的瞬间,都特别有成就感。感谢主办方提供这样难得的机会,也让我真切感受到 FlagOS 生态的融合力与未来潜力。”

图:邹永康社交平台截图

4.不止于胜负:全球开发者共赴开放算力之约

除了获奖选手,还有许多深度参与者,同样让这场比赛闪闪发光。

俞一峻目前在英国开放大学,此前曾帮助华为推广Rust语言,这次虽然没有现场获奖,但深度参与了比赛。他表示,后续会利用好 Triton 和 Triton-TLE 语言争取更好的自动算子性能收益,更好地支持多种芯片算力。

Tariku Mehdi 则在赛后专门给 FlagOS 社区团队写了邮件,表达强烈的后续合作意愿,并附上了自己的GitHub作品集。

这些来自全球各地、背景各异的开发者,共同构成了KernelGen挑战赛更完整的图景——它不仅是一场竞赛,更是全球开发者连接、碰撞、共建开放算力生态的重要平台。

03大赛的背后:以统一软件栈,推动 AI 算力普惠

算子是 AI 算力的核心引擎,优质算子能让硬件释放最大性能;而 FlagOS 作为高效易用的智算系统软件栈,能让开发者无需深陷底层硬件差异,即可实现全平台高效适配。

KernelGen 24 小时挑战赛的独特之处在于:它让开发者同时面对五款 AI 芯片平台,用 24 小时的时间,完成一套算子代码,在多款芯片硬件的性能评测闭环。每个平台的内存模型、指令集、精度行为都有差异,而选手必须在 Triton 或者 Triton-TLE 的统一编程模型下,写出既正确又高效的可移植代码。

未来,FlagOS 将持续构建统一、开放、普惠的 AI 系统软件栈,降低跨硬件开发门槛,让更多开发者无需理解底层硬件细节,即可高效利用全球多元 AI 芯片算力。

24 小时的竞赛虽已落幕,但全球开发者对性能极致的追求、对开放生态的共建热情将永远在线。FlagOS 将持续推动 AI 算力普惠,让高效计算触手可及。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐