基于国产 GPU 全栈训练,摩尔线程 MusaCoder 正式开源:KernelBench 得分超越 Opus 4.7 文章

InfoQ 中文2026-06-10BLOGzh作者: 李冬梅

详细信息

来源站点
InfoQ 中文
作者
李冬梅
文章类型
BLOG
语言
zh
发布日期
2026-06-10

摘要

近日,摩尔线程正式发布并开源面向GPU底层算子生成的专用代码大模型MusaCoder。这是业内首个基于国产GPU算力底座完成全链路训练与验证的开源代码大模型,其完整后训练流程均在基于MTT S5000构建的夸娥智算集群上完成。在KernelBench严格评测中,MusaCoder-27B-RL以Overall Pass@8 93.2%、Avg.@8 88.60%的成绩,超越 Claude Opus 4.7、GLM-5.1、DeepSeek-V4 Pro、Kimi K2.6等主流SOTA代码模型。KernelBench准确率(Avg.@8)对比 MusaCoder模型权重已开源:https://huggingface.co/MooreThreads/MusaCoder-27BMusaCoder论文地址:http://arxiv.org/abs/2606.04847 MusaCoder:专为GPU设计的高性能算子生成模型MusaCoder是摩尔线程面向GPU底层算子生成任务设计的专用代码大模型,包含9B和27B两个参数规模。该模型重点支持从 PyTorch 标准算子自动生成高性能CUDA/MUSA原生Kernel代码,旨在降低开发者手写底层GPU算子的门槛,提升GPU高性能计算场景下的代码生成、验证和优化效率。传统代码大模型虽然具备较强的通用编程能力,但在GPU Kernel生成任务中仍面临显著挑战:一方面,GPU Kernel对并行计算、线程组织、内存访问、索引映射和硬件执行特性要求极高;另一方面,生成代码不仅要语法正确,还必须能够通过编译、数值正确性验证、反作弊检测,并在真实执行中获得性能收益。MusaCoder训练总流程针对上述难点,MusaCoder构建了一套面向GPU原生算子(CUDA/MUSA)生成的大模型全栈后训练方法论。该流程覆盖数据构建、执行验证、强化学习优化等关键环节,使模型能够从基础代码能力逐步进化为具备底层算子生成与修复能力的专用模型。在数据构建阶段,MusaCoder通过结构化推理过程和显式Shape信息注入,增强模型对张量形状、内存布局和索引关系的理解,解决从通用代码能力迁移到GPU Kernel生成任务时的冷启动问题。在评测与训练环境方面,摩尔线程构建了MooreEval分布式执行验证系统。