JetBrains 开源 Mellum2,尝试 Claude Code 无法涉足的领域 文章

InfoQ 中文2026-06-18BLOGzh作者: Paul Sawers

详细信息

来源站点
InfoQ 中文
作者
Paul Sawers
文章类型
BLOG
语言
zh
发布日期
2026-06-18

摘要

JetBrains 近期宣布开源 Mellum2,这是一款拥有 120 亿参数的编程模型,主要面向智能体 AI 系统的基础设施层——包括路由、检索管道和子智能体任务——以及私有本地部署场景,这是 Claude Code 及其同类产品无法触及的领域。这是 Mellum 的后续版本。Mellum 是 JetBrains 于 2024 年底推出的 40 亿参数模型,最初作为其自有 IDE 的专属代码补全工具,后于 2025 年 4 月开源。但与之前不同的是,Mellum2 从发布第一天起就是开放的。值得注意的是,Mellum2 的定位也发生了显著变化。如果说 Mellum 只做一件事——代码补全——那么 Mellum2 则是为工程团队部署 AI 所需的广泛任务而构建:协调多个模型、处理子智能体工作负载、在检索管道中压缩上下文,以及在团队自主控制的基础设施上运行推理。在一篇由高级研究工程师 Nikita Pavlichenko 和产品经理 Anton Semenkin 联合撰写的博客文章中,Mellum2 被定义为一款“聚焦型模型”——主打高效专精,不去和顶尖大模型比拼通用能力。“前沿模型将继续突破极限,但实用的 AI 产品离不开聚焦型模型:快速、专业的组件,高效处理高频任务,”他们写道。“这种专业化设计确保模型在软件工程环境中表现出色,同时保持轻量和高速度。”此外,该基础模型还有两个后训练变体:“指令”版本可以直接回答问题,“思考”版本在回答前生成显式的推理过程,面向更难的多步骤和智能体任务。Mellum2 采用混合专家(MoE)架构,总参数量 120 亿,但每个词元仅激活 25 亿参数。这种设计将每个词元路由给 64 个专家模型的子集,而非整个网络,从而在保持模型整体容量的同时实现快速推理。在技术报告里,JetBrains 基于单张 H100 GPU 选用贴合真实生产代码补全负载的输入、输出数据,对 Mellum2、阿里 Qwen2.5-7B 和 Qwen3-8B 进行了基准性能测试。在单请求模式下,Mellum2 的性能与 Qwen2.5-7B 几乎持平——每秒 192 词元对 193 词元。而在并发负载下——即生产部署的实际运行场景中—— Mellum2 比 Qwen2.5-7B 高出 21%,比 Qwen3-8B 高出 79%。成本方面的表现同理。