摘要
智东西7月6日报道,美团今日宣布开源万亿参数大模型LongCat-2.0,同步开放针对国产算力芯片深度优化的推理代码。该模型总参数达1.6万亿,平均激活约480亿参数,是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型。 ▲LongCat-2.0开源(图源GitHub) 从官方公布的数据看,LongCat-2.0具有较强的综合能力。在考察深层工程能力的SWE-bench Pro中得分59.5,领先Gemini 3.1 Pro(54.2)、GPT-5.5(58.6)及Claude Opus 4.6(57.3);在考察编程语言的SWE-bench Multilingual中得分77.3,与Claude Opus 4.6(77.8)持平;在真实终端指令交互评测Terminal-Bench 2.1中得分70.8。 ▲LongCat-2.0与各模型的评分对比(图源LongCat) 而在真实场景任务方面,LongCat-2.0在搜索智能体评测RWSearch得分78.8,生产力场景评测FORTE得分73.2,BrowseComp得分79.9,均达到或接近前沿闭源模型水平。 据智东西实测,LongCat-2.0在长文本输出方面能够较好地理解用户的意思,并且能根据用户要求生成可阅读的长文本。在编程方面,该模型代码的生成速度较快,但有时不稳定,画面会出现问题。 并且,该模型还具有较好的创意能力和3D动画场景生成能力,能在理解用户的意思并立即作出反应。此外,LongCat-2.0还具备较强的逻辑推理能力,在推理题目时步骤清晰简明。 LongCat-2.0采用MoE(混合专家)架构,原生支持100万token超长上下文输入。该模型在Agentic Coding(智能体编程)任务设计,在代码理解、生成与执行方面进行了针对性强化。 LongCat-2.0有3项创新:一是LongCat稀疏注意力机制(LSA),将传统平方级计算开销优化为线性级,有效加速百万级长上下文的训练与推理;二是在MoE专家之外引入N-gram Embedding作为新的参数扩展路径。三是在后训练阶段,该模型采用多教师在线蒸馏,将专家分为Agent、推理和交互三类,分别聚焦自主执行、自适应推理和安全对齐等核心能力。
相关事件
暂无数据
相关公司
暂无数据
相关人物
暂无数据