首个长程Doc2Repo训练集,代码Agent不止修bug,开始造仓库 文章

36kr 资讯2026-06-25NEWSzh作者: 新智元

详细信息

来源站点
36kr 资讯
作者
新智元
文章类型
NEWS
语言
zh
发布日期
2026-06-25

摘要

随着LLM Code Agent能力的不断提升,越来越多的研究者意识到现在是时候迈向下一个阶段更接近真实场景需求的长程任务了。于是涌现出了一些长程任务评测的Benchmark比如NL2RepoBench以及BeyondSWE等等。大家对Code Agent预期承担的角色逐渐从仓库维护者变成了架构师,能够做规划完成整个仓库的代码的长程任务。 近日,中国人民大学高瓴人工智能学院完成相关研究,重磅发布DeNovoSWE数据集,专注于长程软件工程任务,尤其是仓库级别代码从零生成任务。 论文链接:https://arxiv.org/pdf/2606.10728 仓库链接:https://github.com/AweAI-Team/DeNovoSWE 数据链接:https://huggingface.co/collections/AweAI-Team/denovoswe 通过Divide & Conquer与Critic & Repair机制构造高质量数据集,并且成功实现长程SWE任务的Scaling,构建起包含4,818真实数据的开源高质量长程SWE任务数据集——这一成果为 Code Agent 长程能力训练提供了大规模数据,大幅提升Code Agent长程任务能力。 论文中也提供了根据题目难度打分过滤的手段,有效缓解了困难题目比例与轨迹质量的权衡问题。 实验显示,基于DeNovoSWE训练的Qwen3-30B-A3B-Instruct在BeyondSWE-Doc2Repo上从5.8%提升到47.2%,在 NL2RepoBench 上从 4.3% 提升到 23.0%,展示了长程数据对仓库级代码生成能力的显著提升。 从一份文档开始重建整个仓库 过去一年,随着像Scale-SWE等工作的大规模SWE数据的scaling,代码智能体在 SWE-bench 这类真实软件工程任务上快速进步。但当模型越来越擅长「修一个 issue」「改几行 bug」之后,一个更关键的问题开始浮现:智能体真的具备长程软件工程能力了吗?从BeyondSWE-Doc2Repo以及NL2RepoBench前沿模型的效果来看,效果并不理想。