80%代码由Claude合并,Anthropic内部人员点破Agent真相:「Close the Loop」 文章

36kr 资讯2026-06-25NEWSzh作者: 机器之心

详细信息

来源站点
36kr 资讯
作者
机器之心
文章类型
NEWS
语言
zh
发布日期
2026-06-25

摘要

最近,Anthropic 团队研究产品经理 Theodora(Theo)Chu 的一段演讲视频,引起了大家的注意。 Theo 表示,当前越来越多的开发者已经不再只是「听说过 Claude」,而是在日常工作中真正感受到效率提升。有人认为 Claude 让自己效率翻倍,也有人认为提升了 10 倍。更重要的是,Claude 已经开始深入 Anthropic 自身的工程流程,「Anthropic 内部超过 80% 的代码由 Claude 合并。」 这意味着,模型的角色正在发生变化。 模型不再只是停留在回答问题阶段,而是在一个可以反馈、验证、修正的环境里持续完成任务。「Close the Loop(闭合循环),给模型一种验证自身输出结果的方式。」 而在这场分享中,Theo 想要告诉开发者的是,「你应该如何适应这个新世界,又应该如何面向未来构建产品,而不是只为过去构建产品。」 为此,Theo 详细拆解了如何构建能够自我改进的 Agent,「真正的配置,是让 Claude 在循环、计划模式和动态工作流中持续运行。」 网友 rari@0xwhrrari 认为,「这要比大多数 300 美元的 Agent 课程都要好。」 那么,接下来,我们就来详细了解一下这场演讲到底讲了什么。 一年之内,模型失败率被大幅压低 Theo 用编程评估基准 SWE-bench Verified 举了一个例子,它由一系列 GitHub issue 组成,模型需要理解问题、修改代码,并通过测试来证明自己真正解决了任务,这是 Anthropic 内部用来观察 Claude 编程能力提升的重要评测: 一年前的 Sonnet 3.7 得分仅为 60% 左右,而到了 Opus 4.8,得分已经达到了 88%。 这意味着,一年前的模型在这些任务上的失败次数,大约是现在的 3 倍。 这也是演讲中最值得注意的地方:模型能力提升,并不只是「多做对几道题」,而是失败率正在快速下降。失败率下降之后,模型才有可能承担更长、更复杂、更接近真实工作的任务。 此外,更不可思议的是,在最新的 Mythos 和 Fable 系列模型中,该基准测试实际上已经出现接近饱和的迹象。换句话说,一些过去足够难的测试,今天可能已经不再能有效区分模型能力。