刚刚,Claude Fable 5,又拿第一了 文章

36kr 资讯2026-08-04NEWSzh作者: 新智元

详细信息

来源站点
36kr 资讯
作者
新智元
文章类型
NEWS
语言
zh
发布日期
2026-08-04

摘要

Claude这次,真把AI编程榜单打出断层了! 就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率再次登顶。 紧追其后的GPT-5.6 Sol,分数只有它的三分之一! 排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。 更让人意外的是,在使用Go等高资源语言时,Fable 5的解出率是64%;换成冷门语言Ada,成绩仍然高达61%。 要知道,在开源世界里,Python语料大约是Ada的230倍。 但到了Fable 5这里,成绩居然只下降3个百分点。 这就有意思了。 如果模型主要靠记忆热门语言的语法和常见写法,那么换成Ada之后成绩应该出现下降才对。 而现在的结果,却指向另一种可能—— 最强模型已经摆脱了具体语料的牵引,开始学会如何从零构建一个完整的软件项目。 卡死在100%通关线,100亿Token极限测试 具体来说,完整的MirrorCode包含25个目标程序,覆盖Unix工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。 在这里,模型会被放进隔离环境,没有互联网,看不到原项目源码,也不能下载第三方依赖。它能拿到的只有高层文档、一部分可见测试,以及一个可以反复调用的原程序。 接下来,它要不断向原程序输入数据,观察输出猜内部逻辑,再一点点写出一个行为一致的新程序。 最新榜单从中选出15个Medium和Large目标。每个目标使用两种实现语言,每种语言运行三次。 并且,可见测试与隐藏测试的完成率必须达到100%才算通过,99.9%都不行。 只要漏掉一个边缘案例,整次运行仍然按失败计算。 为了逼模型把最后几个缺口也补上,MirrorCode把单次预算推到100亿Token,最长允许连续运行7天。 论文中成本最高的一次任务更夸张:模型连续跑了19天,单次花费达到2600美元。 在这19天里,模型会反复运行原程序、比较结果、补写功能,再把测试重新跑一遍。报错了就查原因,输出对不上就换假设,局部通过了再去追下一个缺口。 整个过程,更像一场持续数天的调试,而不是一次生成。 gotree的例子最直观。 这个生物信息学工具原本有大约1.