摘要
7月2日,字节 Seed 发布了一个 Agent评测项目 EdgeBench。看起来又是一个 benchmark,但它问了一个其他榜单不问的问题。 给模型一道题,做对了得分,做错了不得分。这是绝大多数 benchmark 现在的工作方式,越来越像高考。 但真实世界里,人不是这么用 AI 的。 你不会给 Claude Code出一道题然后等它交卷。你会给它一个项目、一个代码库、一批数据,然后它在那里折腾好几个小时,探索、犯错、读反馈、修正、再试。你更关心的是它浸泡在现实任务环境里一段时间之后,能不能比刚进来时更强。 但当前的 benchmark 几乎测不出这些东西。它们测量的是静态能力,模型被冻结的那一刻就知道的东西。至于从反馈里持续进步的能力、在长周期里积累经验的能力、在陌生环境里摸索出方向的能力,全在盲区里。 EdgeBench 的切口就是把盲区里的东西放进评测,解答一个问题:把Agent扔进一个陌生环境,12小时后,你能变强多少? 134个任务横跨六大领域:科学/ML、软件工程、组合优化、专业知识工作、形式化数学、交互式游戏 为此,Seed 团队搭了一个叫 EdgeBench 的实验平台。这是一个环境学习观察舱。134 个任务,每个任务设计合约让 Agent至少跑 12 小时。 它的设计围绕四个核心维度展开: 5 个前沿模型(Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1、DeepSeek-V4-Pro)在上面总共跑了约38,000 小时。 经费在燃烧。但最终的结果价值巨大: 他们找到了 Agent 的 Scaling law。 1 四个发现:公式、路径、本质、速度 1 )agent学习有一条被写死的数学公式 134 个任务平均:5 个模型的学习曲线被 log-sigmoid 函数高精度拟合 这是全篇论文的“灵魂发现”。 此前我们大多默认环境学习是一件混乱的事,不同任务、不同模型、不同策略,规律自然也不同。但他们的数据给出了意料之外的答案: 134 个任务的平均学习曲线,被同一个函数以 R² = 0.998 的精度精确拟合。 R² = 0.998 是什么意思?在人机交互和复杂系统研究里,你能看到 R² = 0.
相关事件
暂无数据
相关公司
暂无数据
相关人物
暂无数据