摘要
7月的模型圈很热闹。 25日凌晨,Anthropic正式推出了新模型Claude Opus 5。 这一次,Anthropic没有强调“最强模型”,而是给出更务实的定位:Opus 5在复杂任务上更少遗漏步骤、更倾向主动验证中间结果,在多项评测中兼顾性能与成本,适合日常高频使用。 定位的变化也直接体现在产品里,目前Opus 5成为Claude Max的默认模型,也是面向个人订阅用户(Max/Pro)可调用的最强模型;能力更高的Fable 5主要面向API与企业客户,个人订阅用户虽然可用,但额度相当有限。 从官方公布的成绩来看,Opus 5重点提升了编程、知识工作和智能体任务的完成效率,在多项软件工程、商业流程和电脑操作评测中位居前列;在最高思考档位下,部分成绩已经逼近甚至超过Fable 5。不过,在进攻性网络利用和长周期自主生物研究等高风险场景中,受限的Mythos 5仍然更强。 Opus 5提供了可调节的effort(思考档位),用户可按任务难度调整推理资源投入。档位越高,处理复杂问题的能力越强,但速度更慢、Token消耗也更多;调低则省时省钱。 目前,Opus 5已在全平台上线,API价格为每百万Token输入5美元、输出25美元,与Opus 4.8持平,约为Fable 5的一半;追求速度可开Fast模式,以约两倍价格换2.5倍速度。 Anthropic同时上线了两项Beta功能:动态调整工具与自动回退,用于降低Agent任务因缓存失效抬升成本、或因安全拦截中断的风险。 性能逼近、价格减半,那Opus 5能替代Fable 5吗? 01.登上榜首,但不是断层领先 我们先来看官方给出的成绩单。 为了突出模型的领先性,Opus 5的对比对象选的是当前能力最强的几款模型:上一代Opus 4.8、公开旗舰Fable 5,以及OpenAI刚发布的旗舰模型GPT-5.6 Sol。 软件工程是最突出的方面。在Frontier-Bench v0.1测试中,Opus 5超过所有参测模型,成绩相比Opus 4.8提高一倍以上,单项任务成本反而更低。在CursorBench 3.2测试中,开启max effort后,两者成绩相差不到0.5%,每项任务成本约为后者一半。 类似优势也出现在需要模型连续操作的任务中。
相关事件
暂无数据
相关人物
暂无数据