摘要
Anthropic发布新一代Claude Opus 5模型,在多个基准测试中性能逼近旗舰Fable 5,但API价格仅为后者的一半。Opus 5在ARC-AGI-3测试中以30.2%的成绩刷新纪录,远超此前GPT-5.6的7.8%。该模型在软件工程、科学研究等领域表现突出,旨在以更低成本提供接近旗舰的能力。中国AI公司如月之暗面、DeepSeek等持续以低价和高性价比冲击市场,推动全球AI模型价格重新评估。行业竞争正从单纯追求模型能力转向综合考量性能、推理效率和成本。
Anthropic发布Opus 5:性能逼近Fable 5,价格减半
美东时间7月24日,Anthropic发布新一代Claude Opus模型Opus 5,称其性能在多个任务上已逼近公司最先进的Fable 5,但API价格仅为后者的一半。Opus 5的定价为每百万Token输入5美元、输出25美元,与Opus 4.8相同,而Fable 5定价为输入10美元、输出50美元。
ARC-AGI-3测试刷新纪录
非营利组织ARC Prize披露,Opus 5在ARC-AGI-3基准测试中取得30.2%的超高成绩,远超GPT-5.6 Sol(Max)创下的前纪录7.8%。ARC Prize表示,Opus 5展现出此前未出现过的新颖行为,能够解决此前未被攻克的复杂环境,表现超过Fable。
性能与成本优势
在软件工程方面,Opus 5在CursorBench 3.2测试中最高努力等级下的成绩距离Fable 5峰值仅差0.5%,但单任务成本只有后者的一半。在OSWorld 2.0电脑操作测试中,Opus 5以略高于Fable 5三分之一的成本,超过了Fable 5的最佳成绩。Anthropic强调,Opus 5在科学研究任务上的能力明显提升,尤其是有机化学和蛋白质相关任务。
中国模型加速价格内卷
在中国新模型持续以低价和高性价比冲击市场的背景下,Anthropic率先将“降本增效”推向高端模型市场。7月16日,月之暗面发布2.8万亿参数的开源模型Kimi K3,整体能力仅落后于Fable 5和GPT-5.6。DeepSeek此前也已通过低价策略和开放权重模式,推动全球AI模型价格持续下探。行业竞争正从“谁能训练出最强模型”转向“谁能以最低成本提供足够强的模型”。