摘要
OpenAI 与 Anthropic 几乎同日发布新模型。OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna,基于 GPT-6 Astra 底座重构,API 价格较 GPT-5.6 直降 50%,主打单位任务成本;GPT-6 Sol 在 AutomationBench 最高推理强度下超过 Claude Opus 5,每任务成本仅为其 9%。Anthropic 则发布 Claude Opus 5.5,多数任务达到 Fable 5.1 水平,典型任务成本较 Opus 5 降低约 40%,输出速度提升超 30%。两家都在强调「按任务成本」而非 Token 单价。
两大模型同日发布
就在刚刚,OpenAI 与 Anthropic 几乎同时推出新模型:OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna;Anthropic 则发布性能直逼 Fable 5.1 的 Claude Opus 5.5。
OpenAI:Astra 能力下放,价格「腰斩」
OpenAI 表示,GPT-6 Sol 与 GPT-6 Luna 脱胎于此前的顶级 GPT-6 Astra 底座,重点是将 Astra 的核心推理与多模态优势下放,重构出更轻量、吞吐量更高的运行版本。也就是说,GPT-6 Astra 承担的是能力探索角色,而 Sol 和 Luna 则承担能力规模化应用的任务。
价格方面则直接「腰斩」,与 GPT-5.6 的促销价相比,Sol 与 Luna 的价格直接降低了 50%。
随后,Sam Altman 在社交平台发文,强调这是 OpenAI 推动「智能普及化」的必经之路——让开发者不再受制于昂贵的算力账单。
「尤其是按照单任务成本(per-task pricing)来比较——而这才是我们认为真正应该关注的指标——我认为目前市场上没有任何产品具备真正的竞争力。我们希望人们能够大量使用 AI,因为这对于探索眼前的这场新的『文艺复兴』非常重要。只有让更多人能够广泛使用 AI,才能真正释放这一轮技术变革带来的可能性。」
API 价格:输入与输出均降 50%
博客链接:https://openai.com/index/introducing-gpt-6-sol-and-luna/
相较于 GPT-5.6,GPT-6 Sol 和 Luna 的 API 价格降低了 50%。GPT-6 Sol:输入价格从每百万 token 4 美元降低到 2 美元;输出价格从每百万 token 20 美元降低到 10 美元。GPT-6 Luna:输入价格从每百万 token 0.20 美元降低到 0.10 美元;输出价格从每百万 token 1.20 美元降低到 0.50 美元。
性能:价格下来了,但依旧能打
在 AutomationBench 测试中(该测试评估跨应用的企业工作流),GPT-6 Sol 在最高推理强度(xhigh effort)下超过了 Claude Opus 5 的最高强度表现,而每个任务成本仅为 Opus 5 的 9%。而在高推理强度下,GPT-6 Luna 相比上一代模型提升了 5.4 个百分点,同时每个任务成本降低 58%。
同时,GPT-6 Sol 也以更低成本超过 Claude Fable 5.1,甚至超过了低推理强度下的 GPT-6 Astra。
在内部事实准确性测试中,该测试基于经过匿名处理的真实用户对话(用户曾标记模型错误),GPT-6 Sol 的错误数量约为上一代模型的一半,接近 Astra 级别的可靠性,同时成本更低。GPT-6 Luna 也取得明显提升:在更高推理强度下,它能够以约百分之一的成本达到 GPT-5.6 Sol 的水平。
另一个重要变化出现在软件开发领域。随着 Coding Agent 开始承担越来越复杂的任务,持续运行成本成为开发团队的重要考虑。OpenAI 表示,GPT-6 Sol 和 Luna 在保持强大代码能力的同时,通过更低 API 价格,让开发者拥有更多试验空间,也让团队能够更加大胆地使用 Codex 执行复杂任务。
在 FrontierCode 测试中,GPT-6 Sol 相比 GPT-5.6 Sol 有明显提升,并以更低成本达到 Claude Fable 5.1 xhigh 的水平。
在 DeepSWE v1.1 测试中:GPT-6 Sol 在最高推理强度下获得 68.8% 分数,仅比 Claude Fable 5 的最高成绩 69.9% 低 1.1 个百分点,但每个任务成本降低约 80%。GPT-6 Luna 在最高推理强度下获得 66.6%,接近 Claude Opus 5 和 Fable 5 的中等推理强度表现。在这些比较中:Luna 相比 Opus 5,每任务成本降低 93%;相比 Fable 5,每任务成本降低 96%。
这或许说明,OpenAI 的目标并不是简单制造一个更强模型,而是在寻找单位智能成本最低的模型。
在计算机操作能力上,GPT-6 Sol 和 Luna 相比上一代模型提供了更高成本效率。在 OSWorld 2.0 offline 测试中,GPT-6 Sol 在最高推理强度下达到与 Claude Opus 5 中等推理强度相近的成绩:GPT-6 Sol 为 60.5%,Claude Opus 5 为 60.3%。但 GPT-6 Sol 每任务成本降低约 80%,GPT-6 Luna(max)则能够超过 GPT-5.6 Sol(medium),同时成本仅为其十分之一。
除了模型价格下降,OpenAI 还针对 Agent 长任务场景优化了缓存机制,改进 GPT-6 的 Prompt Caching,使默认缓存命中率更高,从而帮助 Agent 复用更多上下文、更快响应,并对缓存输入 token 读取享受 90% 折扣。这意味着,未来模型竞争不仅是模型本身的能力竞争,也包括整个推理基础设施效率竞争。
Anthropic:Opus 5.5 来了,Fable 级能力
在 OpenAI 发布的另一边,Anthropic 这次同样非常强调「效率」。Claude Opus 5.5 是 Claude 5.5 系列的第一款模型。Anthropic 给它的定位非常直接:大多数任务达到 Claude Fable 5.1 的水平,但相比 Opus 5,典型任务运行成本降低约 40%,输出速度则提高超过 30%。
博客链接:https://www.anthropic.com/claude-opus-5-5/
先看能力。在 Anthropic 公布的 headline comparison table 中,Opus 5.5 在列出的项目上全部高于 Fable 5.1。Terminal-Bench 4.0 上,Opus 5.5 达到 66.4%,Fable 5.1 为 55.8%;FrontierCode v1.1 Main 为 54.4% 对 50.3%;面向真实知识工作的 GDPval-AA v2.1,则是 1846 对 1735。Agentic coding、知识工作、计算机操作,基本都是这代 Opus 主要的能力提升方向,Anthropic 官方发布也将其称为相比 Opus 5 的一次明显升级。
这当然不意味着「Opus 5.5 已经全面超过 Fable 5.1」。不同 benchmark 使用的 harness、工具和推理强度并不完全一致;就在 Anthropic 自己的表格中,GPT-6 Astra 也仍然在 AutomationBench 和 Terminal-Bench-Science 等项目保持更高成绩。但能明显看到,Opus 和 Fable 之间原本清晰的能力差距,正在迅速缩小。
从 API 定价来看就更明白 Anthropic 的意思:Opus 5.5 每百万输入、输出 Token 分别为 4 美元和 20 美元,而 Fable 5.1 为 10 美元和 50 美元,后者正好是前者的 2.5 倍。两者都拥有 100 万 Token 上下文窗口和最高 128K 的常规输出能力。所以这次 Anthropic 没有把 Opus 5.5 描述成一次简单的「性能升级」,而一直在强调单位任务成本。
不再让 Opus「拼命想」
还有一个设置挺有意思。Opus 5.5 的 Adaptive Thinking 永远开启,开发者可以调节推理强度,默认设为 medium;相比之下,Fable 5.1 默认是 high。
这和 Anthropic 公布的一组数据正好对应:在 FrontierCode v1.1 Main 上,Opus 5.5 medium 得分约 54.6%,单任务成本约 0.8 美元;到了 max,成本升至约 6.19 美元,得分反而只有 54.4%。也就是说,多花近 7.7 倍的钱,并没有换来更高分数。原因之一在于 FrontierCode 会惩罚超出任务范围的修改,即使这些改动本身有益;推理预算提高后,模型反而可能多做一些无用功,因此更多 test-time compute 并不一定带来更好的任务结果。
第三方的实际测试验证了这个说法。CodeRabbit 在自己的多步骤 Code Review 工作流中发现,Opus 5.5 medium 已经可以达到或超过 Opus 5 high 的表现,同时只使用大约一半的 Token。
Token 只便宜 20%,为什么任务能便宜 40%?
Anthropic 给出的解释是,单个 Token 的价格并不能直接代表最终任务成本。Opus 5.5 相比 Opus 5,普通输入、输出 Token 价格只下降约 20%,但 Cache Read 从每百万 Token 0.50 美元降到 0.20 美元,降幅达到 60%。对于 Claude Code 这类需要反复读取代码和历史上下文的 long-running 任务,缓存降价会被持续放大。再加上 Opus 5.5 完成同一任务所需的 Token 和步骤更少,Anthropic 测得默认设置下,典型任务的总成本最终可降低约 40%。
「每百万 Token 多少钱」不适合单独计算,更合理的方式是放到实际任务中,看看真正做完要花多少钱。这和 OpenAI 这轮发布的思路惊人地一致。
能力之外,价格当然很重要
把两家放在一起看,这轮发布好像都很在意一个问题:用户到底愿意为提升的那部分智能付多少钱。
OpenAI 在 7 月底发布过一篇博客《Building abundant intelligence》。文中提到,客户真正购买的并不是 Token,而是「任务被完成」。因此更合理的衡量方式,应该是一次成功结果的总成本,其中还要算上重试、人工监督、时间和错误带来的代价。博客链接:https://openai.com/index/building-abundant-intelligence
换句话说,「最后事情做完花多少钱」比 Token 计费更贴近用户心理。Anthropic 这边,其实已经从企业用户那里收到过一次很直接的价格反馈:Fable 5 发布后,Ramp 对企业模型支出的追踪显示,这款 Anthropic 当时最贵、能力最强的模型,只占 Anthropic 企业 Token 使用量约 6%。Ramp 将其视为一个价格上限信号。