OpenAI的GPT-6 Sol和Luna:更快、更便宜、出奇地强大
OpenAI的新组合:GPT-6 Sol和Luna
OpenAI悄然扩展了其GPT-6家族,新增了两名成员:GPT-6 Sol和GPT-6 Luna。这些模型与旗舰GPT-6 Astra类似地训练,在编码、事实准确性和计算机使用方面带来了顶级性能——但成本仅为一小部分。虽然Astra仍然是高端选择,但Sol和Luna为关注预算的用户提供了有吸引力的替代方案。

价格减半,成本不到竞争对手的10%
Sol和Luna的API价格比GPT-5.6的促销价低50%。但真正令人大开眼界的是每任务成本。在AutomationBench跨应用业务流程测试中,GPT-6 Sol在xhigh强度下表现优于Claude Opus 5,但其每任务成本仅为Opus 5的9%。即使Luna在高强度下,也比其前代提升了5.4%,同时将每任务成本降低了58%。
在针对代理的Last Exam测试中,Sol在最大努力下得分56.4%——高于Opus 5的最佳成绩——并将每任务成本降低了60%。事实可靠性?Sol的错误率约为其前代的一半,以更低的价格接近Astra级别的可信度。Luna也取得了显著进步。

性能接近旗舰,更长任务更高效
在编程方面,两个模型都针对AI Coding Agent工作负载进行了优化。在FrontierCode 1.1 Main中,Sol比GPT-5.6 Sol有显著改进,并以更低成本匹配了Claude Fable 5.1 xhigh。在DeepSWE v1.1中,Sol在最大努力下得分68.8%——仅比Fable 5的69.9%低1.1分——每任务成本约低80%。Luna在最大努力下得分66.6%,接近Opus 5和Fable 5在中等努力下的表现,但成本分别低93%和96%。
计算机操作?Astra仍然领先,但Sol和Luna以更低成本完成任务。在OSWorld 2.0离线测试中,Sol在xhigh努力下达到60.5%,几乎匹配Opus 5在中等努力下的60.3%,每任务成本约低80%。Luna的最大努力甚至超过了GPT-5.6 Sol在中等努力下的表现,成本约为十分之一。
OpenAI还继承了Astra改进的沟通风格:更清晰的技术对话,更少行话短语,更紧凑地压缩低价值细节。此外,GPT-6的提示缓存现在有更高的默认命中率,帮助代理重用上下文并更快响应。价值对齐也有所改善,编码任务中的误导性陈述更少。
可用性
从今天起,GPT-6 Sol和Luna在ChatGPT Work和Codex中面向所有Plus、Pro、Business、Enterprise和Edu用户提供。免费和Go用户可以在桌面应用中访问Luna。在API中,它们被列为gpt-6-sol和gpt-6-luna,但尚未在Chat中提供。
要点
- GPT-6 Sol和Luna是OpenAI的新性价比模型,与旗舰Astra类似地训练。
- API价格减半,相比GPT-5.6,某些任务成本仅为竞争对手的9%。
- 性能接近旗舰模型,在编码、计算机使用和事实可靠性方面,通常成本仅为一小部分。
- 改进的沟通风格和提示缓存使其对代理工作负载高效。
- 现已可用,面向大多数ChatGPT用户,API访问通过
gpt-6-sol和gpt-6-luna。