OpenAI 今日正式发布了 GPT-6系列的最新成员 ——GPT-6Sol 与 GPT-6Luna。这两款新模型采用了与 GPT-6Astra 类似的方法进行训练,旨在将 Astra 在专业工作、事实性、编程、计算机使用及对齐等方面的顶尖性能,带入速度更快、更经济的小尺寸模型中。官方表示,虽然 GPT-6Astra 依然是追求最佳效果和无妥协体验的首选,但 Sol 与 Luna 在大幅降低成本的同时,展现出了极其强悍的综合竞争力。
在价格方面,GPT-6Sol 和 Luna 模型的 API 价格相比 GPT-5.6的促销价直接降低了50%。此外,OpenAI 还针对基于 GPT-6的开发者优化了提示缓存,默认提供更高的缓存命中率,帮助智能体重用更多上下文,从而实现更快的响应并进一步节省费用。

在核心性能表现上:
业务流程与智能体表现:在 AutomationBench 跨应用业务流程测试中,GPT-6Sol 在高强度下表现优于 Claude Opus5,且成本仅为其每任务成本的9%;在 Last Exam 智能体评估中,GPT-6Sol 的得分超越了 Claude Opus5的最高分,同时每任务成本降低60%。
事实可靠性:在去标识化的真实世界对话中,GPT-6Sol 的错误率约为前代的一半,接近 Astra 级的可靠性,Luna 的事实可靠性也迎来了大幅提升。

编程与软件工程:两款模型均针对 AI Coding Agent 工作负载进行了深度优化。在 DeepSWE v1.1软件工程测试中,GPT-6Sol 取得68.8% 的成绩,距离最高成绩仅差1.1个百分点,单任务成本却低约80%;Luna 的表现也逼近部分竞品的中档强度,成本更具优势。
计算机操作能力:在 OSWorld2.0离线测试中,GPT-6Sol 取得了接近竞品中档强度的成绩,单任务成本约低80%,而 Luna 的成绩也超过了上一代主打型号,成本仅为后者的十分之一。
除了硬核性能的提升,OpenAI 还将 GPT-6Astra 改进后的沟通风格赋予了 Sol 和 Luna,使新模型在技术和编程对话中更加清晰、简练,大幅减少了术语堆砌和低价值细节。在价值对齐方面,两款模型均较 GPT-5.6版本有所改进,例如编码工作中的误导性声明发生率明显降低。
目前,GPT-6Sol 和 GPT-6Luna 已在 ChatGPT Work 和 Codex 中向所有 Plus、Pro、Business、Enterprise 和 Edu 用户全面开放,免费用户和 Go 用户也能够在桌面应用中使用 GPT-6Luna。在 OpenAI API 中,它们分别以 gpt-6-sol 和 gpt-6-luna 的形式提供服务。
VIP会员