
OpenAI 发布 GPT-6 Sol 和 Luna:更便宜的新一代模型

OpenAI 在推出 GPT-6 Astra 之后,继续扩充 GPT-6 家族,发布了 GPT-6 Sol 和 GPT-6 Luna。这两个模型定位不是追求绝对性能上限,而是把 Astra 那代模型在专业工作、事实性、编程、计算机使用和 alignment 上的进步,以更快的速度和更低的成本分发出去。官方明确说,最复杂、最重要的项目仍然应该用 Astra,但不同工作有不同的规模、节奏和预算,Sol 和 Luna 就是为这些场景准备的。
核心卖点是成本效率。OpenAI 称 GPT-6 系列在成本-智能曲线上领先,通过改进缓存和推理基础设施,把 API 价格直接砍了一半:Sol 和 Luna 的定价比对应的 GPT-5.6 促销价低 50%。价格按每百万 token 计算。
在具体评测上,OpenAI 给出了一组与竞品的对比数据。AutomationBench(跨应用业务流程测试)中,GPT-6 Sol 在 xhigh effort 下表现优于 Claude Opus 5 的 max effort,而每任务成本只有 Opus 5 的 9%;GPT-6 Luna 在 high effort 下比上一代提升 5.4 个百分点,每任务成本降低 58%。在 Agents’ Last Exam 上,GPT-6 Sol 的 max effort 得分 56.4%,比 Claude Opus 5 的最高分高,同时每任务成本低 60%。
事实性方面,OpenAI 用内部评估(基于用户标记过错误的去标识化真实对话)衡量,GPT-6 Sol 的错误率大约是上一代的一半,接近 Astra 的可靠性水平,但成本低得多。GPT-6 Luna 在更高 effort 下匹配 GPT-5.6 Sol 的水平,成本约为其百分之一。
编程能力上,OpenAI 提到内部编码 agent 的 token 使用量增长很快,按 API 价格计算,研究员中位数的日 token 使用已超过 600 美元,90 分位超过 7000 美元。在 DeepSWE v1.1 上,GPT-6 Sol 的 max effort 得分 68.8%,与 Claude Fable 5 的最高分 69.9% 只差 1.1 个百分点,每任务成本低约 80%。GPT-6 Luna 的 max effort 得分 66.6%,与 Claude Opus 5 和 Fable 5 的 medium effort 相当,每任务成本比 Opus 5 低 93%、比 Fable 5 低 96%。
计算机使用方面,OSWorld 2.0 offline 上,GPT-6 Sol 在 xhigh effort 下得分 60.5%,与 Claude Opus 5 的 medium effort 的 60.3% 相当,每任务成本低约 80%。GPT-6 Luna(max)以十分之一的成本超过 GPT-5.6 Sol(medium)。
除了价格和性能,OpenAI 还改进了 prompt caching。GPT-6 的缓存命中率默认更高,缓存输入 token 读取有 90% 折扣。开发者可以用 Prompt Caching Dashboard 监控缓存情况,用诊断工具找出缓存未命中的原因。调整 reasoning effort 和工具开关现在不会破坏已有缓存,还支持显式断点来控制缓存前缀的结束位置。GitHub 报告称,过去几个月这些改进让需要重新处理的 prompt token 比例下降了超过 50%。
alignment 方面,Sol 和 Luna 延续了 Astra 的 alignment 工作,在评估中比 GPT-5.6 对应模型有改进,包括关于编程工作的误导性表述更少。
可用性上,GPT-6 Sol 和 Luna 今天起在 ChatGPT Work 和 Codex 中向 Plus、Pro、Business、Enterprise、Edu 用户开放,Free 和 Go 用户可以在桌面应用中使用 GPT-6 Luna。API 中对应模型名是 gpt-6-sol 和 gpt-6-luna。Chat 中暂不可用,ChatGPT 内会逐步灰度。
需要留意的是,这些评测数据来自 OpenAI 自己的研究环境或 API,竞品分数来自公开报告,实际生产环境可能因系统提示和工具差异而略有不同。

