阅读,与值得关注的内容Readance

GPT-6 Sol、Luna 发布:永久半价

刚刚, GPT-6 Sol 和 GPT-6 Luna 发布,API 永久降价:

每百万 tokens
输入
输出:旧价
GPT-6 Sol
$4 → $2
$20 → $10
GPT-6 Luna
$0.20 → $0.10
$1.20 → $0.50

并且,这些模型的能力大幅提升,且相比 Anthropic 有巨量的价格优势(故意的)

AutomationBench:横轴成本,纵轴得分AutomationBench:横轴成本,纵轴得分

并且 Tibo 还宣布,所有 Plus、Pro、Business 账户将获得一次 banked reset:

Tibo 的发布补充Tibo 的发布补充

工作流与编程

Sol、Luna 使用了与 Astra 类似的训练方法,分别定位复杂编程与专业工作、快速且大规模的日常任务。Astra 继续提供家族内最高能力;推理和缓存效率的改善同时降低了服务成本

GPT-6 家族GPT-6 家族

Agents’ Last Exam 测试 55 个细分行业的长流程专业任务。Sol(max)拿到 56.4%,超过本次评测中 Opus 5 的最高成绩,每个任务便宜 60%

Agents’ Last ExamAgents’ Last Exam

FrontierCode 1.1 Main 同时检查代码正确性、测试质量、改动范围、代码风格和仓库规范。Sol 相比前代明显提升,并以更低成本达到 Fable 5.1(xhigh)的水平

FrontierCode 1.1 MainFrontierCode 1.1 Main

DeepSWE 1.1 包含 113 个原创软件工程任务,覆盖 91 个仓库、5 种语言,使用统一的 Agent 框架运行:

  • Sol(max):68.8%,距 Fable 5 的最高成绩 69.9%(xhigh)差 1.1 个百分点,每个任务便宜约 80%

  • Luna(max):66.6%,与 Opus 5、Fable 5 的 medium 档位相近,成本分别低 93%、96%

DeepSWE 1.1DeepSWE 1.1

以上 GPT 数据来自研究环境或 API,对手数据来自公开报告;缺少 Fable 5.1 成绩的项目沿用了 Fable 5。图中的 low、medium、high、xhigh、max 为不同推理投入档位

Computer Use

在 OSWorld 2.0 离线集中,Sol(xhigh)得分 60.5%,Opus 5(medium)为 60.3%,Sol 每个任务便宜约 80%。Luna(max)超过 GPT-5.6 Sol(medium),成本约为它的 1/10

OSWorld 2.0 离线集,采用部分完成得分OSWorld 2.0 离线集,采用部分完成得分

这组数据采用 2026 年 8 月 8 日版本,指标是 partial reward,按任务各部分的完成情况给分

事实准确性测试使用匿名化的真实对话,样本来自用户曾指出旧模型答错的问题。Sol 的错误约减少一半,接近 Astra 的水平;Luna 在较高推理档位上,以约 1/100 的评测成本达到 GPT-5.6 Sol 的可靠性

困难问题上的事实错误率,越低越好困难问题上的事实错误率,越低越好


缓存大幅降价

GPT-6 提高了默认缓存命中率,复用请求开头相同上下文的中间计算结果。命中的输入读取价格为普通输入的 10%,写入缓存为普通输入的 1.25 倍:

每百万 tokens
GPT-6 Sol
GPT-6 Luna
缓存读取
$0.20$0.01
缓存写入
$2.50
$0.125

开发者新增了几项控制:

  • 查看命中情况。 Prompt Caching Dashboard 显示缓存占比和变化,诊断工具定位输入、参数、工具及历史消息变化造成的缓存损失

  • 中途调整推理档位。 在后续上下文追加配置更新,提高或降低 reasoning effort,保留此前缓存

  • 开关当前可用工具。 保持工具定义稳定,通过工具选择范围等机制调整可用工具,复用前缀

  • 设置显式断点。 指定缓存前缀的结束位置,把动态内容放在后面

GitHub 提供的使用数据是:过去几个月,OpenAI 模型的数十亿次请求中,需要重新处理的 prompt tokens 占比下降了 超过 50%,Copilot 因而响应更快


可用范围、API 与订阅额度

对于付费的 Plus、Pro、Business、Enterprise、Edu 用户现已可用,可在 ChatGPT Work 和 Codex 获得 Sol、Luna;而对于 Free、Go 用户可以在桌面应用中试用 Luna

在 API 中,模型模型名为 gpt-6-sol、gpt-6-luna。两者均支持文本、图片输入及文本输出,上下文窗口 105 万 tokens,最大输入 92.2 万、最大输出 12.8 万

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →