“选了便宜模型,结果20分钟没了”——Codex里GPT-6 Luna / Sol / Astra到底怎么选

阅读功能说明

收听会朗读正文;速读会按顺序显示短语,速度可调。语言练习可对照已有的不同语言版本。收藏保存在本浏览器中,可从播放器的收藏列表再次打开。

分享这篇文章

分享这篇文章

广告
广告

AI编程里最容易踩的成本陷阱,就是只看“一次调用多少钱”。

一个便宜模型连续迷路五次,最后留下一句“权限不足”就原地去世;另一个贵模型第一次就找到真正原因。后者完全可能更便宜。

2026年9月,Codex在GPT-6 Astra之外加入了GPT-6 Sol和GPT-6 Luna。真正的问题不是“谁最强”,而是:

什么任务从一开始交给什么模型,完成成本最低?

1. 到底新增了什么

OpenAI在2026年9月22日发布GPT-6 Sol和GPT-6 Luna API,并把它们加入ChatGPT Work和Codex。[1][2]

GPT-6 Sol面向复杂编码和agentic workflow,Luna面向聚焦、批量、高吞吐任务。两者都有1.05M上下文窗口和最多128K输出。[3][4][5]

GPT-6 Astra则被定位为最困难的端到端工作模型,覆盖编码、电脑操作、研究和文档制作。[6]

粗略理解:

  • Luna:便宜的流水线工人
  • Sol:日常主力
  • Astra:一进机房就说“这根线接反了”的人

2. “GPT-6进ChatGPT了”为什么容易误解

9月22日的ChatGPT Release Notes明确写的是:Sol和Luna进入ChatGPT Work和Codex,并且它们与普通Chat里可用的模型是分开的。[1]

所以“进入ChatGPT产品”不等于“普通聊天窗口里可以直接选”。

Astra的9月发布公告则说明它会向付费ChatGPT用户推出。[6] 同样叫GPT-6,并不代表产品入口完全一样。

3. 标价差距非常大

截至2026年9月23日,Standard API每100万输入/输出token的价格如下。[3][4][6][7][8][9]

模型 输入 输出
GPT-6 Luna $0.10 $0.50
GPT-6 Sol $2.00 $10.00
GPT-6 Astra $10.00 $50.00
GPT-5.6 Luna $0.20 $1.20
GPT-5.6 Terra $2.00 $12.00
GPT-5.6 Sol $4.00 $20.00

相同token量下,Sol大约是Luna的20倍,Astra又是Sol的5倍。

只看这张表,“全部用Luna”似乎天下无敌。相当于为了省搬家费,决定自己背冰箱走十公里。

4. 100K输入+20K输出的简单模拟

假设一个任务使用100,000输入token和20,000输出token,不考虑缓存、工具费、长上下文加价和重试。

模型 单次估算API成本
GPT-6 Luna $0.020
GPT-6 Sol $0.400
GPT-6 Astra $2.000
GPT-5.6 Luna $0.044
GPT-5.6 Terra $0.440
GPT-5.6 Sol $0.800

纯token成本,Luna毫无悬念。

但真正应该算的是:

完成成本 ≈ 单次成本 × 所需尝试次数 + 人类介入时间 + 失败丢失的上下文

相同token消耗下,Astra一次大约等于Sol五次。如果Sol要试五次,而Astra一次解决,API费用已经打平。

5. “贵的Astra反而更便宜”确实会发生

OpenAI的Terminal-Bench 4.0结果中,GPT-6 Astra为57.9%,GPT-5.6 Sol为37.3%。而在比较设置里,Astra的每任务估算API成本还低约9%。[6]

AutomationBench是41.4%对18.1%,内部数据库迁移任务是63.9%对42.7%。[6]

所以“token单价高”和“完成工作更贵”不是一回事。

Astra还为Codex长会话引入了跨上下文窗口保存和检索信息的新机制。[6] 对大型重构和复杂debug来说,这意味着少一点“忘了刚才为什么失败,然后精准地再失败一次”。

6. 不要按便宜顺序试,要按任务形状路由

不建议所有任务都Luna→Sol→Astra逐级撞墙。

应该先分类,出现一次有意义的失败就升级。

GPT-6 Luna

  • grep、提取、分类、格式转换
  • 规范很清楚的小修改
  • 大量互相独立的任务
  • 跑测试、整理结果
  • 可以机械判定成功与否的工作

GPT-6 Sol

  • 常规多文件开发
  • 大致知道问题范围的debug
  • 标准agent工作流
  • 调查→修改→测试
  • Codex默认主力

GPT-6 Astra

  • 根因本身未知
  • 跨多个服务、权限、状态系统
  • 长时间debug
  • migration、大型重构
  • 每次都做到80%然后最后暴毙
  • Sol认真查过一次仍未收尾

7. GPT-5.6 Terra现在是什么位置

Standard价格:

  • GPT-5.6 Terra:$2 / $12
  • GPT-6 Sol:$2 / $10

输入一样,Sol输出更便宜。[3][8]

因此对新任务而言,Terra作为默认选择的经济理由明显变弱。当然,如果某套生产prompt已经在Terra上验证,稳定性和兼容性依然是合理理由。

新设计可以更简单地看成:

Luna=批量,Sol=默认,Astra=难题。

8. 最终答案要用自己的20个任务测

Benchmark是地图,不是你的代码库。

把真实任务分成3~5类,每类记录20个左右:

  • 是否无需人工追加指令就完成
  • 到green耗时
  • 重试次数
  • token或产品credit
  • 人类读了多少日志
  • 是否引入回归
  • 最后是否还是换了模型

最终优化的是:

每个完成任务的总成本

而不是“每100万token多少钱”。

结论:默认Sol,机械批量Luna,迷宫Astra

当前最容易执行的规则是:

GPT-6 Luna:明确、批量、独立任务。 GPT-6 Sol:常规Codex工作。 GPT-6 Astra:模糊、长链路、跨系统难题。

真正昂贵的往往不是Astra,而是为了省Astra,先失败好几次,最后还是用Astra。

人类第四次打开同一份日志的时间,也应该记到账单里。


参考资料(9条)

  1. OpenAI ChatGPT Release Notes help.openai.com
  2. OpenAI API Changelog developers.openai.com
  3. GPT-6 Sol developers.openai.com
  4. GPT-6 Luna developers.openai.com
  5. Models catalog developers.openai.com
  6. GPT-6 Astra openai.com
  7. GPT-5.6 Sol developers.openai.com
  8. GPT-5.6 Terra developers.openai.com
  9. GPT-5.6 Luna developers.openai.com

分享这篇文章

广告

查找其他文章

所有文章

Mendoi-chan

作者

Mendoi-chan

把工作与日常生活中的麻烦整理成清晰的结构和下一步行动。

关于本站
广告

最新文章

  1. 1Zero撤退的那一刻,黑色骑士团也该撤了|藤堂与“过度依赖Zero”的组织极限
  2. 2从第一季第25话等到R2:实时追番观众的地狱|枪口悬念之后,R2又像从“记忆被改写”开始
  3. 3蓝月亮,并不是蓝色的月亮
  4. 4为什么 Niconico 动画的评论,会带来一个人看时笑不出来的笑点
  5. 5“明明回复了,却被说成‘你根本不回’”——当聊天引擎被外包给一个人,会发生什么

推荐阅读

广告