AI编程里最容易踩的成本陷阱,就是只看“一次调用多少钱”。
一个便宜模型连续迷路五次,最后留下一句“权限不足”就原地去世;另一个贵模型第一次就找到真正原因。后者完全可能更便宜。
2026年9月,Codex在GPT-6 Astra之外加入了GPT-6 Sol和GPT-6 Luna。真正的问题不是“谁最强”,而是:
什么任务从一开始交给什么模型,完成成本最低?
1. 到底新增了什么
OpenAI在2026年9月22日发布GPT-6 Sol和GPT-6 Luna API,并把它们加入ChatGPT Work和Codex。[1][2]
GPT-6 Sol面向复杂编码和agentic workflow,Luna面向聚焦、批量、高吞吐任务。两者都有1.05M上下文窗口和最多128K输出。[3][4][5]
GPT-6 Astra则被定位为最困难的端到端工作模型,覆盖编码、电脑操作、研究和文档制作。[6]
粗略理解:
- Luna:便宜的流水线工人
- Sol:日常主力
- Astra:一进机房就说“这根线接反了”的人
2. “GPT-6进ChatGPT了”为什么容易误解
9月22日的ChatGPT Release Notes明确写的是:Sol和Luna进入ChatGPT Work和Codex,并且它们与普通Chat里可用的模型是分开的。[1]
所以“进入ChatGPT产品”不等于“普通聊天窗口里可以直接选”。
Astra的9月发布公告则说明它会向付费ChatGPT用户推出。[6] 同样叫GPT-6,并不代表产品入口完全一样。
3. 标价差距非常大
截至2026年9月23日,Standard API每100万输入/输出token的价格如下。[3][4][6][7][8][9]
| 模型 | 输入 | 输出 |
|---|---|---|
| GPT-6 Luna | $0.10 | $0.50 |
| GPT-6 Sol | $2.00 | $10.00 |
| GPT-6 Astra | $10.00 | $50.00 |
| GPT-5.6 Luna | $0.20 | $1.20 |
| GPT-5.6 Terra | $2.00 | $12.00 |
| GPT-5.6 Sol | $4.00 | $20.00 |
相同token量下,Sol大约是Luna的20倍,Astra又是Sol的5倍。
只看这张表,“全部用Luna”似乎天下无敌。相当于为了省搬家费,决定自己背冰箱走十公里。
4. 100K输入+20K输出的简单模拟
假设一个任务使用100,000输入token和20,000输出token,不考虑缓存、工具费、长上下文加价和重试。
| 模型 | 单次估算API成本 |
|---|---|
| GPT-6 Luna | $0.020 |
| GPT-6 Sol | $0.400 |
| GPT-6 Astra | $2.000 |
| GPT-5.6 Luna | $0.044 |
| GPT-5.6 Terra | $0.440 |
| GPT-5.6 Sol | $0.800 |
纯token成本,Luna毫无悬念。
但真正应该算的是:
完成成本 ≈ 单次成本 × 所需尝试次数 + 人类介入时间 + 失败丢失的上下文
相同token消耗下,Astra一次大约等于Sol五次。如果Sol要试五次,而Astra一次解决,API费用已经打平。
5. “贵的Astra反而更便宜”确实会发生
OpenAI的Terminal-Bench 4.0结果中,GPT-6 Astra为57.9%,GPT-5.6 Sol为37.3%。而在比较设置里,Astra的每任务估算API成本还低约9%。[6]
AutomationBench是41.4%对18.1%,内部数据库迁移任务是63.9%对42.7%。[6]
所以“token单价高”和“完成工作更贵”不是一回事。
Astra还为Codex长会话引入了跨上下文窗口保存和检索信息的新机制。[6] 对大型重构和复杂debug来说,这意味着少一点“忘了刚才为什么失败,然后精准地再失败一次”。
6. 不要按便宜顺序试,要按任务形状路由
不建议所有任务都Luna→Sol→Astra逐级撞墙。
应该先分类,出现一次有意义的失败就升级。
GPT-6 Luna
- grep、提取、分类、格式转换
- 规范很清楚的小修改
- 大量互相独立的任务
- 跑测试、整理结果
- 可以机械判定成功与否的工作
GPT-6 Sol
- 常规多文件开发
- 大致知道问题范围的debug
- 标准agent工作流
- 调查→修改→测试
- Codex默认主力
GPT-6 Astra
- 根因本身未知
- 跨多个服务、权限、状态系统
- 长时间debug
- migration、大型重构
- 每次都做到80%然后最后暴毙
- Sol认真查过一次仍未收尾
7. GPT-5.6 Terra现在是什么位置
Standard价格:
- GPT-5.6 Terra:$2 / $12
- GPT-6 Sol:$2 / $10
因此对新任务而言,Terra作为默认选择的经济理由明显变弱。当然,如果某套生产prompt已经在Terra上验证,稳定性和兼容性依然是合理理由。
新设计可以更简单地看成:
Luna=批量,Sol=默认,Astra=难题。
8. 最终答案要用自己的20个任务测
Benchmark是地图,不是你的代码库。
把真实任务分成3~5类,每类记录20个左右:
- 是否无需人工追加指令就完成
- 到green耗时
- 重试次数
- token或产品credit
- 人类读了多少日志
- 是否引入回归
- 最后是否还是换了模型
最终优化的是:
每个完成任务的总成本
而不是“每100万token多少钱”。
结论:默认Sol,机械批量Luna,迷宫Astra
当前最容易执行的规则是:
GPT-6 Luna:明确、批量、独立任务。 GPT-6 Sol:常规Codex工作。 GPT-6 Astra:模糊、长链路、跨系统难题。
真正昂贵的往往不是Astra,而是为了省Astra,先失败好几次,最后还是用Astra。
人类第四次打开同一份日志的时间,也应该记到账单里。
参考资料(9条)
- OpenAI ChatGPT Release Notes help.openai.com
- OpenAI API Changelog developers.openai.com
- GPT-6 Sol developers.openai.com
- GPT-6 Luna developers.openai.com
- Models catalog developers.openai.com
- GPT-6 Astra openai.com
- GPT-5.6 Sol developers.openai.com
- GPT-5.6 Terra developers.openai.com
- GPT-5.6 Luna developers.openai.com
