看到模型选择器里的 Low,大多数人第一反应都是“省钱档”“简单任务档”“还没认真想”。
GPT-6 Astra 的 Low 偏偏不太配合这个名字。
在 Artificial Analysis 的同一套第三方评测里,Astra Low 的综合 Intelligence Index 高于 GPT-5.6 Sol xhigh,在部分代理式编程评测上的优势更明显,而且在这套评测工作负载里,每个任务的成本反而更低。[1]
于是问题很自然:
“那是不是干脆一直用 Astra Low 就行?”
结论是:把 Low 当默认起点很合理,但把 Low 永久锁死并不是最优策略。
通常从 Low 开始;出现真实遗漏或问题明显变复杂时升到 Medium;Medium 仍解决不了的少数难题再用 High / xhigh。
名字叫 Low,干活一点都不低调。
1. 先看数字——Sol xhigh 对 Astra Low/Medium/High/xhigh
截至 2026 年 9 月 12 日,Artificial Analysis 的对比数据如下。[1][2][3][4]
| 设置 | Intelligence Index | AutomationBench-AA | Terminal-Bench v4.0 | SciCode | AA 每任务成本 | 输出token/任务 | 推理token/任务 |
|---|---|---|---|---|---|---|---|
| GPT-5.6 Sol xhigh | 44 | 55% | 25% | 57% | $1.18 | 约20k | 约10k |
| GPT-6 Astra Low | 46 | 59% | 42% | 54% | $0.82 | 约4k | 约938 |
| GPT-6 Astra Medium | 50 | 65% | 49% | 54% | $1.54 | 约10k | 约3k |
| GPT-6 Astra High | 51 | 67% | 54% | 55% | $1.72 | 约12k | 约5k |
| GPT-6 Astra xhigh | 53 | 67% | 60% | 56% | $2.31 | 约17k | 约9k |
不能把 46 对 44 直接换算成“聪明 4.5%”。Intelligence Index 是综合指数,不是价格或距离那种可直接做比例解释的尺度。
可以明确说的是:同一指数下 Astra Low 为 46,Sol xhigh 为 44;Terminal-Bench v4.0 则是 42% 对 25%。[1]
但 SciCode 上 Sol xhigh 是 57%,Astra Low 是 54%。所以 Astra Low 并不是所有维度都严格压过 Sol。[1]
2. 最奇怪的成本现象——单价贵 2.5 倍,Low 的评测任务却更便宜
OpenAI 官方 API 价格很清楚:Astra 每百万输入/缓存输入/输出 token 分别为 $10/$1/$50,Sol 为 $4/$0.40/$20。[5][6]
相同 token 数下,Astra 是 2.5 倍。
Work/Codex 官方 credit rate 也是同一比例:Astra 为 250/25/1,250,Sol 为 100/10/500 credits per 1M。[7]
可 Artificial Analysis 的任务成本却是 Astra Low $0.82、Sol xhigh $1.18。[1]
原因并不神秘:单价更高的模型,只要用的 token 少得多,总任务成本仍可能更低。
这套评测中,Sol xhigh 每任务大约用了 20k 输出和 10k 推理 token;Astra Low 只有约 4k 和 938。[1]
就像豪华出租车单公里更贵,但它直奔目的地;便宜车却绕着街区观光三圈。
不过 $0.82 和 $1.18 是 Artificial Analysis 对其评测任务的加权平均,并不是你的 Codex 项目一定会出现的实际账单。[1]
3. OpenAI 自己也建议从 Low 或 Medium 开始
OpenAI 的 Work/Codex Astra 使用指南把模型选择和推理强度分开说明。[8]
较低 effort 适合追求速度或延长额度,Medium 是时间与深度的平衡,更高 effort 用于真正困难的问题。[8]
官方还明确说,Astra Low 有时能超过 Sol High;如果 Sol High 已经能给你好结果,可以先尝试 Astra Low 或 Medium。[8]
更关键的是:更高 effort 并不保证结果一定更好。[8]
这不是“商店里最贵的剑必然每场战斗伤害最高”的游戏。
4. 哪些工作可以常驻 Low?
目标、文件、验收条件明确的任务最适合把 Low 设为默认。
比如明确需求的实现、局部代码修改、重构、补测试、常规代码审查、已知错误调查、摘要、对比,以及按固定规则重复执行的任务。
OpenAI 也建议,在提高 effort 之前先检查指令是否清楚,模型是否拥有需要的文件、连接应用和权限。推理强度无法凭空创造缺失的信息或访问权。[8]
没给文件,再上 xhigh 也不会获得透视能力。
5. 什么时候从 Low 升到 Medium?
Low 在材料齐全时仍漏掉一次核心要求,不必直接跳 xhigh。Medium 是第一档真正的升级。
跨文件依赖、模糊需求、多种可能原因的 bug、架构取舍、较长实施计划、边看失败测试边修复,都更适合 Medium。
Astra Medium 的 Index 是 50,Terminal-Bench 49%,评测任务成本 $1.54。[2]
它比 Low 更重,但还没到“为了买瓶水呼叫装甲部队”的程度。
6. High 和 xhigh 什么时候值得?
如果 Medium 仍持续错过核心问题,或者并发、性能、安全、数据迁移等场景让错误决策的返工成本很高,可以上 High。
Astra High 为 Index 51、Terminal-Bench 54%、每任务 $1.72。[3]
xhigh 更适合最难的根因分析、长时间自主任务、多约束重构,以及失败代价很高的一次性工作。它的 Index 53、Terminal-Bench 60% 在这五档里最高,评测任务成本也最高,为 $2.31。[4]
每天去便利店都坐直升机,确实很强,但油钱也是真的。
7. 那 Sol xhigh 已经过时了吗?还没有
SciCode 上 Sol xhigh 为 57%,高于 Astra Low/Medium/High/xhigh 的 54/54/55/56%。[1][2][3][4]
而且同 token 数时,Sol 官方单价比 Astra 低 60%。Astra Low 在评测任务中更便宜,是因为那套工作负载里它用了少得多的 token,并不保证所有真实项目都如此。[5][6][1]
真实代码库还有评测看不到的构建系统、内部约定、工具权限、历史包袱和奇怪故障。
基准测试是地图,不是你家门口台阶的卷尺。
8. 实用规则——从 Low 开始,有证据再升级
| 情况 | 推荐设置 |
|---|---|
| 开始普通新任务 | Astra Low |
| 指令和权限完整,但核心要求漏了一次 | Astra Medium |
| Medium 仍漏核心 / 高难度架构 | Astra High |
| High 仍无法收尾 / 失败代价极高 / 最难根因 | Astra xhigh |
| 难点解决,回到常规工作 | 回到 Low |
这样既不会一开始就烧最高额度,也不会因为迷信 Low 而重复同一个失败。
把 effort 当成挡位,不要当成身份。
9. 结论——“一直 Astra Low?”默认 Yes,永久固定 No
按 2026 年 9 月 12 日的公开数据,把日常 Codex 工作从 Astra Low 开始,是很强的策略。
它在 Artificial Analysis 综合指数和 Terminal-Bench 上超过 Sol xhigh,并在这套评测里拥有更低的任务成本。[1]
OpenAI 也推荐把 Low 或 Medium 作为起点,并提醒更高 effort 不保证更好答案。[8]
最简单的运行方式就是:
平时 Low → 出现复杂性或真实遗漏就 Medium → Medium 也收不了就 High → 最难问题才 xhigh → 解决后回 Low。
别被名字骗了。
Astra Low 长着省电模式的脸,实际坐的是主力阵容。
资料来源
- Artificial Analysis — GPT-6 Astra (low) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- Artificial Analysis — GPT-6 Astra (medium) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- Artificial Analysis — GPT-6 Astra (high) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- Artificial Analysis — GPT-6 Astra (xhigh) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- OpenAI API — GPT-6 Astra Model developers.openai.com
- OpenAI API — GPT-5.6 Sol Model developers.openai.com
- OpenAI Help Center — ChatGPT Rate Card (Business, Enterprise/Edu credit-based pricing) help.openai.com
- OpenAI Help Center — Managing usage with GPT-6 Astra in Work and Codex help.openai.com
