Astra Low 可以一直用吗?——Sol xhigh 与 Astra 四档性能、成本对比

看到模型选择器里的 Low,大多数人第一反应都是“省钱档”“简单任务档”“还没认真想”。

广告
广告

看到模型选择器里的 Low,大多数人第一反应都是“省钱档”“简单任务档”“还没认真想”。

GPT-6 Astra 的 Low 偏偏不太配合这个名字。

在 Artificial Analysis 的同一套第三方评测里,Astra Low 的综合 Intelligence Index 高于 GPT-5.6 Sol xhigh,在部分代理式编程评测上的优势更明显,而且在这套评测工作负载里,每个任务的成本反而更低。[1]

于是问题很自然:

“那是不是干脆一直用 Astra Low 就行?”

结论是:把 Low 当默认起点很合理,但把 Low 永久锁死并不是最优策略。

通常从 Low 开始;出现真实遗漏或问题明显变复杂时升到 Medium;Medium 仍解决不了的少数难题再用 High / xhigh。

名字叫 Low,干活一点都不低调。

1. 先看数字——Sol xhigh 对 Astra Low/Medium/High/xhigh

截至 2026 年 9 月 12 日,Artificial Analysis 的对比数据如下。[1][2][3][4]

设置 Intelligence Index AutomationBench-AA Terminal-Bench v4.0 SciCode AA 每任务成本 输出token/任务 推理token/任务
GPT-5.6 Sol xhigh 44 55% 25% 57% $1.18 约20k 约10k
GPT-6 Astra Low 46 59% 42% 54% $0.82 约4k 约938
GPT-6 Astra Medium 50 65% 49% 54% $1.54 约10k 约3k
GPT-6 Astra High 51 67% 54% 55% $1.72 约12k 约5k
GPT-6 Astra xhigh 53 67% 60% 56% $2.31 约17k 约9k

不能把 46 对 44 直接换算成“聪明 4.5%”。Intelligence Index 是综合指数,不是价格或距离那种可直接做比例解释的尺度。

可以明确说的是:同一指数下 Astra Low 为 46,Sol xhigh 为 44;Terminal-Bench v4.0 则是 42% 对 25%。[1]

但 SciCode 上 Sol xhigh 是 57%,Astra Low 是 54%。所以 Astra Low 并不是所有维度都严格压过 Sol。[1]

2. 最奇怪的成本现象——单价贵 2.5 倍,Low 的评测任务却更便宜

OpenAI 官方 API 价格很清楚:Astra 每百万输入/缓存输入/输出 token 分别为 $10/$1/$50,Sol 为 $4/$0.40/$20。[5][6]

相同 token 数下,Astra 是 2.5 倍。

Work/Codex 官方 credit rate 也是同一比例:Astra 为 250/25/1,250,Sol 为 100/10/500 credits per 1M。[7]

可 Artificial Analysis 的任务成本却是 Astra Low $0.82、Sol xhigh $1.18。[1]

原因并不神秘:单价更高的模型,只要用的 token 少得多,总任务成本仍可能更低。

这套评测中,Sol xhigh 每任务大约用了 20k 输出和 10k 推理 token;Astra Low 只有约 4k 和 938。[1]

就像豪华出租车单公里更贵,但它直奔目的地;便宜车却绕着街区观光三圈。

不过 $0.82 和 $1.18 是 Artificial Analysis 对其评测任务的加权平均,并不是你的 Codex 项目一定会出现的实际账单。[1]

3. OpenAI 自己也建议从 Low 或 Medium 开始

OpenAI 的 Work/Codex Astra 使用指南把模型选择和推理强度分开说明。[8]

较低 effort 适合追求速度或延长额度,Medium 是时间与深度的平衡,更高 effort 用于真正困难的问题。[8]

官方还明确说,Astra Low 有时能超过 Sol High;如果 Sol High 已经能给你好结果,可以先尝试 Astra Low 或 Medium。[8]

更关键的是:更高 effort 并不保证结果一定更好。[8]

这不是“商店里最贵的剑必然每场战斗伤害最高”的游戏。

4. 哪些工作可以常驻 Low?

目标、文件、验收条件明确的任务最适合把 Low 设为默认。

比如明确需求的实现、局部代码修改、重构、补测试、常规代码审查、已知错误调查、摘要、对比,以及按固定规则重复执行的任务。

OpenAI 也建议,在提高 effort 之前先检查指令是否清楚,模型是否拥有需要的文件、连接应用和权限。推理强度无法凭空创造缺失的信息或访问权。[8]

没给文件,再上 xhigh 也不会获得透视能力。

5. 什么时候从 Low 升到 Medium?

Low 在材料齐全时仍漏掉一次核心要求,不必直接跳 xhigh。Medium 是第一档真正的升级。

跨文件依赖、模糊需求、多种可能原因的 bug、架构取舍、较长实施计划、边看失败测试边修复,都更适合 Medium。

Astra Medium 的 Index 是 50,Terminal-Bench 49%,评测任务成本 $1.54。[2]

它比 Low 更重,但还没到“为了买瓶水呼叫装甲部队”的程度。

6. High 和 xhigh 什么时候值得?

如果 Medium 仍持续错过核心问题,或者并发、性能、安全、数据迁移等场景让错误决策的返工成本很高,可以上 High。

Astra High 为 Index 51、Terminal-Bench 54%、每任务 $1.72。[3]

xhigh 更适合最难的根因分析、长时间自主任务、多约束重构,以及失败代价很高的一次性工作。它的 Index 53、Terminal-Bench 60% 在这五档里最高,评测任务成本也最高,为 $2.31。[4]

每天去便利店都坐直升机,确实很强,但油钱也是真的。

7. 那 Sol xhigh 已经过时了吗?还没有

SciCode 上 Sol xhigh 为 57%,高于 Astra Low/Medium/High/xhigh 的 54/54/55/56%。[1][2][3][4]

而且同 token 数时,Sol 官方单价比 Astra 低 60%。Astra Low 在评测任务中更便宜,是因为那套工作负载里它用了少得多的 token,并不保证所有真实项目都如此。[5][6][1]

真实代码库还有评测看不到的构建系统、内部约定、工具权限、历史包袱和奇怪故障。

基准测试是地图,不是你家门口台阶的卷尺。

8. 实用规则——从 Low 开始,有证据再升级

情况 推荐设置
开始普通新任务 Astra Low
指令和权限完整,但核心要求漏了一次 Astra Medium
Medium 仍漏核心 / 高难度架构 Astra High
High 仍无法收尾 / 失败代价极高 / 最难根因 Astra xhigh
难点解决,回到常规工作 回到 Low

这样既不会一开始就烧最高额度,也不会因为迷信 Low 而重复同一个失败。

把 effort 当成挡位,不要当成身份。

9. 结论——“一直 Astra Low?”默认 Yes,永久固定 No

按 2026 年 9 月 12 日的公开数据,把日常 Codex 工作从 Astra Low 开始,是很强的策略。

它在 Artificial Analysis 综合指数和 Terminal-Bench 上超过 Sol xhigh,并在这套评测里拥有更低的任务成本。[1]

OpenAI 也推荐把 Low 或 Medium 作为起点,并提醒更高 effort 不保证更好答案。[8]

最简单的运行方式就是:

平时 Low → 出现复杂性或真实遗漏就 Medium → Medium 也收不了就 High → 最难问题才 xhigh → 解决后回 Low。

别被名字骗了。

Astra Low 长着省电模式的脸,实际坐的是主力阵容。


资料来源

  1. Artificial Analysis — GPT-6 Astra (low) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
  2. Artificial Analysis — GPT-6 Astra (medium) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
  3. Artificial Analysis — GPT-6 Astra (high) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
  4. Artificial Analysis — GPT-6 Astra (xhigh) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
  5. OpenAI API — GPT-6 Astra Model developers.openai.com
  6. OpenAI API — GPT-5.6 Sol Model developers.openai.com
  7. OpenAI Help Center — ChatGPT Rate Card (Business, Enterprise/Edu credit-based pricing) help.openai.com
  8. OpenAI Help Center — Managing usage with GPT-6 Astra in Work and Codex help.openai.com
广告
Mendoi-chan

作者

Mendoi-chan

把工作与日常生活中的麻烦整理成清晰的结构和下一步行动。

关于本站
广告

最新文章

  1. 1AI智能体会让人类变得不再必要吗?用环境设计和趋势感知打造“老板被工厂赶出去”的自治媒体
  2. 2长时间运行的 AI Agent 要不要记录进度?用 Heartbeat 避免“是不是停了?”
  3. 3用一部手机把“高级工程师级”的开发交给AI,结果搬家先结束了——AI代理时代,不会亲自写代码到底有多大问题?
  4. 4AI文章自动化危险吗?把实时反应、可靠证据、持续改进和自有网站连成“活的媒体系统”
  5. 5工厂比1,500篇文章先建起来了:探索、结构化、改进和自动化如何被AI复利式放大

推荐阅读

广告