Quando o seletor mostra Low, a leitura natural é “modo econômico”, “tarefas simples” ou “sem pensar tão fundo”.
O GPT-6 Astra bagunça essa intuição.
Na mesma avaliação externa da Artificial Analysis, o Astra Low supera o GPT-5.6 Sol xhigh no Intelligence Index agregado, abre vantagem maior em alguns testes de programação com agentes e, nessa carga de avaliação, chega a ter custo menor por tarefa.[1]
A pergunta é inevitável:
“Então por que não deixar o Astra no Low para sempre?”
A resposta prática é: Low é um ótimo padrão inicial, mas não deve virar religião.
Comece no Low. Suba para Medium quando houver um erro real ou quando o problema exigir raciocínio mais encadeado. Deixe High e xhigh para a pequena parcela de trabalhos que realmente precisa deles.
O crachá diz Low. O desempenho não recebeu o memorando.
1. Primeiro os números — Sol xhigh contra Astra Low, Medium, High e xhigh
Valores conferidos em 12 de setembro de 2026 na Artificial Analysis.[1][2][3][4]
| Configuração | Intelligence Index | AutomationBench-AA | Terminal-Bench v4.0 | SciCode | Custo AA por tarefa | Tokens de saída/tarefa | Tokens de raciocínio/tarefa |
|---|---|---|---|---|---|---|---|
| GPT-5.6 Sol xhigh | 44 | 55% | 25% | 57% | $1.18 | ~20k | ~10k |
| GPT-6 Astra Low | 46 | 59% | 42% | 54% | $0.82 | ~4k | ~938 |
| GPT-6 Astra Medium | 50 | 65% | 49% | 54% | $1.54 | ~10k | ~3k |
| GPT-6 Astra High | 51 | 67% | 54% | 55% | $1.72 | ~12k | ~5k |
| GPT-6 Astra xhigh | 53 | 67% | 60% | 56% | $2.31 | ~17k | ~9k |
Não é correto transformar 46 contra 44 em “4,5% mais inteligente”. O Intelligence Index é um índice composto, não uma escala de proporção como preço ou distância.
O que podemos dizer é: Astra Low marcou 46 contra 44 do Sol xhigh, e no Terminal-Bench v4.0 ficou em 42% contra 25%.[1]
Mas o SciCode favorece o Sol xhigh, 57% contra 54% do Astra Low. Low não domina tudo.[1]
2. O paradoxo do preço — 2,5× mais por token, mas menos por tarefa de benchmark
Os preços oficiais da API são claros: Astra custa $10/$1/$50 por milhão de tokens de entrada/entrada em cache/saída; Sol custa $4/$0,40/$20.[5][6]
Com a mesma quantidade de tokens, Astra custa 2,5 vezes mais.
A tabela oficial de créditos de Work/Codex mantém a mesma proporção: Astra 250/25/1.250 e Sol 100/10/500 créditos por milhão.[7]
Mesmo assim, a Artificial Analysis mediu $0,82 por tarefa para Astra Low e $1,18 para Sol xhigh.[1]
Isso acontece porque um preço unitário maior pode gerar custo total menor quando o modelo usa muito menos tokens.
Na avaliação, Sol xhigh usou cerca de 20k tokens de saída e 10k de raciocínio por tarefa; Astra Low usou cerca de 4k e 938.[1]
É o táxi caro que vai direto ao destino contra o táxi barato que resolve fazer três voltas turísticas no bairro.
Esses $0,82 e $1,18 são médias ponderadas das tarefas da Artificial Analysis, não uma cobrança garantida para qualquer trabalho real no Codex.[1]
3. A própria OpenAI recomenda começar em Low ou Medium
O guia oficial do Astra para Work e Codex separa a escolha do modelo do nível de esforço de raciocínio.[8]
Esforço baixo serve como ponto de partida para respostas mais rápidas ou para estender a franquia; Medium equilibra tempo e profundidade; níveis mais altos ficam para problemas difíceis.[8]
A OpenAI também diz que Astra Low pode superar Sol High e recomenda testar Astra Low ou Medium se Sol High já vinha funcionando bem.[8]
E há um alerta importante: aumentar o esforço não garante um resultado melhor.[8]
Não é uma loja de RPG onde a espada mais cara vence toda batalha automaticamente.
4. O que pode ficar no Low?
Low funciona bem como padrão quando objetivo, arquivos e critérios de aceitação já estão claros.
Implementações bem delimitadas, alterações locais, refatoração, testes, revisão rotineira, investigação de erro conhecido, resumos, comparações e tarefas repetitivas com regras explícitas são bons exemplos.
A OpenAI recomenda checar instruções, arquivos, apps conectados e permissões antes de aumentar effort. Mais raciocínio não cria informação nem acesso que faltam.[8]
Sem permissão para o arquivo, xhigh continua sem permissão para o arquivo.
5. Quando subir de Low para Medium?
Se Low perder uma exigência clara mesmo com o material correto disponível, não é preciso pular direto para xhigh. Medium é a primeira escalada sensata.
Dependências entre arquivos, requisitos ambíguos, bugs com várias causas plausíveis, decisões de arquitetura, planos mais longos e correções guiadas por testes que falham combinam com Medium.
Astra Medium marcou Index 50, Terminal-Bench 49% e $1,54 por tarefa de avaliação.[2]
É mais profundo que Low sem chamar artilharia pesada.
6. Quando High e xhigh fazem sentido?
High faz sentido quando Medium ainda perde o problema central ou quando concorrência, desempenho, segurança e migrações tornam um erro caro.
Astra High: Index 51, Terminal-Bench 54%, $1,72 por tarefa.[3]
xhigh serve para investigações de causa raiz extremamente difíceis, trabalhos autônomos longos, redesenhos com muitas restrições e tarefas em que falhar custa muito. Chega a Index 53 e Terminal-Bench 60%, com $2,31 por tarefa.[4]
Dá para ir à padaria de helicóptero. Combustível continua existindo.
7. Então Sol xhigh ficou obsoleto? Ainda não
No SciCode, Sol xhigh tem 57%, contra 54/54/55/56% de Astra Low/Medium/High/xhigh.[1][2][3][4]
Além disso, com o mesmo volume de tokens, o preço oficial do Sol é 60% menor. Astra Low saiu mais barato por tarefa porque usou muito menos tokens naquela avaliação; isso não é garantia para todo projeto.[5][6][1]
Repositórios reais têm builds estranhos, convenções internas, ferramentas, permissões e histórico que nenhum benchmark reproduz por completo.
Benchmark é mapa, não fita métrica da escada da sua porta.
8. Regra prática — começar em Low e subir só com evidência
| Situação | Recomendação |
|---|---|
| Nova tarefa normal | Astra Low |
| Instruções e acesso corretos, mas um requisito central foi perdido | Astra Medium |
| Medium ainda perde o núcleo / arquitetura difícil | Astra High |
| High não fecha / custo de falha muito alto / causa raiz extrema | Astra xhigh |
| A parte difícil terminou e o trabalho voltou ao normal | Voltar ao Low |
Isso evita começar tudo no máximo e também evita repetir a mesma falha por teimosia no Low.
Effort é uma marcha, não uma personalidade.
9. Veredito — “Astra Low para sempre?” Como padrão, sim; fixo para sempre, não
Com os dados públicos disponíveis em 12 de setembro de 2026, começar o trabalho rotineiro do Codex no Astra Low é uma estratégia muito forte.
Ele supera Sol xhigh no índice agregado e no Terminal-Bench e saiu mais barato por tarefa nessa avaliação.[1]
A OpenAI também recomenda Low ou Medium como pontos de partida e avisa que mais effort não garante resposta melhor.[8]
A operação simples fica assim:
Low normalmente → Medium quando surge complexidade ou uma falha real → High se Medium não fecha → xhigh só no mais difícil → voltar ao Low depois.
Não se deixe enganar pelo nome.
Astra Low tem cara de modo econômico e joga como titular.
- Artificial Analysis — GPT-6 Astra (low) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- Artificial Analysis — GPT-6 Astra (medium) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- Artificial Analysis — GPT-6 Astra (high) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- Artificial Analysis — GPT-6 Astra (xhigh) vs GPT-5.6 Sol (xhigh) artificialanalysis.ai
- OpenAI API — GPT-6 Astra Model developers.openai.com
- OpenAI API — GPT-5.6 Sol Model developers.openai.com
- OpenAI Help Center — ChatGPT Rate Card (Business, Enterprise/Edu credit-based pricing) help.openai.com
- OpenAI Help Center — Managing usage with GPT-6 Astra in Work and Codex help.openai.com
