0. Resumo em cinco segundos: a IA conseguia resolver problemas de elite e ainda assim se perder em um jogo simples sem manual
A capacidade da IA sempre foi estranhamente desigual.
Máquinas já superaram humanos no xadrez há muito tempo e, em 2025, uma versão avançada do Gemini Deep Think obteve 35/42 pontos, nível de medalha de ouro, em avaliação oficial da Olimpíada Internacional de Matemática. Mesmo assim, modelos de fronteira podiam sofrer quando recebiam um ambiente 2D simples, sem instruções e sem objetivo explícito, e tinham que descobrir sozinhos o que fazer.[1]
O ARC-AGI-3 foi criado para medir exatamente essa lacuna. O agente precisa agir, observar mudanças, inferir mecanismos, descobrir objetivos e planejar sem regras em linguagem natural.[2][3]
Em setembro de 2026, o GPT-6 Astra alcançou 62,71% no ARC-AGI-3 Semi-Private com o Standard harness e um máximo verificado de 99,95% com o Provider Adapter da OpenAI.[2][4]
Isso não prova que a AGI esteja pronta. Não é 100%, e o resultado de 99,95% usou gerenciamento de contexto específico do provedor.
A mudança realmente importante é mais específica: a IA melhorou muito em aprender dentro de um ambiente desconhecido em que, no início, nem a própria tarefa está clara.
No mercado, isso sugere um papel melhor do que “preveja o preço de amanhã”: um agente que descobre possíveis vantagens estatísticas, testa e tenta destruir as próprias conclusões.
1. O que é AGI? E 1, 2 e 3 são gerações do teste, não níveis de IA
AGI significa Artificial General Intelligence, inteligência artificial geral.
O ARC Prize trata AGI, de forma aproximada, como um sistema capaz de adquirir habilidades que humanos conseguem aprender, com eficiência semelhante à humana.[2]
ARC-AGI-1, 2 e 3 não significam “AGI nível 1, 2 e 3”. São gerações do benchmark.
- ARC-AGI-1: lançado em 2019; quebra-cabeças de grade colorida nos quais o solucionador deduz uma transformação escondida a partir de poucos exemplos.[5]
- ARC-AGI-2: mesmo formato, maior dificuldade. Toda tarefa incluída foi resolvida por pelo menos duas pessoas em no máximo duas tentativas.[5][6]
- ARC-AGI-3: sai de puzzles estáticos e vai para ambientes interativos desconhecidos que precisam ser aprendidos ao longo de muitas ações.[3]
Versão para criança:
1 = puzzle visual
2 = puzzle visual muito mais maldoso
3 = jogo novo depois que alguém jogou o manual fora
2. Como é um “jogo desconhecido”? Um mundo 2D cujo sentido só aparece quando você age
O ARC-AGI-3 usa ambientes 2D por turnos. O estado pode ser representado em grades de até 64×64, e o agente escolhe entre as ações disponíveis.[7]
O ponto-chave é que saber quais botões existem não revela o que significa vencer.
Um exemplo inventado, não uma tarefa oficial, poderia começar assim:
■■□□□□
■●□□▲□
□□□■□□
Sem explicação.
Você move para a direita e o ponto se move. Encosta no triângulo e ele muda de cor. Em outro lugar, algo parecido com uma porta se abre.
Uma pessoa começa a criar hipóteses:
“Talvez o ponto seja eu.”
“Talvez o triângulo seja um interruptor.”
“Talvez eu precise mudar de estado antes de chegar à porta.”
O ARC-AGI-3 mede esse ciclo: exploração → modelagem → aquisição de objetivo → planejamento e execução.[2]
O benchmark foi projetado para ser relativamente rápido de aprender por humanos, mas isso não significa que qualquer criança zere todos os jogos. O estudo humano de 2026 envolveu 458 participantes; os ambientes foram calibrados como solucionáveis por humanos, embora o sucesso individual variasse.[8]
3. Por que a IA podia ser ótima em xadrez e matemática difícil, mas fraca aqui?
No xadrez, as regras completas já são dadas. Na matemática, o problema diz o que deve ser provado.
Podem ser tarefas absurdamente difíceis, mas a moldura do problema já está pronta.
O ARC-AGI-3 pergunta algo anterior:
“O que conta como progresso?”
“Para que serve este objeto?”
“O que mudou por causa da minha última ação?”
Humanos fazem isso o tempo todo com aparelhos, jogos, empregos e aplicativos novos. Mexemos algumas vezes e criamos um modelo aproximado de “provavelmente funciona assim”.
Modelos de fronteira tinham uma fraqueza importante em construir e manter esse tipo de modelo a partir de pouca experiência.
Podiam resolver um teorema difícil e depois se perder numa interface parecida com brinquedo.
4. GPT-5.6 Sol: um cérebro forte que, na prática, jogava o caderno fora
O GPT-5.6 Sol Max marcou 96,5% no ARC-AGI-1 e 92,5% no ARC-AGI-2, mas apenas 7,78% no ARC-AGI-3 Semi-Private.[9]
A OpenAI investigou e descobriu que parte do problema estava no harness, o software que liga o modelo ao jogo.[10]
O raciocínio oculto era descartado depois das ações, e o histórico antigo acabava truncado.
Em versão humana:
“Pisar no vermelho abre a porta.”
→ dá um passo
→ rasga a anotação dessa descoberta
→ no passo seguinte: “O que é essa coisa vermelha?”
Quando a OpenAI ativou retenção de raciocínio e compactação de contexto, o Sol subiu de 13,3% para 38,3% no Public set.[10]
Não se deve comparar diretamente 7,78 com 38,3: o primeiro é Semi-Private e os outros são Public.
A lição, porém, é clara: capacidade depende tanto do raciocínio do modelo quanto de como a experiência é preservada e comprimida.
5. GPT-6 Astra: 62,71% e 99,95% não são o mesmo tipo de resultado
O ARC Prize verificou o GPT-6 Astra em 2 de setembro de 2026.[4]
Os melhores resultados Semi-Private foram:
| Condição | Melhor resultado do Astra |
|---|---|
| Standard harness | 62,71% (Max) |
| Provider Adapter | 99,95% (High) |
O Standard harness se aproxima de uma interface mínima compartilhada, na qual o modelo decide quais notas visíveis manter.
O Provider Adapter preserva estado de raciocínio opaco específico do provedor entre requisições e usa compactação em contextos longos.[2][4]
Por isso, “Astra sozinho e sem ajuda fez 99,95%” é impreciso. A formulação correta é: Astra mais o gerenciamento de contexto projetado pela OpenAI fez 99,95%.
Mesmo 62,71% no Standard já é um salto enorme diante dos 7,78% Semi-Private do Sol Max.[4][9]
A comparação humana também precisa de cuidado. Astra Max com Provider Adapter marcou 98,55% e, nos níveis que completou, usou menos ações que a referência humana em 96,0% dos níveis, com 51,7% menos ações por nível em média.[2]
Isso não significa “mais inteligente que 96% das pessoas”. É uma comparação de eficiência por nível contra uma mediana humana.
6. O que o Astra realmente fazia? Escrevia um pequeno livro de física particular para cada jogo
O ARC Prize destacou o comportamento do Astra, não só a pontuação.
Em vez de guardar cada observação literalmente, ele comprimía informações sobre:
- posição dos objetos,
- efeitos das ações,
- estado atual,
- planos inacabados,
- próximas operações úteis.
Ele chegou a criar uma notação simbólica curta para representar mecânicas do jogo.[2]
Conceitualmente, algo como:
vermelho + ação para a direita → estado B estado B + alvo azul → porta abre
Isso é um pequeno modelo de mundo: uma representação interna capaz de prever o que o ambiente fará em seguida.
A resposta não estava decorada de antemão; a estrutura útil precisava ser extraída da interação.
7. Então isso é AGI? O ARC Prize diz explicitamente que não
O ARC Prize descreve o Astra como uma mudança de patamar perceptível na capacidade de fronteira, mas não afirma que ele prove AGI.[2]
O ARC-AGI-3 ainda é um mundo limitado:
- grades 2D,
- interação por turnos,
- mecânicas determinísticas,
- objetivos fechados.
O mundo real tem regras que mudam, variáveis escondidas, adversários estratégicos e objetivos ambíguos.
Além disso, o Grand Prize exige 100%. Um 99,95% verificado está muito perto, mas não é 100%.[11]
A leitura precisa é: a inteligência geral não está “concluída”, mas uma fraqueza histórica — aprender com eficiência em ambientes interativos novos — diminuiu drasticamente.
8. Onde isso pode ser útil? Em trabalhos nos quais ninguém consegue escrever todo o manual antecipadamente
As aplicações mais interessantes vão muito além de puzzles.
- Simulação de fábrica e logística: variar equipe, estoque, sequência e rotas para descobrir condições que reduzem atraso e custo.
- Exploração de software: aprender interfaces desconhecidas e achar condições reproduzíveis de bugs.
- Jogos e robótica: aprender relações causais entre ação e resultado com poucas tentativas.
- Publicidade, preços e operações: explorar combinações de decisões e observar resultados.
- Apoio à pesquisa: gerar hipóteses, testar, descartar falhas e atualizar o modelo do sistema.
A tarefa muda de “siga esta regra” para “descubra quais regras realmente importam”.
9. E ações e scalping? Um descobridor de vantagens candidatas faz mais sentido que um oráculo
Aqui, edge significa uma pequena vantagem estatística repetível que continua existindo depois dos custos de negociação.
Uma abordagem tipo Astra não começaria com uma regra pronta como “compre quando RSI ficar abaixo de 30”. Ela observaria livro de ofertas, negócios, preço, spread, volume e horário.
Depois perguntaria:
Quais combinações do estado atual são seguidas por um pequeno viés direcional nos próximos segundos ou minutos?
A IA poderia propor, por exemplo, uma hipótese combinando aumento súbito da profundidade compradora, rajada de compras a mercado, spread estreito e uma janela específica de horário.
Isso ainda é uma hipótese, não uma regra lucrativa.
Mercados são fundamentalmente diferentes de ARC porque suas regras não ficam paradas. Participantes, notícias, liquidez, regulação e regimes mudam.
Se você disser apenas “ache um padrão lucrativo”, a IA pode confundir coincidência histórica com lei da natureza.
10. Um sistema sério deve obrigar a IA a atacar as próprias descobertas
Backtest é o uso de dados históricos para avaliar uma regra de trading.
O perigo é testar milhares ou milhões de variantes: algumas parecerão espetaculares apenas por acaso. Esse é o problema clássico de overfitting de backtest.[12][13]
Um explorador de edges confiável deveria:
- gerar hipóteses;
- buscar candidatos em um período de desenvolvimento;
- rejeitá-los em dados nunca usados na descoberta;
- tentar quebrá-los em mercados de alta, baixa, alta volatilidade e baixa volatilidade;
- descontar taxas, spread e slippage;
- registrar quantas ideias foram testadas;
- fazer validação walk-forward respeitando o tempo;
- usar paper trading antes de dinheiro real;
- definir condições de desligamento quando a vantagem desaparecer.
O papel ideal não é profeta.
É um pesquisador que propõe 1.000 ideias e um revisor que mata 998 delas.
11. Conclusão: de “IA que responde” para “IA que descobre quais são as regras”
O mais importante no ARC-AGI-3 não é só o chamativo 99,95%.
É o ciclo:
observar → agir → falhar → inferir uma regra → revisar a hipótese → avançar para o objetivo.
O Sol mostrou quanto um modelo forte sofre quando sua experiência é mal preservada. O Astra mostrou um avanço enorme ao comprimir experiência em regras úteis e executá-las com poucas interações.
Isso permite mudar a tarefa que damos a agentes avançados.
Em vez de:
“Esta é a regra. Execute.”
podemos dizer:
“Aqui estão o ambiente e os dados. Descubra as regras que parecem importar, tente quebrá-las em outras condições e traga apenas o que sobreviver.”
Nada disso garante lucro no mercado. Mercados são muito mais hostis que ARC.
Mas, se pararmos de tratar IA como vidente e começarmos a tratá-la como uma máquina para descobrir e atacar hipóteses, o resultado do Astra vira uma notícia bastante prática.
- Google DeepMind — IMO 2025 gold-medal-level result (2025-07-21) deepmind.google
- ARC Prize — “OpenAI's GPT-6 Astra on ARC-AGI-3” (2026-09-03) arcprize.org
- ARC Prize — “Announcing ARC-AGI-3” (2026-03-25) arcprize.org
- ARC Prize Verified Results — GPT-6 Astra (verified 2026-09-02) arcprize.org
- ARC Prize — ARC-AGI-1 & ARC-AGI-2 Guide arcprize.org
- ARC Prize — “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (2025-05-20) arcprize.org
- ARC-AGI-3 Docs — Game Schema docs.arcprize.org
- ARC Prize — “Measuring Human Performance on ARC-AGI-3” (2026-04-14) arcprize.org
- ARC Prize Verified Results — GPT-5.6 arcprize.org
- OpenAI — “How two settings tripled our ARC-AGI-3 scores” (2026-07-29) openai.com
- ARC Prize 2026 — ARC-AGI-3 Competition; Grand Prize requires 100% arcprize.org
- Bailey, Borwein, López de Prado & Zhu — “The Probability of Backtest Overfitting papers.ssrn.com
- Bailey & López de Prado — “How ‘backtest overfitting’ in finance leads to false discoveries” (2021) academic.oup.com
