Como a capacidade de exploração do GPT-6 Astra pode ajudar na pesquisa de scalping? — Quando a IA testa milhares de combinações que antes exigiam anos de trabalho manual, o verdadeiro monstro é o sobreajuste

Compartilhar este artigo

Compartilhar este artigo

Publicidade
Publicidade

Quem já pesquisou estratégias de curtíssimo prazo manualmente sabe que a parte mais pesada não é apenas “fazer conta”.

O que fazer quando aparece o sinal A? E se B aparecer junto? Manter em alta volatilidade? Filtrar em baixa? Seguir tendência nesta sessão e ficar de fora naquela?

Quando cada ramificação é testada uma por uma, uma noite comum vira rapidamente um laboratório particular. Passar algumas horas por dia durante anos e terminar com uma única estratégia sobrevivente não é algo absurdo.

Então aparece uma IA voltada à exploração.

Em um fluxo desse tipo, ela pode testar milhares de variantes em escala de horas, investigar por que o resultado não é estável e transformar a causa da falha no próximo experimento.

A reação humana é imediata:

“Quanto tempo uma pessoa levaria para fazer isso tudo?”

Mas “a IA consegue testar 4.000 estratégias, então vencemos” é justamente a conclusão perigosa. Em finanças, testar mais também cria mais oportunidades de sobreajustar o passado.[1][2]

A combinação útil é outra:

hipótese humana × exploração por IA × refutação por IA × correção estatística da busca massiva.

Não basta uma IA que encontre vencedores. É útil ter outra cujo trabalho seja tentar destruí-los.

1. Por que anos de pesquisa manual podem parecer comprimidos de repente

Pesquisa manual de estratégia é uma sequência de tarefas pequenas:

  1. Formular uma hipótese.
  2. Implementar uma condição.
  3. Fazer backtest.
  4. Ler o resultado.
  5. Perguntar por que ficou instável.
  6. Separar condições.
  7. Testar de novo.

Nenhuma etapa precisa ser extraordinária isoladamente. O peso vem de repetir isso centenas ou milhares de vezes.

Há também o custo de trocar de contexto: o que foi testado ontem? Este filtro já foi usado? O resultado era de antes ou depois de mudar a hipótese de spread?

Um agente explorador consegue manter o ciclo andando.

Ele não precisa parar em “deu lucro”. Pode investigar se o resultado depende de poucos dias, desaparece após custos, vive apenas em uma sessão ou quebra quando um componente é retirado.

Isso é mais do que acelerar backtests.

É acelerar a própria iteração de pesquisa.

2. A força do Astra parece menos “saber a resposta” e mais “conseguir caminhar por um ambiente desconhecido”

O ARC-AGI-3 ajuda a visualizar essa diferença.

É um benchmark interativo feito de ambientes novos em grades 2D, sem instruções em linguagem natural e sem objetivo declarado. O agente precisa explorar, inferir regras, construir um modelo de funcionamento, descobrir metas, planejar, agir e corrigir o plano.[3][4]

Em julho de 2026, o GPT-5.6 Sol obteve 7,78% no conjunto semiprivado do ARC Prize. A OpenAI também mostrou, no conjunto público e em outra configuração, que preservar estado de raciocínio e compactar o contexto elevou o Sol de 13,3% para 38,3%.[5]

Em setembro, o Astra marcou 62,7% no mesmo conjunto semiprivado com o harness padrão do ARC Prize e 99,9% com um Provider Adapter que preserva mais estado de raciocínio entre ações. Como o harness muda muito o resultado, 99,9 contra 7,78 não deve ser lido como uma multiplicação simples em condições idênticas. O ponto relevante é o salto em exploração, modelagem de estado e adaptação de longo horizonte.[6][3]

O ARC Prize também informou que, em 96% dos níveis concluídos pelo Astra, ele usou menos ações do que a mediana dos humanos que concluíram o mesmo nível.[3]

É um tipo de força diferente de resolver uma equação difícil em uma única tentativa.

Parece mais com:

“O que acontece se eu mexer nisto? Certo. E se eu tentar aquilo? Ah, então esta é a regra.”

O fato de jogos 2D aparentemente simples terem sido difíceis para IA por tanto tempo torna essa mudança particularmente visível.

O próprio ARC Prize ressalta que saturar ARC-AGI-3 não prova AGI. O benchmark é fechado e determinístico; o mundo real é outra coisa.[3]

3. Por que explorar um jogo 2D lembra pesquisa de scalping

O mercado não é um quebra-cabeça determinístico. Há agentes concorrentes, informação escondida, mudança de regime, custos e restrições de execução.

Mas o ciclo de pesquisa pode ser parecido.

Suponha que adicionar uma condição de desequilíbrio no livro de ofertas melhore o backtest.

As perguntas seguintes são obrigatórias:

  • O desequilíbrio realmente prevê algo?
  • Funciona apenas em alta volatilidade?
  • É apenas um artefato de spread baixo?
  • Um tick pior de execução elimina o resultado?
  • O efeito existe somente em um horário?

Observar. Mudar. Medir. Atualizar a hipótese.

A estrutura lembra o ciclo do ARC-AGI-3: perceber, agir, receber feedback, atualizar o modelo e escolher a próxima ação.[3][4]

Por isso, uma instrução melhor que “ache os parâmetros mais lucrativos” é:

“Desmonte por que esse lucro existe, encontre as condições que o destroem e transforme essas falhas nos próximos experimentos.”

4. A experiência humana não desaparece — “aqui parece promissor” vira mapa de exploração

É possível mandar a IA começar do zero.

Mas, quanto maior o espaço de busca, mais útil fica a experiência humana para decidir onde gastar primeiro o orçamento de pesquisa.

Quem passou anos lendo e testando componentes costuma ter conhecimento comprimido assim:

  • fraco sozinho, talvez útil como filtro;
  • interessante apenas em regimes de tendência;
  • bonito no backtest, frágil depois dos custos;
  • melhor para bloquear entradas ruins do que para prever direção;
  • parece forte, mas provavelmente está concentrado em um período.

Isso não é uma lista de verdades.

É um mapa prévio do espaço de busca.

Na ciência aparece uma estrutura parecida. O Co-Scientist de 2026 parte de um objetivo definido pelo pesquisador e de evidências anteriores, e repete geração, crítica, ranking e evolução de hipóteses ao aumentar o poder computacional de teste.[7]

No trading, a pessoa pode dizer “comece a cavar aqui” e a IA explora milhares de ramificações próximas.

Experiência funciona melhor como guia de orçamento do que como dogma.

5. Por que múltiplas combinações viram um inferno manual

Imagine 20 componentes.

Com apenas duas opções — usar ou não usar — já existem:

2^20 = 1.048.576 combinações.

Com três opções — não usar, usar normalmente, usar ao contrário — surgem:

3^20 = 3.486.784.401 combinações.

Na prática, ninguém testa tudo por força bruta. Conhecimento do domínio elimina absurdos cedo.

Mas uma pesquisa real ainda adiciona limiares, horários, volatilidade, spread, duração, exclusão de notícias, assimetria entre compra e venda e hipóteses de execução.

Então o antigo processo de:

“E se eu olhar isto também? E se eu excluir aquele caso? E só neste regime?”

era uma pessoa caminhando manualmente por uma árvore condicional gigantesca.

Não é surpresa levar anos.

A planilha era inocente. O universo era grande demais.

6. O comportamento valioso da IA não é força bruta; é escolher o próximo experimento

Um bom explorador muda o teste seguinte com base no resultado anterior.

Se a estratégia é A+B+C+D, retire uma peça por vez.

  • Tirar D quase não muda nada → D pode ser decorativa.
  • B é fraco sozinho, mas A+B reduz bastante o drawdown → B pode ser filtro, não fonte de previsão.
  • C é fraco no geral, mas forte em alta volatilidade → C pode depender do regime.

Remover componentes para entender contribuição costuma ser chamado de teste de ablação.

O nome é menos importante que o objetivo:

desmontar uma estratégia complexa e descobrir quais peças realmente trabalham.

Explorar → falhar → classificar a falha → escolher a próxima experiência.

Automatizar esse ciclo aproxima o modelo de um assistente de pesquisa, não apenas de um otimizador.

7. O maior perigo continua sendo o sobreajuste — teste 4.000 coisas e aparecerá um “gênio de sorte”

Este é o ponto crítico em finanças.

Se 4.000 estratégias são testadas e só a mais bonita é mostrada, o vencedor pode ser apenas o melhor encaixe acidental no histórico.

White formalizou o problema do data snooping: reutilizar o mesmo conjunto de dados para inferência e seleção de modelos permite que bons resultados apareçam por acaso, e não por verdadeira superioridade.[1]

Combinar sinais piora o problema.

Novy-Marx mostrou que estratégias com múltiplos sinais podem sofrer forte viés de sobreajuste e que até sinais aleatórios, sem poder preditivo real, podem gerar backtests aparentemente muito significativos depois de seleção e combinação.[2]

A capacidade de exploração tem dois lados.

A IA pode errar milhares de vezes mais rápido.

E depois premiar o erro mais bonito.

Quanto maior a busca, mais a defesa contra sobreajuste deve estar dentro do próprio processo de busca.

8. A defesa começa registrando todas as tentativas e preservando um conjunto final fora da seleção

Se milhares de candidatos foram explorados, os candidatos rejeitados também são evidência.

Um fluxo robusto deveria incluir pelo menos:

  1. Registrar cada tentativa. O que mudou, quantas variantes foram testadas e por que foram descartadas.
  2. Separar descoberta e avaliação final. Não olhar repetidamente o conjunto final enquanto escolhe o modelo.
  3. Validar para frente no tempo. Construir com dados anteriores e testar em dados posteriores com avaliação walk-forward.
  4. Piorar a execução de propósito. Aumentar spread, comissão, slippage, latência e pessimismo de fills.
  5. Perturbar parâmetros. Uma estratégia que só vive em um limiar mágico é suspeita.
  6. Separar regimes. Ver se o lucro vem de um ano, sessão, nível de volatilidade, direção ou poucas operações.
  7. Corrigir o fato de que muitas tentativas foram feitas.

O Deflated Sharpe Ratio, DSR, ajusta a interpretação do Sharpe para viés de seleção de múltiplos testes e retornos não normais.[8]

A Probability of Backtest Overfitting, PBO, foi proposta especificamente para backtests de investimento e estima a probabilidade de sobreajuste com validação cruzada simétrica combinatória.[9]

O Reality Check de White trata data snooping entre muitos candidatos, enquanto o teste SPA de Hansen busca maior poder e menor sensibilidade a alternativas ruins ou irrelevantes.[1][10]

Não é necessário decorar todas as siglas.

A regra é:

se o vencedor apareceu depois de 4.000 tentativas, avalie-o como vencedor de um torneio de 4.000 tentativas.

E, depois de olhar o conjunto supostamente final e modificar a estratégia, esse conjunto deixou de ser intocado.

9. Uma arquitetura forte pode ter duas IAs: uma encontra vencedores e outra tenta matá-los

Divida os papéis.

IA exploradora

  • cria novas condições;
  • recombina hipóteses humanas;
  • procura efeitos por regime;
  • transforma causas de falha em novos testes.

IA de refutação

  • piora custos;
  • atrasa execução;
  • remove dias;
  • desloca limiares;
  • muda período e mercado;
  • aplica DSR, PBO, Reality Check e SPA;
  • verifica se o lucro vem de pouquíssimas observações.

A exploradora diz: “Achei.”

A outra responde: “Tem certeza?”

Se sobreviver, bate de novo.

Em pesquisa financeira, essa personalidade desagradável é controle de qualidade.

O objetivo deixa de ser “maior lucro histórico” e vira:

“uma estrutura que continua explicável e resistente depois de danificar razoavelmente hipóteses, parâmetros, custos e amostra”.

10. Quando um novo modelo sair, procure a capacidade que acabou de atravessar um muro — não apenas a nota geral

A ideia vale muito além do scalping.

Quando surge uma nova IA, um pequeno ganho em benchmark genérico pode importar menos que uma tarefa estranha que passa de quase impossível para prática.

A pergunta útil é:

“Que trabalho não compensava economicamente na geração anterior e agora pode compensar?”

No Astra, ARC-AGI-3 destaca exploração de ambientes desconhecidos, criação de modelos compactos, retenção de estado e ação eficiente.[3]

Depois conecte isso a gargalos reais:

  • Onde humanos perdem tempo decidindo o próximo teste?
  • Onde existem milhares de hipóteses verificáveis?
  • Sucesso e fracasso podem ser medidos objetivamente?
  • Repetição amplia muito a diferença de custo de trabalho?
  • Exploração melhor vira lucro, economia ou P&D mais rápido?

Quanto mais respostas positivas, mais interessante a oportunidade.

A ciência já está indo nessa direção: o Co-Scientist escala um ciclo de gerar, criticar, comparar e evoluir hipóteses.[7]

Assim, o lançamento de um modelo pode ser visto como uma caça ao tesouro:

“Qual parte brutalmente tediosa do trabalho humano acabou de se tornar escalável por máquina?”

Resumo final:

A pessoa desenha o primeiro mapa. A IA cava além dele. A estatística pergunta se aquilo que brilha é realmente ouro.

Quanto mais poderosa a IA, mais importante manter alguém cético.

Esse cético também pode ser outra IA.


  1. Halbert White — A Reality Check for Data Snooping, Econometrica 68(5), 2000 onlinelibrary.wiley.com
  2. Robert Novy-Marx — Backtesting Strategies Based on Multiple Signals, NBER Working Paper 21329, 2015 nber.org
  3. ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 (2026-09-03) arcprize.org
  4. ARC Prize — Announcing ARC-AGI-3 / ARC-AGI-3 documentation https://docs.arcprize.org/ arcprize.org
  5. OpenAI — How two settings tripled our ARC-AGI-3 scores (GPT-5.6 Sol) openai.com
  6. OpenAI — GPT-6 Astra: A new generation of intelligence openai.com
  7. Juraj Gottweis et al. — Accelerating scientific discovery with Co-Scientist, Nature, 2026 nature.com
  8. David H. Bailey & Marcos López de Prado — The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality, 2014 doi.org
  9. David H. Bailey, Jonathan Borwein, Marcos López de Prado & Qiji Jim Zhu — The Probability of Backtest Overfitting, 2015 papers.ssrn.com
  10. Peter Reinhard Hansen — A Test for Superior Predictive Ability, Journal of Business & Economic Statistics 23(4), 2005 tandfonline.com

Compartilhar este artigo

Publicidade

Encontrar outros artigos

Todos os artigos

Mendoi-chan

Escrito por

Mendoi-chan

Transforma as dificuldades do trabalho e do dia a dia em estruturas claras e próximos passos práticos.

Sobre o site
Publicidade

Artigos recentes

  1. 1Dormi 18 horas em um dia: sono de recuperação ou um sinal para prestar atenção?
  2. 2“Desculpa por não te dar netos” é mesmo necessário? Às vezes, o filho adulto voltar para casa e comer com os pais já significa muita coisa
  3. 3O dia em que uma VTuber de 40 anos virou um “centro comunitário digital”: idade nem sempre mata a demanda — às vezes muda o formato dela
  4. 4Como a automação de artigos com IA virou uma “fábrica autônoma” em cerca de uma semana: um soco de Ultra, Level 6 e por que o Level 7 pode esperar
  5. 5A IA é brilhante, mas a fábrica para em “tá, e o que vamos construir?” — Quem acende a primeira ideia transforma capacidade em produção

Leia também

Publicidade