Comment la capacité d’exploration de GPT-6 Astra peut-elle aider la recherche en scalping ? — Quand l’IA fouille des milliers de combinaisons qui demandaient autrefois des années de travail humain, le vrai monstre est le surapprentissage

Partager cet article
Publicité
Publicité

Quiconque a étudié manuellement des stratégies de très court terme sait que la partie pénible n’est pas seulement « faire les calculs ».

Que faire quand le signal A apparaît ? Et si B apparaît au même moment ? Garder l’opération quand la volatilité est forte ? L’écarter quand le spread s’élargit ? Suivre la tendance pendant cette séance et ne rien faire pendant l’autre ?

Tester chaque branche une par une transforme vite une soirée ordinaire en laboratoire personnel. Passer plusieurs heures par jour pendant des années pour ne conserver qu’une stratégie survivante n’a rien d’absurde.

Puis arrive une IA orientée vers l’exploration.

Dans un tel flux de recherche, elle peut tester des milliers de variantes en quelques heures, chercher pourquoi le résultat reste instable et utiliser la cause de l’échec pour choisir l’expérience suivante.

La réaction humaine est immédiate :

« Combien de temps faudrait-il si une personne devait faire tout ça une par une ? »

Mais conclure « l’IA peut tester 4 000 stratégies, donc nous avons gagné » est dangereux. En finance, essayer davantage signifie aussi créer davantage d’occasions de surajuster le passé.[1][2]

La combinaison utile est plutôt :

hypothèse humaine × exploration par l’IA × réfutation par l’IA × correction statistique de la recherche massive.

Il ne faut pas seulement une IA qui trouve des gagnants. Il est utile d’en avoir une autre dont le travail consiste à essayer de les détruire.

1. Pourquoi des années de recherche manuelle peuvent soudain sembler compressées

La recherche manuelle d’une stratégie est une chaîne de petites tâches :

  1. Formuler une hypothèse.
  2. Implémenter une condition.
  3. Faire un backtest.
  4. Lire le résultat.
  5. Demander pourquoi il est instable.
  6. Séparer les conditions.
  7. Recommencer.

Aucune étape n’a besoin d’être extraordinaire seule. Le coût vient des centaines ou milliers de répétitions.

Il y a aussi le coût du changement de contexte : qu’ai-je testé hier ? Ai-je déjà essayé ce filtre ? Ce résultat date-t-il d’avant ou d’après la modification de l’hypothèse de spread ?

Un agent explorateur peut maintenir la boucle en mouvement.

Il ne doit pas s’arrêter à « rentable ». Il peut vérifier si le résultat dépend de quelques jours, disparaît après coûts, n’existe que pendant une séance ou s’effondre quand un composant est retiré.

C’est plus que du backtest plus rapide.

C’est une itération de recherche plus rapide.

2. La force d’Astra ressemble moins à « connaître la réponse » qu’à « savoir se déplacer dans un environnement inconnu »

ARC-AGI-3 illustre bien cette capacité.

C’est un benchmark interactif composé de nouveaux environnements en grille 2D, sans consignes en langage naturel ni objectif explicitement donné. L’agent doit explorer, inférer les règles, construire un modèle du monde, découvrir les buts, planifier, agir et corriger.[3][4]

En juillet 2026, GPT-5.6 Sol a obtenu 7,78 % sur le jeu semi-privé d’ARC Prize. OpenAI a aussi montré sur le jeu public qu’une autre configuration conservant l’état de raisonnement et compactant le contexte faisait passer Sol de 13,3 % à 38,3 %.[5]

En septembre, Astra a obtenu 62,7 % sur le même jeu semi-privé avec le Standard harness d’ARC Prize, et 99,9 % avec un Provider Adapter conservant davantage d’état de raisonnement entre les actions. Le choix du harness modifie fortement le score : il serait donc trompeur de lire 99,9 contre 7,78 comme un simple rapport à conditions identiques. Ce qui compte est le saut dans l’exploration, la modélisation d’état et l’adaptation à long horizon.[6][3]

ARC Prize indique également que, sur 96 % des niveaux terminés par Astra, le modèle a utilisé moins d’actions que la médiane des humains ayant terminé ces niveaux.[3]

Ce n’est pas exactement la même intelligence que résoudre une équation très difficile en une fois.

Cela ressemble davantage à :

« Que se passe-t-il si je touche ça ? Bien. Et si j’essaie ceci ? Ah, j’ai compris la règle. »

Le fait que des jeux 2D apparemment accessibles à un enfant aient longtemps résisté à l’IA rend cette frontière particulièrement visible.

ARC Prize précise aussi que saturer ARC-AGI-3 ne constitue pas une preuve d’AGI. Le benchmark est fermé et déterministe ; le monde réel ne l’est pas.[3]

3. Pourquoi explorer un jeu 2D peut rappeler la recherche en scalping

Le marché n’est pas un puzzle déterministe. Il comporte des acteurs concurrents, de l’information cachée, des changements de régime, des coûts et des contraintes d’exécution.

Mais la boucle de recherche peut se ressembler.

Supposons qu’ajouter une condition de déséquilibre du carnet d’ordres améliore le backtest.

Les questions suivantes sont obligatoires :

  • Le déséquilibre est-il réellement prédictif ?
  • Ne fonctionne-t-il qu’en forte volatilité ?
  • Le résultat est-il seulement un artefact d’un spread faible ?
  • Un tick d’exécution plus défavorable le détruit-il ?
  • L’effet est-il limité à une séance ?

Observer. Modifier. Mesurer. Mettre à jour l’hypothèse.

La structure rappelle ARC-AGI-3 : perception → action → retour → mise à jour du modèle → action suivante.[3][4]

Une meilleure instruction que « trouve les paramètres les plus rentables » devient donc :

« Décompose pourquoi ce profit existe, trouve les conditions qui le tuent et transforme ces échecs en expériences suivantes. »

4. L’expérience humaine ne disparaît pas — « cette zone semble prometteuse » devient une carte

On peut laisser l’IA partir de zéro.

Mais plus l’espace de recherche est grand, plus l’expérience humaine devient utile pour décider où dépenser d’abord le budget d’exploration.

Quelqu’un qui lit et teste des composants depuis des années possède souvent un savoir compressé :

  • faible seul, peut-être utile comme filtre ;
  • intéressant uniquement en régime tendanciel ;
  • magnifique en backtest, fragile après coûts ;
  • meilleur pour interdire de mauvaises entrées que pour prédire la direction ;
  • semble fort, mais probablement concentré sur une période.

Ce n’est pas une liste de vérités.

C’est une carte préalable de l’espace de recherche.

La science utilise déjà une structure proche. Co-Scientist, publié en 2026, part d’un objectif défini par le chercheur et de preuves antérieures, puis génère, critique, classe et fait évoluer des hypothèses en augmentant le calcul au moment du test.[7]

En trading, l’humain peut dire « commence à creuser ici » et l’IA explore des milliers de branches autour.

L’expérience est plus utile comme guide de budget que comme dogme.

5. Pourquoi les combinaisons deviennent un enfer manuel

Imaginons 20 composants.

Avec seulement deux choix — utiliser ou ne pas utiliser — il existe déjà :

2^20 = 1 048 576 combinaisons.

Avec trois choix — ne pas utiliser, utiliser normalement ou utiliser à l’envers — on obtient :

3^20 = 3 486 784 401 combinaisons.

Dans la vraie vie, personne ne teste tout par force brute. Le savoir métier élimine rapidement l’absurde.

Mais la recherche réelle ajoute aussi seuils, horaires, volatilité, spread, durée de position, exclusion de nouvelles, asymétrie long/short et hypothèses d’exécution.

L’ancien processus :

« Et si j’ajoute ceci ? Et si j’exclus ce cas ? Et seulement dans ce régime ? »

revenait donc à faire marcher un humain dans un arbre conditionnel gigantesque.

Qu’il faille des années n’a rien d’étonnant.

Le tableur était innocent. L’univers était trop grand.

6. La valeur de l’IA n’est pas la force brute, mais le choix de l’expérience suivante

Un bon explorateur change le test suivant en fonction du résultat précédent.

Si une stratégie vaut A+B+C+D, retirons les composants un par un.

  • Retirer D ne change presque rien → D est peut-être décoratif.
  • B est faible seul, mais A+B réduit fortement le drawdown → B peut être un filtre plutôt qu’une source prédictive.
  • C est faible globalement, mais fort en forte volatilité → C dépend peut-être du régime.

Retirer des composants pour comprendre leur contribution est souvent appelé test d’ablation.

Le nom compte moins que l’objectif :

démonter une stratégie complexe et identifier les pièces qui font vraiment le travail.

Explorer → échouer → classer la cause → choisir l’expérience suivante.

Automatiser cette boucle transforme le modèle en assistant de recherche plutôt qu’en simple optimiseur.

7. Le plus grand danger reste le surapprentissage — testez 4 000 choses et un « génie chanceux » apparaîtra

C’est le point critique en finance.

Si 4 000 stratégies sont testées et que seule la plus belle est montrée, le gagnant peut n’être que l’ajustement accidentel le plus chanceux à l’historique.

White a formalisé le problème du data snooping : réutiliser les mêmes données pour l’inférence et la sélection de modèles permet à des résultats satisfaisants d’apparaître par hasard plutôt que par réelle supériorité.[1]

Combiner plusieurs signaux aggrave encore le problème.

Novy-Marx a montré que les stratégies multi-signaux peuvent subir un biais de surapprentissage sévère et que des signaux aléatoires sans véritable pouvoir prédictif peuvent produire des backtests apparemment très significatifs après sélection et combinaison.[2]

La puissance d’exploration est à double tranchant.

L’IA peut se tromper des milliers de fois plus vite.

Puis récompenser la plus jolie erreur.

Plus la recherche est grande, plus la défense contre le surapprentissage doit faire partie du moteur de recherche lui-même.

8. La défense commence par enregistrer tous les essais et garder un jeu final hors de la sélection

Si des milliers de candidats ont été explorés, les candidats rejetés font aussi partie des preuves.

Un processus robuste devrait au minimum :

  1. Enregistrer chaque essai. Ce qui a changé, combien de variantes ont été testées, pourquoi elles ont été rejetées.
  2. Séparer découverte et évaluation finale. Ne pas regarder sans cesse le jeu final pendant la sélection.
  3. Valider vers l’avant dans le temps. Construire sur des données plus anciennes et tester sur des données plus récentes avec une validation walk-forward.
  4. Dégrader volontairement l’exécution. Augmenter spread, frais, slippage, latence et pessimisme des fills.
  5. Perturber les paramètres. Une stratégie qui ne vit qu’à un seuil magique mérite la méfiance.
  6. Séparer les régimes. Vérifier si les profits viennent d’une seule année, séance, volatilité, direction ou poignée d’opérations.
  7. Corriger statistiquement le fait d’avoir tenté beaucoup de choses.

Le Deflated Sharpe Ratio, DSR, ajuste l’interprétation du Sharpe pour le biais de sélection lié aux tests multiples et pour les rendements non normaux.[8]

La Probability of Backtest Overfitting, PBO, a été proposée spécifiquement pour les backtests d’investissement et estime la probabilité de surapprentissage grâce à une validation croisée symétrique combinatoire.[9]

Le Reality Check de White traite le data snooping parmi de nombreux candidats ; le test SPA de Hansen cherche à être plus puissant et moins sensible aux alternatives mauvaises ou non pertinentes.[1][10]

Pas besoin de retenir tous les sigles.

La règle suffit :

si le gagnant apparaît après 4 000 essais, jugez-le comme le gagnant d’un tournoi de 4 000 essais.

Et après avoir regardé le jeu final supposé intact puis modifié la stratégie, ce jeu n’est plus intact.

9. Une architecture forte peut utiliser deux IA : l’une trouve des gagnants, l’autre essaie de les tuer

Séparons les rôles.

IA exploratrice

  • crée de nouvelles conditions ;
  • recombine les hypothèses humaines ;
  • cherche des effets par régime ;
  • transforme les causes d’échec en nouvelles expériences.

IA de réfutation

  • dégrade les coûts ;
  • retarde les fills ;
  • retire des jours ;
  • perturbe les seuils ;
  • change de période et de marché ;
  • applique DSR, PBO, Reality Check et SPA ;
  • vérifie si le profit vient de très peu d’observations.

L’exploratrice dit : « J’en ai trouvé une. »

L’autre répond : « Vraiment ? »

Si elle survit, on recommence.

Dans la recherche financière, ce caractère désagréable est du contrôle qualité.

L’objectif devrait passer de « profit historique maximum » à :

« une structure qui reste compréhensible et résistante après une dégradation raisonnable des hypothèses, paramètres, coûts et échantillons ».

10. Lorsqu’un nouveau modèle sort, cherchez la capacité qui vient de franchir un mur — pas seulement la note globale

Cette idée dépasse largement le scalping.

Lorsqu’une nouvelle IA apparaît, quelques points de plus sur un benchmark général peuvent compter moins qu’une tâche étrange qui passe soudain de presque impossible à pratique.

La bonne question est :

« Quel travail n’était pas économiquement viable avec la génération précédente, mais le devient maintenant ? »

Avec Astra, ARC-AGI-3 met en avant l’exploration d’environnements inconnus, la création de modèles compacts, la conservation d’état et l’efficacité des actions.[3]

Il faut ensuite relier cette capacité aux vrais goulets d’étranglement :

  • Où les humains perdent-ils du temps à décider quoi tester ensuite ?
  • Où existe-t-il des milliers d’hypothèses vérifiables ?
  • Le succès et l’échec peuvent-ils être mesurés objectivement ?
  • La répétition amplifie-t-elle fortement l’écart de coût humain ?
  • Une meilleure exploration se transforme-t-elle en profit, économies ou R&D plus rapide ?

Plus ces conditions se recouvrent, plus l’opportunité est intéressante.

La science se dirige déjà dans cette direction : Co-Scientist fait croître une boucle générer → critiquer → comparer → faire évoluer des hypothèses.[7]

Le lancement d’un modèle peut donc être vu comme une chasse au trésor :

« Quelle partie atrocement fastidieuse du travail humain vient de devenir exécutable à l’échelle machine ? »

Résumé final :

L’humain dessine la première carte. L’IA creuse au-delà. La statistique demande si ce qui brille est vraiment de l’or.

Plus l’IA devient puissante, plus il faut garder un sceptique.

Ce sceptique peut lui aussi être une IA.


Sources

  1. Halbert White — A Reality Check for Data Snooping, Econometrica 68(5), 2000 onlinelibrary.wiley.com
  2. Robert Novy-Marx — Backtesting Strategies Based on Multiple Signals, NBER Working Paper 21329, 2015 nber.org
  3. ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 (2026-09-03) arcprize.org
  4. ARC Prize — Announcing ARC-AGI-3 / ARC-AGI-3 documentation https://docs.arcprize.org/ arcprize.org
  5. OpenAI — How two settings tripled our ARC-AGI-3 scores (GPT-5.6 Sol) openai.com
  6. OpenAI — GPT-6 Astra: A new generation of intelligence openai.com
  7. Juraj Gottweis et al. — Accelerating scientific discovery with Co-Scientist, Nature, 2026 nature.com
  8. David H. Bailey & Marcos López de Prado — The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality, 2014 doi.org
  9. David H. Bailey, Jonathan Borwein, Marcos López de Prado & Qiji Jim Zhu — The Probability of Backtest Overfitting, 2015 papers.ssrn.com
  10. Peter Reinhard Hansen — A Test for Superior Predictive Ability, Journal of Business & Economic Statistics 23(4), 2005 tandfonline.com
Publicité

Trouver d’autres articles

Tous les articles

Mendoi-chan

Rédigé par

Mendoi-chan

Elle transforme les frictions du travail et du quotidien en structures claires et en prochaines étapes concrètes.

À propos
Publicité

Articles récents

  1. 1Dormir 18 heures en une journée : sommeil de récupération ou signal à surveiller ?
  2. 2Faut-il vraiment s’excuser de « ne pas avoir donné de petits-enfants » à ses parents ? Parfois, le simple retour d’un enfant adulte pour partager un repas compte déjà beaucoup
  3. 3Le jour où une VTuber de 40 ans est devenue une « maison de quartier numérique » : l’âge ne tue pas toujours la demande, il peut en changer la forme
  4. 4J’ai confié depuis un smartphone un développement de niveau senior à un agent IA — et le déménagement s’est terminé avant
  5. 5Comment une automatisation d’articles par IA est devenue une « usine autonome » en environ une semaine : un coup d’Ultra, Level 6, et pourquoi Level 7 peut attendre

À lire aussi

Publicité