Une IA à 99,95% sur des jeux 2D que les humains comprennent vite ? Ce qu’ARC-AGI-3 révèle sur la découverte de règles inconnues et son possible usage pour chercher des avantages de trading

Les capacités de l’IA ont longtemps été étrangement inégales.

Partager cet article

Partager cet article

Publicité
Publicité

0. Conclusion en cinq secondes : l’IA savait résoudre des problèmes d’élite mais pouvait encore se perdre dans un jeu simple sans manuel

Les capacités de l’IA ont longtemps été étrangement inégales.

Les machines ont dépassé les humains aux échecs depuis longtemps et, en 2025, une version avancée de Gemini Deep Think a obtenu 35/42, soit un niveau médaille d’or, lors d’une évaluation officielle de l’Olympiade internationale de mathématiques. Pourtant, les modèles de pointe pouvaient encore avoir beaucoup de mal lorsqu’on leur donnait un environnement 2D simple, sans instructions ni objectif explicite, en leur demandant de comprendre seuls quoi faire.[1]

ARC-AGI-3 a été conçu précisément pour mesurer cet écart. L’agent doit agir, observer les changements, inférer les mécanismes, découvrir les objectifs et planifier sans règles en langage naturel.[2][3]

En septembre 2026, GPT-6 Astra a obtenu 62,71% sur ARC-AGI-3 Semi-Private avec le Standard harness et un meilleur score vérifié de 99,95% avec le Provider Adapter d’OpenAI.[2][4]

Cela ne prouve pas que l’AGI est achevée. Ce n’est pas 100%, et le résultat à 99,95% utilise une gestion de contexte spécifique au fournisseur.

Le changement vraiment important est plus précis : l’IA est devenue bien meilleure pour apprendre dans un environnement nouveau où, au départ, la tâche elle-même n’est même pas claire.

Pour les marchés, cela suggère un rôle plus crédible que « prédis le prix de demain » : un agent qui découvre des avantages statistiques candidats, les teste et tente de détruire ses propres conclusions.

1. Qu’est-ce que l’AGI ? Et 1, 2, 3 sont des générations du test, pas des niveaux d’IA

AGI signifie Artificial General Intelligence, intelligence artificielle générale.

ARC Prize la décrit en gros comme un système capable d’acquérir les compétences que les humains peuvent acquérir avec une efficacité comparable à celle des humains.[2]

ARC-AGI-1, 2 et 3 ne signifient donc pas « AGI niveau 1, 2, 3 ». Ce sont des générations du benchmark.

  • ARC-AGI-1 : lancé en 2019 ; puzzles de grilles colorées où il faut déduire une transformation cachée à partir de quelques exemples.[5]
  • ARC-AGI-2 : même format, plus difficile. Chaque tâche retenue a été résolue par au moins deux personnes en deux essais ou moins.[5][6]
  • ARC-AGI-3 : passe des puzzles statiques à des environnements interactifs inconnus qu’il faut apprendre par de nombreuses actions.[3]

Version enfant :

1 = énigme visuelle
2 = énigme visuelle beaucoup plus méchante 3 = nouveau jeu après que quelqu’un a jeté le manuel

2. À quoi ressemble un « jeu inconnu » ? Un monde 2D qui ne prend sens qu’après l’action

ARC-AGI-3 utilise des environnements 2D au tour par tour. L’état peut être représenté sur des grilles allant jusqu’à 64×64 et l’agent choisit parmi les actions disponibles.[7]

Le point essentiel : connaître les boutons disponibles ne révèle pas ce que signifie gagner.

Un exemple inventé, qui n’est pas une tâche officielle, pourrait commencer ainsi :

■■□□□□
■●□□▲□
□□□■□□

Aucune explication.

Vous allez à droite, le point bouge. Vous touchez le triangle, sa couleur change. Ailleurs, quelque chose ressemblant à une porte s’ouvre.

Un humain forme aussitôt des hypothèses :

« Le point, c’est peut-être moi. »
« Le triangle est peut-être un interrupteur. »
« Il faut peut-être changer d’état avant d’aller vers la porte. »

ARC-AGI-3 mesure cette boucle : exploration → modélisation → acquisition du but → planification et exécution.[2]

Le benchmark est conçu pour être relativement rapide à prendre en main par des humains, mais cela ne veut pas dire que n’importe quel enfant termine tous les jeux. L’étude humaine de 2026 portait sur 458 participants : les environnements ont été calibrés comme résolubles par des humains, mais la réussite individuelle varie.[8]

3. Pourquoi l’IA pouvait-elle être excellente aux échecs et en mathématiques difficiles mais faible ici ?

Aux échecs, toutes les règles sont données dès le départ. En mathématiques, l’énoncé dit ce qu’il faut démontrer.

La tâche peut être extrêmement difficile, mais le cadre du problème est déjà fourni.

ARC-AGI-3 pose des questions plus fondamentales :

« Qu’est-ce qui compte comme progrès ? »
« À quoi sert cet objet ? »
« Qu’est-ce que ma dernière action a changé ? »

Les humains font cela sans arrêt avec de nouveaux appareils, jeux, emplois ou logiciels. Nous interagissons quelques fois puis construisons un modèle approximatif : « cela fonctionne probablement comme ça ».

Les modèles de pointe avaient une faiblesse importante pour construire et maintenir ce genre de modèle à partir de peu d’expérience.

Ils pouvaient résoudre un théorème complexe puis se perdre dans une interface ressemblant à un jouet.

4. GPT-5.6 Sol : un cerveau puissant qui, en pratique, jetait son carnet après chaque action

GPT-5.6 Sol Max a obtenu 96,5% sur ARC-AGI-1 et 92,5% sur ARC-AGI-2, mais seulement 7,78% sur ARC-AGI-3 Semi-Private.[9]

OpenAI a enquêté et découvert qu’une partie du problème venait du harness, le logiciel reliant le modèle au jeu.[10]

Le raisonnement caché était supprimé après les actions, et l’historique ancien finissait par être tronqué.

L’équivalent humain serait :

« Marcher sur le rouge ouvre la porte. »
→ faire un pas
→ déchirer la note où cette découverte était écrite
→ étape suivante : « C’est quoi ce truc rouge ? »

Quand OpenAI a activé la conservation du raisonnement et la compaction du contexte, Sol est passé de 13,3% à 38,3% sur le Public set.[10]

Il ne faut pas comparer directement 7,78 et 38,3 : le premier est Semi-Private, les autres Public.

La leçon reste claire : la capacité dépend autant du raisonnement du modèle que de la manière dont son expérience est conservée et compressée.

5. GPT-6 Astra : 62,71% et 99,95% ne sont pas le même type de résultat

ARC Prize a vérifié GPT-6 Astra le 2 septembre 2026.[4]

Ses meilleurs résultats Semi-Private sont :

Condition Meilleur score Astra
Standard harness 62,71% (Max)
Provider Adapter 99,95% (High)

Le Standard harness se rapproche d’une interface minimale commune, où le modèle choisit quelles notes visibles conserver.

Le Provider Adapter maintient entre les requêtes un état de raisonnement opaque spécifique au fournisseur et utilise la compaction pour les contextes longs.[2][4]

Dire « Astra seul, sans aide, a fait 99,95% » est donc inexact. La formulation juste est : Astra plus la gestion de contexte conçue par OpenAI a obtenu 99,95%.

Même le 62,71% Standard représente un bond énorme face aux 7,78% Semi-Private de Sol Max.[4][9]

La comparaison humaine demande aussi de la précision. Astra Max avec Provider Adapter a obtenu 98,55% et a utilisé moins d’actions que la référence humaine sur 96,0% des niveaux terminés, avec 51,7% d’actions en moins par niveau en moyenne.[2]

Cela ne signifie pas « plus intelligent que 96% des humains ». C’est une comparaison d’efficacité niveau par niveau contre une médiane humaine.

6. Que faisait réellement Astra ? Il écrivait un petit manuel de physique privé pour chaque jeu

ARC Prize a mis en avant le comportement d’Astra, pas seulement son score.

Au lieu de conserver toutes les observations brutes, Astra compressait des informations sur :

  • la position des objets,
  • les effets des actions,
  • l’état actuel,
  • les plans inachevés,
  • les prochaines opérations utiles.

Il créait même une notation symbolique compacte pour les mécaniques du jeu.[2]

Conceptuellement :

rouge + action droite → état B état B + cible bleue → porte ouverte

C’est un petit modèle du monde : une représentation interne capable de prédire ce que fera l’environnement ensuite.

La bonne réponse n’était pas mémorisée à l’avance ; la structure utile devait être extraite de l’interaction.

7. Est-ce donc l’AGI ? ARC Prize dit explicitement que non

ARC Prize décrit Astra comme un changement de palier visible dans les capacités de pointe, mais ne prétend pas qu’il prouve l’AGI.[2]

ARC-AGI-3 reste un monde limité :

  • grilles 2D,
  • tour par tour,
  • mécanismes déterministes,
  • objectifs fermés.

Le monde réel contient des règles qui changent, des variables cachées, des adversaires stratégiques et des objectifs ambigus.

De plus, le Grand Prize exige 100%. Un score vérifié de 99,95% est extrêmement proche, mais ce n’est pas 100%.[11]

La conclusion exacte est : l’intelligence générale n’est pas “terminée”, mais une faiblesse historique — apprendre efficacement dans des environnements interactifs nouveaux — a fortement reculé.

8. Où cela peut-il servir ? Dans les tâches où personne ne peut écrire tout le règlement à l’avance

Les applications les plus intéressantes dépassent largement les puzzles.

  1. Simulation d’usine et de logistique : varier personnel, stocks, séquences et itinéraires pour trouver les conditions réduisant retards et coûts.
  2. Exploration logicielle : apprendre des interfaces inconnues et trouver des conditions de bug reproductibles.
  3. Jeux et robotique : apprendre les relations causales entre actions et résultats avec peu d’essais.
  4. Publicité, tarification et opérations : explorer des combinaisons de décisions et observer les résultats.
  5. Assistance à la recherche : générer des hypothèses, tester, éliminer les échecs et mettre à jour le modèle du système.

L’instruction passe de « suis cette règle » à « découvre quelles règles comptent vraiment ».

9. Et les actions et le scalping ? Un détecteur d’avantages candidats est plus plausible qu’un oracle

Ici, un edge désigne un petit avantage statistique répétable qui subsiste après les coûts de trading.

Une approche de type Astra ne commencerait pas par une règle finie comme « acheter si le RSI passe sous 30 ». Elle observerait carnet d’ordres, transactions, prix, spread, volume et heure.

Puis elle demanderait :

Quelles combinaisons de conditions présentes sont suivies d’un léger biais directionnel sur les prochaines secondes ou minutes ?

L’IA pourrait proposer une hypothèse combinant hausse soudaine de la profondeur côté achat, rafale d’ordres au marché acheteurs, spread étroit et créneau horaire particulier.

Cela reste une hypothèse, pas une règle rentable.

Les marchés sont fondamentalement différents d’ARC parce que leurs règles ne restent pas fixes. Participants, nouvelles, liquidité, réglementation et régimes changent.

Si l’on dit seulement « trouve un motif rentable », l’IA peut prendre une coïncidence historique pour une loi de la nature.

10. Un système sérieux doit obliger l’IA à attaquer ses propres découvertes

Un backtest utilise des données historiques pour évaluer une règle de trading.

Le danger est de tester des milliers ou des millions de variantes : certaines sembleront extraordinaires uniquement par hasard. C’est le problème classique du surajustement de backtest.[12][13]

Un explorateur d’edge crédible devrait :

  1. générer des hypothèses ;
  2. chercher des candidats sur une période de développement ;
  3. les rejeter sur des données jamais utilisées pour la découverte ;
  4. essayer de les casser en marchés haussiers, baissiers, volatils et calmes ;
  5. déduire frais, spread et slippage ;
  6. enregistrer le nombre total d’idées testées ;
  7. faire une validation walk-forward dans l’ordre du temps ;
  8. utiliser du paper trading avant l’argent réel ;
  9. définir des conditions d’arrêt lorsque l’edge disparaît.

Le rôle idéal n’est pas celui d’un prophète.

C’est un chercheur qui propose 1 000 idées et un relecteur qui en tue 998.

11. Conclusion : de « l’IA qui répond » à « l’IA qui découvre quelles sont les règles »

Le plus important dans ARC-AGI-3 n’est pas seulement le spectaculaire 99,95%.

C’est la boucle :

observer → agir → échouer → inférer une règle → réviser l’hypothèse → avancer vers le but.

Sol a montré combien un modèle puissant peut souffrir lorsque son expérience est mal conservée. Astra a montré un énorme progrès pour compresser l’expérience en règles utiles et les exécuter avec peu d’interactions.

Cela change aussi la mission que l’on peut donner à un agent avancé.

Au lieu de :

« Voici la règle. Exécute-la. »

on peut dire :

« Voici l’environnement et les données. Trouve les règles qui semblent importantes, essaie de les casser dans d’autres conditions et ne rapporte que ce qui survit. »

Rien ne garantit que cela produira des profits en bourse. Les marchés sont bien plus hostiles qu’ARC.

Mais si l’on cesse de voir l’IA comme une voyante et qu’on la considère comme une machine à découvrir et attaquer des hypothèses, le résultat d’Astra devient une nouvelle très pratique.

Sources

  1. Google DeepMind — IMO 2025 gold-medal-level result (2025-07-21) deepmind.google
  2. ARC Prize — “OpenAI's GPT-6 Astra on ARC-AGI-3” (2026-09-03) arcprize.org
  3. ARC Prize — “Announcing ARC-AGI-3” (2026-03-25) arcprize.org
  4. ARC Prize Verified Results — GPT-6 Astra (verified 2026-09-02) arcprize.org
  5. ARC Prize — ARC-AGI-1 & ARC-AGI-2 Guide arcprize.org
  6. ARC Prize — “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (2025-05-20) arcprize.org
  7. ARC-AGI-3 Docs — Game Schema docs.arcprize.org
  8. ARC Prize — “Measuring Human Performance on ARC-AGI-3” (2026-04-14) arcprize.org
  9. ARC Prize Verified Results — GPT-5.6 arcprize.org
  10. OpenAI — “How two settings tripled our ARC-AGI-3 scores” (2026-07-29) openai.com
  11. ARC Prize 2026 — ARC-AGI-3 Competition; Grand Prize requires 100% arcprize.org
  12. Bailey, Borwein, López de Prado & Zhu — “The Probability of Backtest Overfitting papers.ssrn.com
  13. Bailey & López de Prado — “How ‘backtest overfitting’ in finance leads to false discoveries” (2021) academic.oup.com

Partager cet article

Publicité

Trouver d’autres articles

Tous les articles

Mendoi-chan

Rédigé par

Mendoi-chan

Elle transforme les frictions du travail et du quotidien en structures claires et en prochaines étapes concrètes.

À propos
Publicité

Articles récents

  1. 1Dormir 18 heures en une journée : sommeil de récupération ou signal à surveiller ?
  2. 2Faut-il vraiment s’excuser de « ne pas avoir donné de petits-enfants » à ses parents ? Parfois, le simple retour d’un enfant adulte pour partager un repas compte déjà beaucoup
  3. 3Le jour où une VTuber de 40 ans est devenue une « maison de quartier numérique » : l’âge ne tue pas toujours la demande, il peut en changer la forme
  4. 4J’ai confié depuis un smartphone un développement de niveau senior à un agent IA — et le déménagement s’est terminé avant
  5. 5Comment une automatisation d’articles par IA est devenue une « usine autonome » en environ une semaine : un coup d’Ultra, Level 6, et pourquoi Level 7 peut attendre

À lire aussi

Publicité