1. Au départ, je voulais seulement gagner à un jeu de cartes
Le plan n’avait rien d’académique : gagner du PP, retirer Ward, Storm face, gagner.
Puis on fait jouer l’IA des milliers de parties pour comparer des decks, et les questions arrivent : est-ce du hasard ? la moyenne suffit-elle ? que faire d’un matchup catastrophique ? comment raisonner avec une main adverse cachée ? pourquoi une nouvelle politique régresse-t-elle ?
Soudain apparaissent Monte Carlo, mise à jour bayésienne, équilibre de Nash, programmation dynamique, POMDP, optimisation robuste, inférence causale et contrefactuels.
L’humain n’a pas besoin de calculer tout cela mentalement. Il choisit la question ; l’IA et le code gèrent répétition, journalisation, statistiques et comparaisons.
2. Imaginons un métier : « professeur de jeu de cartes »
Entraîner une IA à jouer comme un bon humain ressemble à former un nouvel employé.
Le « stagiaire » doit apprendre le mulligan, la conservation des cartes, l’usage de l’Évolution, les réponses adverses, le plan à deux ou trois tours, le lethal, la taille de main et l’espace de board.
Trop d’informations à tenir simultanément, donc on conçoit le travail : condition de victoire, ressources à ne pas dépenser, puis vérification de la survie au prochain tour.
Puis l’IA pratique des milliers de parties.
Quatre mille parties de stage, ce n’est plus un stage, c’est une usine de formation.
3. Suivre littéralement un conseil humain peut rendre l’IA plus faible
Les guides disent : « garde cette carte », « réserve SEP », « rampe tôt », « garde les pièces de combo ».
C’est souvent juste, mais conditionnel.
Garde-la, sauf si la jouer évite de mourir. Économise l’Évolution, sauf si la dépenser maintenant détruit le prochain tour adverse. Rampe, sauf si perdre le board signifie mourir.
Les humains ajoutent automatiquement ces exceptions grâce à l’expérience. L’IA peut ne pas le faire.
Humain : « En général, garde-la. » IA : « Compris. » IA : meurt.
Obéir à une instruction et comprendre son objectif sont deux compétences différentes.
4. Recherche arborescente : lire « ce coup, le suivant, puis le suivant »
Supposons trois actions : A retirer une unité, B attaquer le leader, C conserver la carte.
Chaque action ouvre un futur différent, puis l’adversaire possède plusieurs réponses. Ces branches forment un arbre.
Le problème : les branches explosent. Dix choix par étape peuvent donner environ dix mille branches en quatre étapes.
On utilise donc une limite de profondeur, le beam search et un budget de nœuds.
Mais couper trop tôt peut supprimer une action faible maintenant mais excellente dans deux tours.
Chercher ne signifie pas seulement « regarder plus loin ». Il faut décider quels futurs méritent de rester vivants.
5. Les autres théories ont chacune un rôle
Monte Carlo : simuler de nombreuses fois et regarder la moyenne.
Mise à jour bayésienne : modifier la probabilité que l’adversaire possède quelque chose après observation.
POMDP : décider lorsque certaines informations réelles sont cachées.
Minimax : supposer que l’adversaire choisit la meilleure réponse.
Équilibre de Nash : étudier les stratégies où changer seul n’apporte pas facilement un avantage.
Apprentissage sans regret : réduire sur le long terme le « j’aurais dû choisir autre chose ».
Optimisation robuste : être fort sans s’effondrer dans les mauvais matchups.
CVaR : regarder la zone des mauvais résultats.
A/B apparié : même seed, mêmes decks, même ordre ; seule la politique change.
Intervalle de confiance : mesurer combien de différence peut venir du bruit.
Ablation : retirer un composant à la fois.
Contrefactuel : tester une autre action depuis le même état.
Inférence causale : vérifier si modifier la cause supposée modifie réellement le résultat.
Les noms anglais impressionnent. En français simple : tester souvent, mettre à jour une hypothèse, regarder le pire, comparer proprement et interroger un suspect à la fois.
6. Où finit le niveau licence et où commence l’esprit recherche ?
Statistiques, Monte Carlo, programmation dynamique, théorie des jeux, Bayes et optimisation peuvent apparaître à l’université.
Ce qui ressemble davantage à la recherche avancée est la boucle : observer une régression, formuler plusieurs hypothèses, prédire les preuves attendues, ajouter des traces, changer un composant, tester des contrefactuels, utiliser des données jamais vues et refuser la méthode si elle échoue.
L’université donne une boîte à outils. La recherche demande comment produire des preuves convaincantes avec ces outils.
7. Sciences humaines ou STEM ? Les vrais problèmes mélangent tout
Recherche, algorithmes, probabilités et apprentissage par renforcement sont très techniques.
Théorie des jeux, Nash, Pareto, risque et décision sont aussi présents en économie et recherche opérationnelle.
L’inférence causale apparaît en économie, médecine, sciences sociales et IA.
Les problèmes réels ne respectent pas les départements.
Même un board de cartes peut devenir un laboratoire interdisciplinaire.
8. La valeur des études n’est pas de tout mémoriser
Il est normal d’oublier des formules après des années.
Mais avoir entendu parler de Monte Carlo, Bayes, optimisation ou théorie des jeux crée un index mental.
Face à un problème, on peut penser : « Ça ressemble à Bayes », « c’est peut-être une optimisation », « comparons sous les mêmes conditions ».
C’est bien plus facile que de ne même pas savoir quoi chercher.
L’éducation construit une carte des outils. La formation professionnelle fonctionne aussi ainsi : bases d’abord, profondeur lorsque la pratique l’exige.
9. L’IA augmente énormément la valeur de « connaître les bases »
Autrefois, connaître le nom d’une méthode pouvait être insuffisant si l’on ne savait pas dériver les équations, coder et faire les statistiques.
Aujourd’hui, l’humain peut orienter : « Monte Carlo convient-il ici ? », « est-ce un problème d’information cachée ? », « cette différence peut-elle être du hasard ? », « faisons une ablation ».
L’IA aide à implémenter et calculer.
La connaissance de base devient aussi un index pour donner le bon travail intellectuel à l’IA.
10. Ne pas avoir “d’allergie au savoir” est un avantage
POMDP, PSRO, CVaR, cluster bootstrap.
Les mots sont agressifs.
Mais si votre première réaction est « à quoi ça sert ? » plutôt que « ce n’est pas pour moi », vous êtes déjà entré.
POMDP : information cachée. PSRO : ajouter des réponses fortes. CVaR : regarder les mauvais résultats. Cluster bootstrap : mesurer l’incertitude en respectant les groupes liés.
Pas besoin de tout comprendre avant de toucher. On touche d’abord, on approfondit avec l’IA ensuite.
11. Si la mémoire de travail sature, sortez la mémoire de votre tête
Un jeu de cartes demande déjà main, board, PP, Évolution, réponses, Ward, soins, lethal et tours futurs.
La recherche ajoute seeds, hashes, configs, hypothèses, intervalles et historique.
Inutile de tout mémoriser.
Conditions dans les configs, calculs dans le code, historique dans les logs, comparaisons massives par l’IA.
L’humain garde la question et le sentiment : « ce résultat est bizarre ».
Ce n’est pas tricher. C’est réserver le cerveau au jugement.
12. Conclusion : je voulais Storm face et j’ai compris l’utilité des études
Un jeu de cartes a relié recherche, probabilités, statistiques, théorie des jeux, causalité, éducation et IA.
Pas besoin de tout maîtriser lors du premier apprentissage.
Avoir vu l’idée, connaître son nom et ne pas en avoir peur suffit déjà à créer une porte d’entrée pour plus tard.
L’IA réduit énormément le coût entre « ça me dit quelque chose » et « je peux le tester sur un vrai problème ».
L’humain pose la question. La machine calcule. Le résultat paraît étrange, l’humain repose une question.
Et l’objectif d’origine reste simple.
Retirer Ward. Évoluer.
Storm face.
Endroit inattendu pour rentabiliser les études.


