Attendre une grande annonce du mardi et recevoir d'abord un long message sur une nouvelle méthode de calcul des quotas produit un effet assez particulier.
Le 29 septembre 2026, Tibo a indiqué que l'abonnement Pro à 200 dollars rouvrirait aux nouveaux abonnés le 30 septembre, mais que le nouveau calcul d'usage correspondrait à environ la moitié de la dépense API du précédent Pro à 200 dollars.[1]
C'est un peu comme attendre un feu d'artifice et recevoir d'abord la nouvelle grille tarifaire de l'électricité.
Une précision est essentielle : cela ne signifie pas que tous les modèles auront simplement deux fois moins de messages. La même semaine, OpenAI a annoncé des prix API pour GPT-6 Sol et Luna inférieurs de 50 % aux prix promotionnels de GPT-5.6.[2][3]
Le raisonnement du fournisseur est donc :
réduire l'enveloppe exprimée en dollars d'API, diminuer le coût des modèles et continuer à augmenter la quantité de travail réellement accomplie.
Mathématiquement, c'est possible.
Mais l'utilisateur n'achète pas des « dollars équivalents API ». Il achète du travail terminé.
1. Qu'est-ce qui est réellement divisé par deux ?
Le message de Tibo explique que Pro $200 rouvrira le 30 septembre et que le nouveau mode de calcul représentera environ la moitié de l'API spend de l'ancien forfait.[1]
Il affirme également que la limite de cinq heures ne reviendra pas, que l'enveloppe hebdomadaire pourra être utilisée au moment voulu, que les gains d'efficacité et les baisses de prix seront transmis aux abonnés, et que de nouvelles fonctions ne consommant pas d'usage seront ajoutées.[1]
GPT-6 Sol et Luna, annoncés le 22 septembre, affichent officiellement des prix API inférieurs de 50 % aux prix promotionnels de GPT-5.6.[2] La page tarifaire officielle confirme les prix actuels.[3]
Si l'ancienne enveloppe vaut B et qu'un travail coûte C en équivalent API, le débit est B/C.
Si la nouvelle enveloppe vaut 0,5B et que le même travail coûte désormais 0,5C :
0,5B ÷ 0,5C = B ÷ C
Le débit théorique reste identique.
Mais les tâches réelles d'IA ne sont pas uniformes.
2. L'utilisateur compte les travaux terminés, pas des dollars abstraits
Cent questions courtes ne sont pas équivalentes à une réparation complexe d'un grand dépôt de code.
Contexte long, raisonnement approfondi, appels d'outils, tests, nouvelles tentatives et boucles d'agents peuvent rendre une seule tâche très coûteuse.
La vraie question d'un utilisateur intensif est donc :
combien de gros travaux puis-je encore terminer cette semaine ?
Une métrique pratique ressemble davantage à :
travaux terminés ÷ coût mensuel
Un modèle peut être excellent ; s'il manque de capacité avant la fin, aucun artefact complet n'est produit.
3. « J'ai l'impression d'en avoir cent fois moins qu'avec Opus » n'est pas un benchmark, mais le problème sous-jacent existe
Dans les longs travaux agentiques, les différences entre quotas peuvent sembler énormes.
Un service permet plusieurs tâches longues d'affilée ; un autre peut donner l'impression que le réservoir est presque vide après une seule grosse tâche.
« Cent fois moins » est évidemment une hyperbole, pas une mesure. Tout dépend du plan, du modèle, de la tâche et du contexte.
Mais la vraie question est de savoir si la granularité du travail correspond à la granularité de la limite.
Une tâche de cinq minutes supporte un petit quota.
Un travail de trente minutes, une heure ou plusieurs cycles de correction et de test souffre énormément d'une coupure en plein milieu.
Il faut donc regarder aussi :
- la capacité à finir une tâche ;
- la reprise après échec ;
- le nombre de tâches terminées par semaine ;
- la possibilité de changer de modèle sans reconstruire le système.
4. C'est une fenêtre pour construire des machines, pas seulement pour consommer de l'IA
Personne ne sait si les abonnements actuels deviendront plus chers, moins chers ou simplement différents.
Ce que l'on sait, c'est que les conditions d'utilisation ne sont pas des actifs fixes.
La pire utilisation d'une inférence bon marché consiste à multiplier les conversations utiles dont les résultats restent enfermés dans l'historique.
La meilleure consiste à utiliser l'inférence d'aujourd'hui pour réduire celle de demain :
- automatiser les recherches répétitives ;
- transformer les critères récurrents en règles explicites ;
- convertir les contrôles manuels en tests et évaluateurs ;
- découper les tâches géantes en étapes reprenables ;
- stocker artefacts, preuves et état hors du chat ;
- isoler les différences entre fournisseurs derrière un adaptateur mince ;
- enregistrer les performances réelles de chaque modèle selon le type de tâche.
Le principe :
louer aujourd'hui une IA bon marché pour construire une usine qui continuera à fonctionner lorsque cette IA précise ne sera plus bon marché.
5. Séparer la consommation jetable des actifs durables
| Consommation jetable | Actif durable |
|---|---|
| Réexpliquer le contexte | Conserver spécifications et règles |
| Demander une vérification manuelle | Construire tests et évaluateurs |
| Lancer un énorme prompt | Étapes avec checkpoints |
| Lire la réponse puis passer à autre chose | Stocker artefacts, preuves et état |
| Meilleur modèle pour tout | Modèle économique d'abord, escalade si nécessaire |
| Prompt magique spécifique à un fournisseur | Contrat commun + adaptateur mince |
| Arrêt quand le quota est atteint | Retry, resume et handoff |
FrugalGPT a montré qu'une cascade choisissant différents modèles selon la requête peut, sur les tâches évaluées, approcher le meilleur modèle unique avec un coût nettement inférieur.[4]
Une étude de 2026 sur le routage sensible au coût a également commencé par des modèles plus économiques et n'a escaladé que les cas de qualité insuffisante, conservant 97 à 99 % de la précision du modèle le plus fort dans ses évaluations.[5]
6. Une architecture minimale et portable
Pas besoin d'un grand programme multicloud.
Séparer six composants suffit déjà :
- Contrat de travail — entrées, sorties et définition de terminé sans nom de modèle.
- Adaptateur fournisseur — différences d'API isolées au même endroit.
- État — mémoriser où le travail s'est arrêté.
- Artefacts — code, documents et preuves hors de la conversation.
- Évaluateur — vérifier que « terminé » est réellement terminé.
- Routeur — commencer par le modèle le moins cher qui suffit, puis escalader si nécessaire.
Le Well-Architected Framework de Microsoft recommande lui aussi de réduire les dépendances fortement couplées et de séparer la logique métier des fonctions spécifiques à l'infrastructure.[6]
7. Que faire construire aux modèles puissants tant qu'ils sont bon marché ?
Privilégier ce qui continue à produire de la valeur après la session :
- automatisation de recherche, tests, publication et rapports récurrents ;
- retry, resume, checkpoints, idempotence et déduplication ;
- critères de qualité testables ;
- observation du type de tâche, modèle, réussite, reprises, durée et usage ;
- porte de sortie permettant de changer de fournisseur.
Une hausse de prix devient alors un réglage de routage, pas une reconstruction.
8. Les optimisations qui vieillissent mal
Ne pas faire de « consommer tout le quota » un objectif. L'usage n'est pas un résultat.
Ne pas dépendre de gigantesques tâches monolithiques.
Ne pas accumuler trop de magie de prompt propre à un fournisseur.
Et il n'est pas nécessaire de prédire quelle entreprise augmentera forcément ses prix.
Un système capable de survivre à plusieurs futurs vaut mieux qu'une bonne prédiction.
9. Conclusion — la générosité d'un abonnement est la météo ; le système est la maison
Il est normal d'être agacé lorsque l'économie d'un forfait à 200 dollars change.
Il est aussi normal de constater qu'un autre service permet de terminer beaucoup plus de travail réel.
Mais si la productivité dépend entièrement de la grille tarifaire du jour, chaque annonce fournisseur devient un incident opérationnel.
La stratégie la plus robuste consiste à convertir l'intelligence bon marché d'aujourd'hui en capital durable :
code, tests, évaluateurs, données, automatisation, workflows reprenables et adaptateurs de modèles remplaçables.
Ne supposez pas que le meilleur modèle d'aujourd'hui restera le meilleur.
Ne supposez pas que l'abonnement bon marché d'aujourd'hui restera bon marché.
Construisez maintenant le système qui continuera à fonctionner lorsque la période bon marché sera terminée.
C'est là que se trouve la vraie valeur de cette fenêtre.
Références (6)
- Tibo (@thsottiaux), X post, 2026-09-29, announcing the 2026-09-30 reopening of Pro $200 and the new usage calculation x.com
- OpenAI, “Introducing GPT-6 Sol and Luna”, 2026-09-22 openai.com
- OpenAI API, “Pricing”, checked 2026-09-29 developers.openai.com
- Chen, Lingjiao; Zaharia, Matei; Zou, James, “FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance”, Transactions on Machine Learning Research, 2024 openreview.net
- Moslem, Yasmin et al., “Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving”, arXiv, 2026 arxiv.org
- Microsoft Azure Well-Architected Framework, guidance on reducing tightly coupled dependencies and separating domain logic from infrastructure concerns, checked 2026-09-29 learn.microsoft.com
