La fatigue des modèles d'IA, c'est ce que ressentent les acheteurs en entreprise quand le modèle qu'ils évaluent change avant que les achats aient signé. Dans la première semaine de septembre 2026, Anthropic, Meta, Google et OpenAI ont sorti Claude Fable 5.1, Muse Spark 1.3, Gemini 3.8 Flash et GPT-6 Astra en trois jours, et CNBC a rapporté des dirigeants qui décrivaient exactement ça. Le remède que nous appliquons avec nos clients : arrêter de chercher le modèle gagnant. Figer le workflow et faire passer chaque sortie par un même jeu de tests réutilisable qui mesure la qualité, le taux d'intervention, la vitesse, la sécurité et le coût. Le tableau comparatif, le jeu de tests et les questions à poser à chaque éditeur sont ci-dessous.
Le deck qui a expiré jeudi
Vous avez passé le mois d'août sur un comparatif de modèles. Capacités, tarifs, sécurité, une matrice notée. Le juridique avait son onglet. Il est passé en comité de pilotage le lundi 1er septembre.
Le jeudi, trois lignes étaient périmées et une quatrième venait d'apparaître en préversion. Anthropic a livré le lundi. Meta et Google le mardi. OpenAI le mercredi, avec un accès pour les abonnés payants le lendemain. La personne qui a construit le deck est en train de le reconstruire, et le comité est passé à une question à laquelle personne dans la salle ne sait répondre : lequel on prend ?
Si ce sont vos deux dernières semaines, vous êtes dans l'article de CNBC.
Qu'est-ce que la fatigue des modèles d'IA ?
La fatigue des modèles d'IA (« model fatigue » en anglais), c'est l'épuisement que rapportent les acheteurs en entreprise quand les laboratoires d'IA sortent des mises à jour majeures plus vite qu'une entreprise ne peut les évaluer, les chiffrer et les valider. CNBC l'a nommée le 6 septembre 2026, après qu'Anthropic, Meta, Google et OpenAI ont tous livré un nouveau modèle la même semaine (CNBC, « 'Model fatigue' sets in as AI labs race to roll out new versions at frenetic pace »). Le symptôme : des DSI et des équipes finance qui passent une part démesurée de leur temps à comparer coûts et capacités entre deux sorties, et qui voient le comparatif expirer avant d'être terminé.
Deux citations de l'article méritent d'être gardées. Zhen Lu, PDG du fournisseur de cloud IA Runpod, a déclaré à CNBC : « I feel like model fatigue is a real thing. » Il a ajouté : « We are in an environment where there's just so much frothiness that you have to make noise. » Sam Altman, PDG d'OpenAI, a dit à CNBC que « we're all moving to faster cadences », en attribuant une partie du calendrier au retour de vacances de tout le monde.
CNBC lit ce rythme comme une course à la part de portefeuille entre des laboratoires qui visent la Bourse, chacun déjà valorisé près de mille milliards de dollars par des investisseurs privés. L'article note aussi que plus de 1 100 employés de ces laboratoires ont demandé à Washington d'aider à réguler la cadence. Les gens qui construisent les modèles sont fatigués eux aussi.
Les laboratoires construisent pour la prochaine sortie. Votre processus d'achat achète pour les trois prochaines années. Ces deux horloges ne s'accordent pas, et le deck est l'endroit où elles se percutent.
Ce qui est sorti en une semaine, et ce que ça coûte
Voici la semaine, plus les deux noms que CNBC ne cite pas et que votre service achats citera : Microsoft Copilot et Mistral. Les prix catalogue sont par million de tokens, tels que publiés le 8 septembre 2026, relevés sur les pages des éditeurs et les comparateurs qui les reprennent. Les prix par siège sont à part, plus bas.
| Modèle | Éditeur | Sortie | Prix catalogue (entrée / sortie par million de tokens) | Contexte | Où une entreprise l'obtient |
|---|---|---|---|---|---|
| Claude Fable 5.1 (Mythos 5.1 en dessous) | Anthropic | 1er sept. 2026 | 10 $ / 50 $. Lectures de cache passées de 1,00 $ à 0,25 $ | 1M | Applications Claude et API. Mythos 5.1 est réservé à des organisations vérifiées en cybersécurité et sciences de la vie (annonce d'Anthropic) |
| Muse Spark 1.3 | Meta | 2 sept. 2026 | 1,25 $ / 4,25 $ | 1M (1 048 576 tokens) | API dès maintenant, déploiement en cours sur Meta AI, Instagram et Facebook (Meta AI Research) |
| Gemini 3.8 Flash | 2 sept. 2026 | 0,75 $ / 3,75 $ jusqu'au 31 décembre 2026, puis 1,50 $ / 7,50 $ à partir du 1er janvier 2027 | 1M en entrée, 64K en sortie | API Gemini et Vertex AI. Troisième Flash en six semaines (Artificial Analysis, Enterprise DNA) | |
| GPT-6 Astra | OpenAI | 3 sept. 2026 en préversion, 4 sept. pour les offres payantes | 10 $ / 50 $. Lectures de cache à 1,00 $. Mode rapide environ 2,5 fois plus vite pour à peu près le double du prix | 1M | ChatGPT Plus, Pro, Business et Enterprise (désactivé par défaut sur Business et Enterprise tant qu'un admin ne l'active pas), API, AWS, GitHub Copilot, Microsoft Copilot en cours de déploiement (CNBC, fiche modèle OpenAI) |
| Microsoft 365 Copilot | Microsoft | GPT-5.6 est devenu le modèle préféré en juillet 2026. GPT-6 Astra arrive dans Copilot Cowork et Copilot Studio | Au siège, pas au token : 30 $ par utilisateur et par mois en option entreprise. Offre Business à 21 $ catalogue, 18 $ en promotion jusqu'au 30 septembre 2026 | Dépend du modèle vers lequel Microsoft route | Centre d'administration Microsoft 365. Le modèle est le choix de Microsoft, le siège est le vôtre (OpenAI, Microsoft) |
| Mistral Large 3 et Medium 3.5 | Mistral | Large 3 en décembre 2025, Medium 3.5 en avril 2026. Septembre 2026 a apporté Agentic Search, des points d'inférence régionaux et un Priority Tier | Large 3 : 0,50 $ / 1,50 $. Medium 3.5 : 1,50 $ / 7,50 $ | 256K | API, Le Chat, poids ouverts sous Apache 2.0 pour Large 3, auto-hébergement, inférence en Europe ou aux États-Unis (tarifs Mistral, inférence régionale Mistral) |
Lisez le tableau pour ce qu'il fait à un comparatif construit en août. Deux modèles phares portent désormais la même étiquette, donc l'argument prix entre Astra et Fable 5.1 vit dans la colonne cache, où l'un coûte quatre fois moins cher que l'autre. Anthropic estime que cela rend les charges de travail typiques environ 25 % moins chères et le travail très agentique environ 45 % moins cher sur 5.1 que sur Fable 5, à prix catalogue inchangé. Un coût total de possession bâti sur le tarif actuel de Gemini 3.8 Flash est faux dès janvier, quand il double. Et la ligne Copilot ne contient aucun modèle, parce que Microsoft a changé de modèle préféré en juillet et change encore maintenant.
Nous avons creusé l'économie des sièges Astra et Fable 5.1 dans le guide de migration de Claude vers ChatGPT, et ce qu'Astra change vraiment pour les équipes non techniques dans GPT-6 Astra au travail.
Pourquoi l'exercice annuel « on choisit le modèle de l'entreprise » ne tient plus
Un cycle d'achat en entreprise dure de trois à neuf mois. Revue juridique, questionnaire sécurité, analyse d'impact RGPD, un pilote, une ligne budgétaire. Dans cette fenêtre, le modèle avec lequel vous avez commencé a été remplacé au moins une fois. Gemini 3.8 Flash était le troisième Flash de Google en six semaines. GPT-6 Astra a remplacé GPT-5.6 Sol en haut de la gamme OpenAI environ deux mois après l'arrivée de Sol dans Copilot comme « modèle préféré ». Anthropic a changé son prix de cache sans toucher au prix catalogue, donc un comparatif sur les tarifs affichés passe à côté de toute l'histoire.
L'exercice échoue donc sur trois points, et c'est notre lecture plutôt qu'une étude publiée :
- Le gagnant change avant la signature du contrat. Ce que vous validez au T3 a une génération de retard au T1.
- Le comparatif compare les mauvaises choses. Des benchmarks publiés par l'éditeur, sur des tâches qui ne sont pas les vôtres, sur une version que vous n'aurez peut-être pas. Le matériel de lancement de Meta pour Muse Spark 1.3 s'appuie sur les résultats d'une variante que les développeurs ne peuvent pas encore largement utiliser, comme l'a rapporté VentureBeat.
- Il répond à une question que personne n'a posée. Le conseil d'administration n'a pas demandé quel modèle est le meilleur. Il a demandé si les sièges ont changé quelque chose au temps de cycle. Un choix de modèle ne peut pas répondre à ça. Un workflow mesuré, si.
Le rapport Adoption Decade de la CBI, publié en août 2026 avec Oliver Wyman, montre que les entreprises en tête sur le déploiement de l'IA atteignent ou dépassent le retour attendu dans 49 % des cas, contre 15 % pour les retardataires, souvent avec les mêmes logiciels. Nous l'avons décortiqué dans notre analyse du fossé d'exécution. Mêmes modèles, mêmes éditeurs, même grille tarifaire. L'écart tient à la façon dont le travail a été redessiné, et aucun comparatif de modèles ne le comble.
Avant le prochain comparatif de modèles, vérifiez si vos équipes ont dépassé « résume-moi ça » sur celui qu'elles ont déjà.
Passer le diagnostic de maturité IA gratuit →Réserver 20 minutesHuit minutes, cinq dimensions, un rapport noté. Agnostique en outils, donc personne à l'appel ne vous vend un logo.
Ce que nous faisons à la place : figer le workflow, laisser les modèles se battre en dessous
Voici comment une mission We Call Shotgun traverse une semaine comme celle-là. La première décision, c'est le workflow. Le modèle vient en dernier.
Avec une équipe cliente, nous choisissons un travail qui se répète et qui fait mal : le pack mensuel du conseil, l'onboarding fournisseurs, les réponses aux appels d'offres, la revue hebdomadaire du pipeline. Nous le mesurons tel qu'il est aujourd'hui. Temps de cycle du déclencheur à la livraison, combien de mains le touchent, où il cale. C'est la référence, et elle ne bouge pas quand un laboratoire livre.
Puis nous construisons un jeu de tests à partir de ce workflow. Vingt à trente cas réels, anonymisés quand il le faut, avec les vraies entrées et la sortie que le responsable aurait acceptée. Chaque nouveau modèle passe par le même jeu. Astra le jeudi, Fable 5.1 le lundi, ce qui sortira le mois prochain. Le deck est remplacé par un tableau de scores, et le tableau survit au cycle des sorties parce que les cas ne bougent pas.
Le jeu note cinq choses. Chacune est un chiffre qu'un directeur financier peut lire.
| Dimension | Ce que nous mesurons | Pourquoi le benchmark de l'éditeur ne le couvre pas |
|---|---|---|
| Qualité | La personne responsable de la sortie note chaque cas contre une grille courte qu'elle a écrite. Validé, à corriger, à refaire. | SWE-bench ne sait pas ce que votre comité de crédit accepte. |
| Taux d'intervention | Combien de fois un humain a dû intervenir par cas pour arriver à un résultat acceptable. Les questions de clarification comptent, les corrections aussi. | Un modèle qui pose plus de questions peut être plus sûr et plus lent à la fois. Astra en pose davantage, de l'aveu même d'OpenAI. Muse Spark 1.3 revendique moins d'appels d'outils. Les deux se testent sur vos cas, et seulement là. |
| Vitesse | Temps réel du brief au brouillon utilisable, reprises comprises. | Les tokens par seconde ne disent rien d'une tâche qui demande trois passes. |
| Sécurité | Conditions de rétention, disponibilité de la rétention zéro, lieu d'inférence, contrôles d'administration, ce qui est désactivé par défaut. | Trois éditeurs proposent la « rétention zéro » par trois mécanismes différents, et l'un d'eux échoue en position ouverte. Nous les avons cartographiés dans le comparatif de la rétention zéro. |
| Coût | Coût par cas terminé, reprises et contexte en cache compris, sur la forme de siège ou d'API que vous achèteriez vraiment. | Le prix catalogue est une entrée parmi d'autres. Des lectures de cache à 0,25 $ contre 1,00 $ changent la réponse pour tout workflow qui réutilise un long document, c'est-à-dire la plupart. |
La cinquième ligne est celle que la plupart des decks ratent. Le coût par cas terminé sur votre workflow, c'est le chiffre. Le prix par million de tokens et le prix par siège en sont des composantes. Nous avons documenté comment sortir ce chiffre des factures de quatre éditeurs dans le guide de visibilité des dépenses IA.
Une fois le jeu en place, une nouvelle sortie coûte un après-midi à évaluer au lieu d'un trimestre. C'est tout le remède à la fatigue des modèles. Les sorties ne ralentissent pas. Votre réponse, si.
Où chaque modèle de septembre mérite une place dans le jeu de tests
Ceci est une opinion, tirée du jeu de tests mené avec des équipes clientes et de la documentation de chaque éditeur. Ce n'est pas un classement, et nous n'avons pas mené de comparaison contrôlée des six modèles sur une même charge de travail.
| Modèle | Où il tend à gagner sa place | À vérifier avant de la lui donner |
|---|---|---|
| GPT-6 Astra | Le travail long et multi-sources : réconcilier un budget, une note de décision à partir d'une pile de documents, l'usage de l'ordinateur. | Désactivé par défaut sur Business et Enterprise. Les sièges standard ont un plafond mensuel de messages. Les lectures de cache coûtent quatre fois celles de Fable 5.1, ce qui compte quand le même contrat de 200 pages entre à chaque passage. |
| Claude Fable 5.1 | Les exécutions agentiques sur plusieurs jours, les changements sur une base de code entière, l'analyse à enjeux. Même étiquette qu'Astra, moins cher sur le contexte répété. | Fable 5 est sorti avec une rétention obligatoire de 30 jours sur les prompts et les sorties (notre guide Fable 5). Confirmez ce que 5.1 a changé pour votre catégorie de données avant que le juridique ne lise le mot Mythos. |
| Gemini 3.8 Flash | Le volume, le travail sensible au coût, les entrées mixtes : PDF, audio, vidéo, longues transcriptions. | Quel Flash vous utilisez vraiment, vu qu'il y en a eu trois en six semaines. Et la marche tarifaire du 1er janvier 2027, qui double les deux tarifs. |
| Microsoft 365 Copilot | Les équipes qui vivent dans Word, Excel, Outlook et Teams et veulent le modèle dans le document plutôt que dans un onglet à part. | Vous ne choisissez pas le modèle. Vérifiez lequel est « préféré » ce trimestre et si Astra est activé dans votre tenant. Notre article sur Copilot dans la banque montre ce que ça donne en environnement régulé. |
| Mistral Large 3 et Medium 3.5 | La résidence des données en Europe, les poids ouverts, l'auto-hébergement, et les charges sensibles au prix où un modèle ouvert de 675 milliards de paramètres suffit. | La parité de fonctionnalités sur le point d'inférence régional que vous déploierez vraiment, et le prix du Priority Tier une fois sorti de préversion. |
| Muse Spark 1.3 | Les tâches agentiques et de code à prix intermédiaire, avec un long contexte. | Ce que vous pouvez réellement appeler. Les meilleurs résultats publiés viennent d'une variante qui n'est pas encore largement accessible aux développeurs. |
Chaque ligne est une hypothèse à faire passer par votre jeu de tests. Le test coûte un après-midi et règle des débats qui, sinon, durent un trimestre.
L'autre fatigue de l'IA : celle que vos équipes ressentent
La fatigue des modèles, c'est la version de l'acheteur. Il existe une version côté salariés, et elle est plus ancienne.
Vos équipes ont eu un nouveau modèle dans le sélecteur ce mois-ci. Le trimestre dernier, un nouvel outil. Avant ça, un e-learning obligatoire sur le prompt. Ce qu'elles n'ont jamais eu, à aucun moment, c'est quelqu'un assis à côté d'elles pendant que le vrai travail du mardi changeait de forme. Le sélecteur de modèles est donc un menu de choses qu'on leur a dites puissantes et qu'on ne leur a jamais montrées sur le rapport à rendre vendredi.
Ça se voit de trois façons que nous constatons sans arrêt. L'usage plafonne à « résume-moi ça ». Les gens font confiance à une réponse assurée qui va dans leur sens, ce que nous avons traité dans l'article sur la sycophancie. Et le brief ne passe jamais du prompt à la délégation, le basculement que nous décrivons dans du prompt à la délégation de tâches. Un nouveau modèle ne change rien à ça. Il ajoute une ligne au sélecteur.
L'approche par le workflow soigne les deux fatigues d'un coup, et c'est la raison pour laquelle nous nous en donnons la peine. L'acheteur arrête de reconstruire le deck. L'équipe obtient un workflow qui est allé mesurablement plus vite, sur le modèle qui a gagné le test, et une raison d'ouvrir l'outil mercredi.
Mettez un chiffre sur le workflow avant de mettre un modèle dessus.
Lancer le calculateur de ROI IA →Voir comment nous travaillons avec les grandes entreprisesCinq entrées, des données publiques britanniques, une fourchette du prudent à l'optimiste. Sans e-mail. Apportez le résultat en comité de pilotage à la place du deck.
Quoi faire cette semaine
Trois choses, dans l'ordre où nous les faisons.
D'abord, mettre le deck comparatif en pause et garder l'évaluation en marche. Ce qu'il contient est la photo d'une semaine déjà terminée.
Ensuite, choisir un workflow et le mesurer tel qu'il est. Temps de cycle, mains, blocages. Écrire les vingt cas. Si vous avez une charte IA, vérifiez qu'elle désigne le responsable du workflow comme la personne qui note la qualité. Si vous n'en avez pas, voici comment en rédiger une avec un générateur gratuit.
Enfin, faire passer les modèles de septembre par le jeu de tests et garder le tableau de scores. Quand la prochaine sortie arrivera, et elle arrivera avant la fin de votre cycle d'achat, le test coûtera un après-midi. C'est la différence entre une équipe fatiguée et une équipe prête.
L'outil n'a jamais été le problème. Personne ne leur a appris à conduire.
Questions fréquentes
Qu'est-ce que la fatigue des modèles d'IA ?
La fatigue des modèles d'IA (« model fatigue »), c'est l'épuisement que rapportent les acheteurs en entreprise quand les laboratoires d'IA sortent des modèles majeurs plus vite qu'une entreprise ne peut les évaluer, les chiffrer et les valider. CNBC l'a nommée le 6 septembre 2026, après qu'Anthropic, Meta, Google et OpenAI ont sorti Claude Fable 5.1, Muse Spark 1.3, Gemini 3.8 Flash et GPT-6 Astra la même semaine. Zhen Lu, PDG de Runpod, a déclaré à CNBC : « I feel like model fatigue is a real thing. » Le symptôme concret : des équipes IT et finance qui passent un temps démesuré sur des comparatifs de modèles périmés avant d'être terminés.
Quels modèles d'IA sont sortis la première semaine de septembre 2026 ?
Anthropic a sorti Claude Fable 5.1 et Mythos 5.1 le 1er septembre. Meta a sorti Muse Spark 1.3 et Google Gemini 3.8 Flash le 2 septembre. OpenAI a annoncé GPT-6 Astra le 3 septembre en préversion limitée et l'a ouvert aux offres ChatGPT payantes le 4 septembre. GPT-6 Astra est aussi devenu disponible dans GitHub Copilot le 4 septembre et a commencé à arriver dans Microsoft Copilot Cowork et Copilot Studio la même semaine.
Notre entreprise doit-elle standardiser sur un seul modèle d'IA ?
D'après notre expérience, non. Standardisez sur le workflow et la méthode d'évaluation, et laissez les modèles se battre en dessous. Un modèle choisi au T3 a une génération de retard au T1, et un cycle d'achat de trois à neuf mois ne peut pas suivre des laboratoires qui livrent toutes les quelques semaines. Ce qui peut rester stable, c'est un workflow mesuré avec une référence et un jeu de tests réutilisable de cas réels, pour qu'un nouveau modèle soit noté en un après-midi au lieu de déclencher un nouveau comparatif d'éditeurs.
Comment GPT-6 Astra, Claude Fable 5.1 et Gemini 3.8 Flash se comparent-ils sur le prix ?
Sur l'API, GPT-6 Astra et Claude Fable 5.1 affichent tous deux 10 $ par million de tokens en entrée et 50 $ en sortie. La différence est dans les lectures de cache : 1,00 $ sur Astra contre 0,25 $ sur Fable 5.1, ce qui, selon Anthropic, rend les charges typiques environ 25 % moins chères. Gemini 3.8 Flash affiche 0,75 $ en entrée et 3,75 $ en sortie jusqu'au 31 décembre 2026, puis 1,50 $ et 7,50 $ à partir du 1er janvier 2027. Muse Spark 1.3 affiche 1,25 $ et 4,25 $. Mistral Large 3 affiche 0,50 $ et 1,50 $. Prix publiés au 8 septembre 2026.
Que doit contenir une évaluation de modèles d'IA en entreprise ?
Un jeu de tests réutilisable construit à partir d'un vrai workflow, avec vingt à trente cas réels et la sortie que le responsable accepterait. Notez chaque modèle sur cinq dimensions : la qualité, jugée par la personne responsable de la sortie ; le taux d'intervention, c'est-à-dire combien de fois un humain a dû intervenir ; la vitesse du brief au brouillon utilisable, reprises comprises ; la sécurité, avec les conditions de rétention, la rétention zéro, le lieu d'inférence et les réglages par défaut ; et le coût par cas terminé plutôt que le prix catalogue. Chaque nouvelle sortie passe par le même jeu, donc le comparatif survit au cycle des sorties.
Quel modèle utilise Microsoft 365 Copilot ?
C'est Microsoft qui décide, et ça change. GPT-5.6 d'OpenAI est devenu le modèle préféré de Microsoft 365 Copilot en juillet 2026, dans Word, Excel, PowerPoint, Chat et Cowork. En septembre 2026, Microsoft a commencé à déployer GPT-6 Astra dans Copilot Cowork et Copilot Studio, avec une disponibilité gérée par les administrateurs dans le centre d'administration Microsoft 365. Vous achetez le siège, à 30 $ par utilisateur et par mois en option entreprise, et Microsoft route vers le modèle. C'est pour ça qu'un deck comparatif n'a pas de ligne Copilot stable.
Quelle est la différence entre Claude Fable 5.1 et Claude Mythos 5.1 ?
C'est le même modèle sous-jacent. Fable 5.1 est la version disponible pour tous, avec les garde-fous de production d'Anthropic. Mythos 5.1 est accessible par des programmes à accès restreint pour des organisations vérifiées en cybersécurité et en sciences de la vie qui ont besoin de capacités normalement limitées par ces garde-fous. Les deux sont sortis le 1er septembre 2026 avec une fenêtre de contexte d'un million de tokens. Pour la plupart des entreprises, Fable 5.1 est celui qui figure sur la grille tarifaire.
En quoi la fatigue des modèles diffère-t-elle de la fatigue de l'IA chez les salariés ?
La fatigue des modèles est le problème de l'acheteur : trop de sorties à comparer. La fatigue de l'IA chez les salariés, c'est ce que ressentent les équipes quand de nouveaux outils et modèles arrivent sans que personne ne leur montre comment leur travail réel change. Les symptômes : un usage bloqué à « résume-moi ça », une confiance excessive dans les réponses complaisantes et des briefs qui ne dépassent jamais le stade du prompt. Les deux se traitent par le même geste : figer un workflow, le mesurer, et laisser le choix du modèle suivre la mesure.
Sources et lectures complémentaires
- CNBC, « 'Model fatigue' sets in as AI labs race to roll out new versions at frenetic pace », 6 septembre 2026
- CNBC, OpenAI announces rollout of GPT-6 Astra, 3 septembre 2026
- Anthropic, Introducing Claude Fable 5.1 and Claude Mythos 5.1, 1er septembre 2026
- Meta AI Research, Introducing Muse Spark 1.3, 2 septembre 2026, et la couverture de VentureBeat sur la réserve de disponibilité
- Artificial Analysis, Gemini 3.8 Flash release intelligence, et Enterprise DNA sur le gel des prix
- OpenAI, documentation du modèle GPT-6 Astra et GPT-5.6 modèle préféré de Microsoft 365 Copilot
- Microsoft, GPT-6 Astra dans Microsoft Copilot, et GitHub, GPT-6 Astra disponible dans GitHub Copilot
- Mistral, Introducing Agentic Search, inférence régionale et nouveau calcul européen, et tarifs
- CBI et Oliver Wyman, The Adoption Decade: Closing the Execution Divide, août 2026, via notre analyse