Pourquoi le meilleur modèle d’IA plafonne à 11% de la dépense
Claude Fable 5, le modèle le plus performant du marché, ne capte que 11% de ce que les entreprises dépensent chez Anthropic, d’après les données de la fintech Ramp sur 70 000 entreprises. Deux explications possibles : le prix, environ le double du concurrent le plus proche, ou l’enjeu, quand l’IA ne traite encore que des tâches où l’erreur coûte peu et où un modèle moins cher suffit. Les deux lectures n’appellent pas le même budget 2027. Dix semaines de mesure ne tranchent pas entre elles, mais suffisent à piloter.
Si vous arbitrez un budget IA pour 2027, un même chiffre peut fonder deux stratégies opposées. Le 12 août, la fintech américaine Ramp a publié la première mesure d'usage de Claude Fable 5, le modèle le plus performant du marché, chez Anthropic : 6% des tokens, 11,4% des dollars, un mois après le lancement. Le 23 août, le Financial Times prolonge la même série Ramp, mesurée sur 70 000 entreprises : la part plafonne autour de 11%, et Claude Opus 5, moins cher, sorti fin juillet, l'a déjà dépassé en dépense. Miles Clements, associé chez Accel, y voit la fin de l'ère où l'on achetait d'abord la frontière, le sommet de gamme du moment.
Première lecture : un plafond de prix. Fable 5 coûte environ deux fois le tarif de GPT-5.6 Sol d'OpenAI, presque aussi performant. Le mécanisme s'appelle le routage : envoyer chaque requête vers le modèle le moins cher capable de la traiter. Il transforme le modèle en composant interchangeable et déplace la négociation vers celui qui tient le routeur.
Deuxième lecture : un plafond d'enjeu. La faible part de Fable 5 mesurerait alors autre chose que le prix : les entreprises confient surtout à l'IA des tâches où l'erreur coûte peu, et là un modèle moins cher suffit. Router au moins cher a un coût chiffré. Le 11 août, LangChain a testé le routeur de NVIDIA sur 145 tâches en plusieurs étapes : en n'envoyant que 7% des appels vers le modèle de frontière, la facture baisse de 74% et le taux de réussite passe de 86% à 80%. L'écart s'amplifie en chaîne : quatre étapes à 80% chacune aboutissent ensemble quatre fois sur dix.
Cela suffit pourtant à piloter. La dépense totale monte quand les prix unitaires baissent : la facture se joue au volume d'appels. La fiabilité se finance là où la marque ou l'argent sont engagés. Avant toute bascule, le nouveau modèle tourne en parallèle de l'ancien pour mesurer l'écart.
Reste l'inconnue : le chiffre de l'an prochain dira laquelle des deux lectures tient.
Sources
- Ramp Economics Lab (Ara Kharazian), AI Index, édition d'août 2026, 12 août 2026. Part de Fable 5 chez Anthropic (6% des tokens, 11,4% des dollars un mois après le lancement), prix d'environ le double de GPT-5.6 Sol, dépense IA totale en hausse malgré la baisse des prix unitaires. lien
- Financial Times (George Hammond), 23 août 2026, données Ramp mesurées sur 70 000 entreprises. Part stabilisée autour de 11%, Claude Opus 5 passé devant Fable 5 en dépense, citation de Miles Clements (Accel, près d'un milliard de dollars investi dans Anthropic). Article payant. lien
- PYMNTS, « Anthropic Customers Switch to Cheaper Models Ahead of IPO », 23 août 2026. Reprise concordante des chiffres et citations de l'article du FT. lien
- LangChain, « How many of your agent's calls actually need a frontier model? », 11 août 2026. Banc Deep Agents : 145 tâches en plusieurs étapes, 7% des appels routés vers le modèle de frontière, coût en baisse de 74%, taux de réussite de 86% à 80%. Mesure publiée par l'éditeur, sans audit indépendant. lien
- NVIDIA Technical Blog, « Route AI Agents Across Models with NVIDIA NeMo Switchyard », 11 août 2026. Lancement du routeur testé par LangChain. lien
