Le vrai prix de Claude : notre analyse de 11 modèles, avec 3 prompts et 200 requêtes
Les pensées sont aussi facturées
Le 04 septembre à 15h45
Haiku est le modèle le moins cher d’Anthropic, contrairement à Fable, mais dans quelles proportions ? Où se placent Sonnet et Opus ? Les versions 5 changent-elles la donne ? Next a testé près de 200 combinaisons différentes afin d’apporter un peu de clarté dans l’obscurité de la facturation des IA génératives.
Le vrai prix de Claude : notre analyse de 11 modèles, avec 3 prompts et 200 requêtes
Les pensées sont aussi facturées
Haiku est le modèle le moins cher d’Anthropic, contrairement à Fable, mais dans quelles proportions ? Où se placent Sonnet et Opus ? Les versions 5 changent-elles la donne ? Next a testé près de 200 combinaisons différentes afin d’apporter un peu de clarté dans l’obscurité de la facturation des IA génératives.
Hardware
Hardware
12 min
On entend beaucoup parler de tokens, de raisonnement, de limites et de prix autour des IA génératives. Chez Next, on a décidé de mettre les mains dans le cambouis et de lancer des batteries de tests pour vous donner des chiffres.
Nous commençons cette série d’articles avec Anthropic et son IA générative Claude. Le prochain article sera évidemment consacré à ChatGPT, l’IA générative d’OpenAI. Nous testerons également Gemini de Google par la suite.
Fable, Opus, Sonnet et Haiku face à trois prompts bien différents
Afin d’avoir un décompte précis des capacités de raisonnement utilisées par les modèles (via le nombre de tokens), nous passons par l’API d’Anthropic. Le modèle de facturation est clair : on paye par millions de tokens en entrée (le prompt) ou en sortie (le raisonnement et la réponse).
Ce n’est pas le cas des forfaits Claude : Pro et Max qui incluent des limites d’utilisation aux contours flous. C’est un gloubi-boulga dont les utilisateurs peinent parfois à comprendre le fonctionnement : certains ont parfois l’impression de cramer leur crédit en quelques prompts, que les limites changent régulièrement, etc.
L’API permet d’avoir des chiffres précis, c’est ce qui nous intéresse. Quatre familles de modèles sont disponibles, avec parfois plusieurs versions. Au total, nous avons passé à la moulinette 11 IA génératives d’Anthropic : Haiku 4.5, Sonnet 4.5, 4.6 et 5, Opus 4.5, 4.6, 4.7, 4.8 et 5, et enfin Fable 5 et 5.1.
Haiku est le modèle d’entrée de gamme ; c’est le plus léger pour des « réponses rapides, des résumés et de l’extraction simple ». Sonnet se place au-dessus pour « coder, écrire, analyser et des flux de travail en plusieurs étapes ». Les modèles sont présentés par ici.

Opus est plus lourd, pour de la « recherche approfondie et du raisonnement complexe qui nécessitent véritablement une réflexion soutenue ». Enfin, Fable est le modèle le plus lourd et le plus cher, pour « les projets les plus importants et les plus critiques : des tâches longues et complexes ».
Les modèles ont des paramètres pour définir des niveaux de raisonnement, généralement avec cinq paliers de low à max (nous expliquons un peu plus le protocole en fin d’article). Combiné aux onze modèles, cela donne plus de 60 possibilités. Avec trois prompts à chaque fois, cela donne près de 200 combinaisons au total.
Voici les prompts et, en gras, le petit nom que nous leur avons attribué pour les identifier facilement :
Devinette : « Ô frère, fils de ma mère, ton père est le frère de mon enfant. Qui suis-je ? »
Carnet de voyage : « L’été prochain je vais avoir trois semaines de vacances. Je suis avec ma petite voiture électrique Sprind (charge à 30 kW max) et je voudrais visiter le sud de Bayonne a Montpellier en prenant mon temps. Propose moi un carnet de voyage »
Extension : « Je veux une extension pour Chrome et Firefox qui me permet d’inverser les titres et les sous titres sur le site d’actualité Next.ink. S’il n’y a pas de sous-titre, c’est que c’est un brief. Alors fais en sorte d’un inventer un à partir du titre du brief. L’extension doit avoir un sélecteur pour activer/désactiver l’inversion en direct sur la page »
De 1,3 centime en moyenne sur Haiku à 60 centimes sur Fable
Un premier résultat brut, avec la moyenne d’une requête suivant les modèles. Haiku est de loin le moins cher avec seulement 1,3 centime en moyenne. Sonnet passe à 15 centimes, Opus à 20 centimes et Fable monte à 60 centimes.

Une autre manière de voir les choses : Sonnet est en moyenne 11 fois plus cher que Haiku. Passer de Sonnet à Opus fait grimper la facture de 40 %. Enfin, Fable coûte trois fois plus cher qu’Opus. Au final, le rapport entre Haiku et Fable est presque de x50 !
Voici les moyennes des dernières versions de chaque modèle :
- Haiku 4.5 : 1,3 centime
- Sonnet 5 : 19,3 centimes
- Opus 5 : 27,8 centimes
- Fable 5.1 : 92,1 centimes
L’écart entre Haiku et Fable est encore plus important : près de 100 fois ! On voit également que les dernières versions des modèles coûtent en moyenne plus chères, mais nous y reviendrons un peu plus tard dans cette actualité.
Passons maintenant à toutes les données détaillées. Pour commencer, voici toutes les réponses des différents modèles, avec le nombre de tokens en entrée, ceux utilisés pendant le raisonnement et enfin ceux en sortie.
Il reste 68% de l'article à découvrir.
Déjà abonné ou lecteur ? Se connecter
Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.
Accédez en illimité aux articles
Profitez d'un média expert et unique
Intégrez la communauté et prenez part aux débats
Partagez des articles premium à vos contacts
expert et sans pub.
Commentaires (10)
Aujourd'hui à 16h07
Aujourd'hui à 16h24
Certes, c'est compliqué à estimer, mais si par exemple l'extension ne fonctionne pas après mon prompt j'ai perdu quelques centimes + mon temps.
Si je dois le reprompter une 20aine de fois en + avec Haïku alors que c'est du one-shot avec Sonnet, c'est ce coût là qu'il faudrait prendre en compte, non ?
Aujourd'hui à 16h28
Quand au carnet de voyage, ca serait presque impossible à comparer, il n’y a pas de bonne ou de mauvaise
situationréponse.Aujourd'hui à 16h41
Modifié aujourd'hui à 16h39
E pourquoi ne pas tester mistral AI aussi?
Aujourd'hui à 16h43
Aujourd'hui à 16h43
Modifié aujourd'hui à 16h50
Merci pour cet article, qui représente bcp de travail !
Vous expliquez bien les situations où le budget est parti en raisonnement et aucune réponse n'a donc été fournie.
Mais quid de la qualité des réponses lorsqu'elle est fournie ?
Je ne crois pas qu'une analyse des coûts veuille vraiment dire quelque chose si on ne sait pas combien de fois il a fallu lancer la requête pour avoir la bonne réponse ou même si on l'a eu tout court.
Est-ce qu'il vaut mieux dépenser moins et ne pas avoir la bonne réponse ? Lancer 2x une requête sur Sonnet coûte plus cher (en moyenne d'après vos données) qu'une seule sur Opus donc à quelle fréquence Opus nous evitera-t-il de lancer 2x Sonnet?
C'est encore plus de boulot mais je pense que c'est essentiel à intégrer.
Aujourd'hui à 17h05
Pour l’extension non plus d’ailleurs, le LLM peut proposer plus ou moins de fonctions, plus ou moins de ss titre dans sa base de données pour les briefs, etc. Donc même tester ça fonctionne oui/non n’est pas forcément suffisant.
Modifié à l'instant
Et donc à hauteur de combien Next le finance dans son usage de Claude ?
Signaler un commentaire
Voulez-vous vraiment signaler ce commentaire ?