Connexion Premium

Le vrai prix de Claude : notre analyse de 11 modèles, avec 3 prompts et 200 requêtes

Les pensées sont aussi facturées

Le vrai prix de Claude : notre analyse de 11 modèles, avec 3 prompts et 200 requêtes

Haiku est le modèle le moins cher d’Anthropic, contrairement à Fable, mais dans quelles proportions ? Où se placent Sonnet et Opus ? Les versions 5 changent-elles la donne ? Next a testé près de 200 combinaisons différentes afin d’apporter un peu de clarté dans l’obscurité de la facturation des IA génératives.

On entend beaucoup parler de tokens, de raisonnement, de limites et de prix autour des IA génératives. Chez Next, on a décidé de mettre les mains dans le cambouis et de lancer des batteries de tests pour vous donner des chiffres.

Nous commençons cette série d’articles avec Anthropic et son IA générative Claude. Le prochain article sera évidemment consacré à ChatGPT, l’IA générative d’OpenAI. Nous testerons également Gemini de Google par la suite.

Fable, Opus, Sonnet et Haiku face à trois prompts bien différents

Afin d’avoir un décompte précis des capacités de raisonnement utilisées par les modèles (via le nombre de tokens), nous passons par l’API d’Anthropic. Le modèle de facturation est clair : on paye par millions de tokens en entrée (le prompt) ou en sortie (le raisonnement et la réponse).

Ce n’est pas le cas des forfaits Claude : Pro et Max qui incluent des limites d’utilisation aux contours flous. C’est un gloubi-boulga dont les utilisateurs peinent parfois à comprendre le fonctionnement : certains ont parfois l’impression de cramer leur crédit en quelques prompts, que les limites changent régulièrement, etc.

L’API permet d’avoir des chiffres précis, c’est ce qui nous intéresse. Quatre familles de modèles sont disponibles, avec parfois plusieurs versions. Au total, nous avons passé à la moulinette 11 IA génératives d’Anthropic : Haiku 4.5, Sonnet 4.5, 4.6 et 5, Opus 4.5, 4.6, 4.7, 4.8 et 5, et enfin Fable 5 et 5.1.

Haiku est le modèle d’entrée de gamme ; c’est le plus léger pour des « réponses rapides, des résumés et de l’extraction simple ». Sonnet se place au-dessus pour « coder, écrire, analyser et des flux de travail en plusieurs étapes ». Les modèles sont présentés par ici.

Opus est plus lourd, pour de la « recherche approfondie et du raisonnement complexe qui nécessitent véritablement une réflexion soutenue ». Enfin, Fable est le modèle le plus lourd et le plus cher, pour « les projets les plus importants et les plus critiques : des tâches longues et complexes ».

Les modèles ont des paramètres pour définir des niveaux de raisonnement, généralement avec cinq paliers de low à max (nous expliquons un peu plus le protocole en fin d’article). Combiné aux onze modèles, cela donne plus de 60 possibilités. Avec trois prompts à chaque fois, cela donne près de 200 combinaisons au total.

Voici les prompts et, en gras, le petit nom que nous leur avons attribué pour les identifier facilement :

Devinette : « Ô frère, fils de ma mère, ton père est le frère de mon enfant. Qui suis-je ? »

Carnet de voyage : « L’été prochain je vais avoir trois semaines de vacances. Je suis avec ma petite voiture électrique Sprind (charge à 30 kW max) et je voudrais visiter le sud de Bayonne a Montpellier en prenant mon temps. Propose moi un carnet de voyage »

Extension : « Je veux une extension pour Chrome et Firefox qui me permet d’inverser les titres et les sous titres sur le site d’actualité Next.ink. S’il n’y a pas de sous-titre, c’est que c’est un brief. Alors fais en sorte d’un inventer un à partir du titre du brief. L’extension doit avoir un sélecteur pour activer/désactiver l’inversion en direct sur la page »

De 1,3 centime en moyenne sur Haiku à 60 centimes sur Fable

Un premier résultat brut, avec la moyenne d’une requête suivant les modèles. Haiku est de loin le moins cher avec seulement 1,3 centime en moyenne. Sonnet passe à 15 centimes, Opus à 20 centimes et Fable monte à 60 centimes.

Une autre manière de voir les choses : Sonnet est en moyenne 11 fois plus cher que Haiku. Passer de Sonnet à Opus fait grimper la facture de 40 %. Enfin, Fable coûte trois fois plus cher qu’Opus. Au final, le rapport entre Haiku et Fable est presque de x50 !

Voici les moyennes des dernières versions de chaque modèle :

  • Haiku 4.5 : 1,3 centime
  • Sonnet 5 : 19,3 centimes
  • Opus 5 : 27,8 centimes
  • Fable 5.1 : 92,1 centimes

L’écart entre Haiku et Fable est encore plus important : près de 100 fois ! On voit également que les dernières versions des modèles coûtent en moyenne plus chères, mais nous y reviendrons un peu plus tard dans cette actualité.

Passons maintenant à toutes les données détaillées. Pour commencer, voici toutes les réponses des différents modèles, avec le nombre de tokens en entrée, ceux utilisés pendant le raisonnement et enfin ceux en sortie.

Il reste 68% de l'article à découvrir.

Cadenas en colère - Contenu premium

Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.

Accédez en illimité aux articles

Profitez d'un média expert et unique

Intégrez la communauté et prenez part aux débats

Partagez des articles premium à vos contacts

Commentaires (10)

votre avatar
Au final, le rapport entre Haiku et Fable est presque de x50 !
L’écart entre Haiku et Fable est encore plus important : près de 100 fois !
Alors que 92,1 / 1,3 ≈ 70 😅
votre avatar
Ne faudrait-il pas ajouter un critère sur la qualité de la réponse pour que l'analyse soit plus complète ?

Certes, c'est compliqué à estimer, mais si par exemple l'extension ne fonctionne pas après mon prompt j'ai perdu quelques centimes + mon temps.
Si je dois le reprompter une 20aine de fois en + avec Haïku alors que c'est du one-shot avec Sonnet, c'est ce coût là qu'il faudrait prendre en compte, non ?
votre avatar
C’est une limite de mon protocole actuel, que je précise et explique d’ailleurs. Les modèles sont en effet statistiques et difficile de comparer les réponses. Je pourrais tester les 60 extensions renvoyées par les LLM, mais ca ne voudrait presque rien dire. Il faudrait faire plusieurs passes et tester chaque extension pour comparer.
Quand au carnet de voyage, ca serait presque impossible à comparer, il n’y a pas de bonne ou de mauvaise situation réponse.
votre avatar
Pour la partie développement, il serait également intéressant de tester avec et sans contexte. Un AGENTS.md et quelques SKILL.md peuvent transformer un modèle même "faible" en quelque chose de tout à fait acceptable
votre avatar
c'est marrant cela me fait penser au début d'internet ou pour le moindre Gbit/s il y avait un tarif différent etc, puis un acteur es arrivé et à proposé le max à un prix .... bref on voit que le modèle de tarification se cherche et essai de rentabiliser au max tout en faisant adopter la technologie.

E pourquoi ne pas tester mistral AI aussi?
votre avatar
Pour Mistral, ils ne se positionnent plus sur la prétention d'avoir de grands modèles généralistes. Ils ont plutôt un focus sur des petits modèles spécialisés, fine-tunés, et adaptés à un environnement donné. Par contre, la question se poserait plutôt pour les modèles chinois génériques
votre avatar
rien ne l'empêche, j’avance petit à petit :) Ce premier article permet aussi d’avoir vos retours s’il y a des choses à améliorer/changer ;)
votre avatar
[Edit] je viens de voir le message de Arthur-fr qui a posté pendant que j'écrivais et je le rejoins donc.

Merci pour cet article, qui représente bcp de travail !
Vous expliquez bien les situations où le budget est parti en raisonnement et aucune réponse n'a donc été fournie.
Mais quid de la qualité des réponses lorsqu'elle est fournie ?
Je ne crois pas qu'une analyse des coûts veuille vraiment dire quelque chose si on ne sait pas combien de fois il a fallu lancer la requête pour avoir la bonne réponse ou même si on l'a eu tout court.
Est-ce qu'il vaut mieux dépenser moins et ne pas avoir la bonne réponse ? Lancer 2x une requête sur Sonnet coûte plus cher (en moyenne d'après vos données) qu'une seule sur Opus donc à quelle fréquence Opus nous evitera-t-il de lancer 2x Sonnet?
C'est encore plus de boulot mais je pense que c'est essentiel à intégrer.
votre avatar
Comme répondu à arthur-fr, c’est compliqué. Pour l'extension, on pourrait tester si elle fonctionne facilement. Mais combien de fois lancer les tests ? Les modèles sont probabilistes. Par contre pour le carte de voyage, comment faire ? Il n’y a pas de bonne réponse universelle.

Pour l’extension non plus d’ailleurs, le LLM peut proposer plus ou moins de fonctions, plus ou moins de ss titre dans sa base de données pour les briefs, etc. Donc même tester ça fonctionne oui/non n’est pas forcément suffisant.
votre avatar
J'ai le droit d'être taquin et de demander à ajouter au protocole d'analyse des coûts quelle part sert à financer le techno-fascisme et l'extrême droite ? :dd:

Et donc à hauteur de combien Next le finance dans son usage de Claude ? :dd: