Connexion Premium

Le vrai prix de ChatGPT : notre analyse complète, de GPT-3.5 à GPT-6

OpenAille hiii pour la facture

Le vrai prix de ChatGPT : notre analyse complète, de GPT-3.5 à GPT-6

Illustration : Flock

OpenAI propose une multitude de modèles utilisables dans ChatGPT, mais ce n’est pas toujours facile de s’y retrouver et de comprendre la tarification. Next vous propose des exemples concrets et chiffrés, avec en prime une comparaison avec Claude d’Anthropic.

Après Claude d’Anthropic, analysons le vrai coût de ChatGPT, l’intelligence artificielle générative d’OpenAI qui a été la première à se lancer pour le grand public. Nous avons pour rappel publié cette semaine une analyse dédiée à GPT-6 Astra, dont une seule requête peut atteindre 33 dollars… et même 67 dollars en Fast mode.

De GPT-3.5 Turbo à GPT-6 : trois prompts avec ou sans raisonnement

Comme avec Claude, nous utilisons l’API afin d’avoir le détail du nombre de tokens (ou jetons) en entrée, mais aussi ceux utilisés pour la réflexion du modèle et ceux en sortie avec la réponse écrite. Les IA génératives travaillent avec des tokens à la place des mots, ce sont des fragments de texte. Cela peut être un mot s’il est court, la partie d’un mot, de la ponctuation, etc.

Les sociétés utilisent les tokens pour établir des limites sur les forfaits et/ou facturer à l’usage. C’est vraiment l’unité de base des IA génératives. Nous pouvons ainsi calculer avec précision le prix et comparer les modèles. Plus la réponse et le raisonnement sont longs, plus le modèle utilise de tokens et, par conséquent, plus vite les limites des forfaits sont atteintes ou plus vite l’addition grimpe pour un paiement à l’usage (comme c’est le cas avec les API).

ChatGPT, de la version 5 à la 5.5, proposait un seul modèle principal, avec deux déclinaisons. GPT-5.5 Instant est la version sans raisonnement, GPT-5.5 Thinking avec plusieurs niveaux de raisonnement, de low à xhigh.

Avec GPT-5.6, la situation a changé avec trois familles de modèles : « Sol, notre modèle phare ; Terra, un modèle équilibré pour le travail quotidien ; et Luna, un modèle rapide et abordable », explique OpenAI. Ils peuvent être avec ou sans raisonnement, comme les versions précédentes.

Via l’API, nous avons aussi accès à d’autres modèles, notamment GPT-3.5-turbo, GPT-4 et 4-turbo, GPT-4o et GPT-4.1. Tous ces modèles sont sans raisonnement. Avec GPT-6 Astra (uniquement avec raisonnement, comme Fable d’Anthropic) qui vient de sortir, cela nous donne 14 modèles et 51 combinaisons à tester en fonction du niveau de raisonnement (quand il est ajustable, évidemment).

Nous avons repris exactement les mêmes prompts que pour Claude avec, en gras, le petit nom que nous leur avons attribué. Les voici pour mémoire :

Devinette : « Ô frère, fils de ma mère, ton père est le frère de mon enfant. Qui suis-je ? »

Carnet de voyage : « L’été prochain je vais avoir trois semaines de vacances. Je suis avec ma petite voiture électrique Sprind (charge à 30 kW max) et je voudrais visiter le sud de Bayonne à Montpellier en prenant mon temps. Propose-moi un carnet de voyage »

Extension : « Je veux une extension pour Chrome et Firefox qui me permet d’inverser les titres et les sous-titres sur le site d’actualité Next.ink. S’il n’y a pas de sous-titre, c’est que c’est un brief. Alors fais en sorte d’en inventer un à partir du titre du brief. L’extension doit avoir un sélecteur pour activer/désactiver l’inversion en direct sur la page »

ChatGPT : de 1 à 34 centimes en moyenne par prompt chez OpenAI

Commençons un résumé des tarifs en fonction de la génération des modèles. Il s’agit de la moyenne pour une seule requête, qui varie entre 1 et 34 centimes chez OpenAI (le double chez Anthropic) :

Il reste 65% de l'article à découvrir.

Cadenas en colère - Contenu premium

Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.

Accédez en illimité aux articles

Profitez d'un média expert et unique

Intégrez la communauté et prenez part aux débats

Partagez des articles premium à vos contacts

Commentaires (11)

votre avatar
Ça confirme mon ressenti.
De tout ce que j'ai pu tester, le plus équilibré et pertinent, me semblait être Sol - high.
votre avatar
Sans croisement avec la qualité des réponses, et éventuellement le temps mis à répondre, pris seul, le coût de traitement des prompts est une information qui n'a aucune valeur. Connaitre le coût des tokens et la quantité nécessaire à l'élaboration d'une réponse n'a aucun intérêt. C'est, un peu, comme comparer des restaurants, avec le prix des plats comme unique critère. On n'est pas plus avancé, pour savoir où on préfèrerait aller manger...

Edit: Le travail sur la consommation des tokens (à géométrie floue) et leur coût est remarquable. Mais, les résultats n'ont aucun intérêt pratique, ni économique, si ils sont présentés sans le contexte qui les rendrait pertinents.
votre avatar
Comme déjà expliqué dans le précédent article, ce n’est pas franchement possible dans le cas présent, et ce n’est pas le but. Sur la devinette, Œdipe est une bonne réponse donnée seulement par une poignée de modèle, c’est précisé. Pour les autres c‘est aussi voir à quel point le raisonnement est utilisée et donc facturé.

Sur l’extension, je n’ai pas les moyens ni le temps de tester des dizaines/centaines de version d’une même extension. Quand au carnet de voyage, il n’y a pas une seule réponse possible, loin de là. Mais dans ces deux cas le cout en tokens et en dollars est intéressant à comparer je pense
votre avatar
Je comprends parfaitement la difficulté. On va dire qu'il appartient à chacun d'évaluer la performance de chaque solution, par rapport à ses besoins propres. On peut alors croiser ses propres évaluations avec celles-ci, pour retenir ce qu'on considérera comme étant (probablement) le meilleur compromis coût/performances.

De toute façon, même en intégrant l'évaluation de la performance (au sens large), il est difficile (voir impossible) de garantir que, pour un même type de prompt, le même modèle réagira toujours dans les mêmes proportions en terme de consommation de ressources. C'est un problème semblable à celui de la répétabilité, mais d'une dimension bien supérieure, qui demanderai des évaluations autrement plus poussées.

En tout cas, on progresse bien. Avant l'IA, on utilisait la logique floue (Fuzzy Logic). Maintenant, plus besoin de faire appel à la logique. L'IA repose toujours le flou, mais ce sont les coûts qui sont devenus flous (les moins vigilants peuvent faire l'économie du "l").
votre avatar
hum, petite remarque: dans le flux rss full, les frames sur les courbes n'apparaissent pas, possible de faire en sorte qu'on ait au moins une image à la place en preview ? Merci !
(au cas où: freshrss/firefox linux)
votre avatar
C’est noté, je vais regader !
votre avatar
Sympa ces comparaisons.

Juste une remarque : GPT-5.6 n'est pas un modèle.

Luna, Terra et Sol sont trois modèles complètement différents, comme le sont par ex. Haïku, Sonnet et Opus.

Faire la moyenne des coûts entre les trois n'a aucun sens.
Comparer Haïku, Sonnet et Opus (on suppose dans leur dernière version) avec différentes générations de GPT n'a pas non plus de sens.
votre avatar
Mon avis totalement subjectif :
Dès que j'avais des tâches de code un peu trop hardues pour un model très léger et/ou local, je passais par Claude Sonet. Désormais, Sonet 5 est bien trop cher et verbeux à mon goût, sans m'impressionner sur la qualité de l'analyse par rapport à GPT 5.6 Luna, qui est très pertinent je trouve, peu verbeux, et surtout bien moins cher à tâche égale.

À noter que j'utilise les modèles via GitHub Copilot, donc c'est peut être une question d'implémentation. (D'ailleurs, GitHub Copilot est-il un "harnais" dans ce contexte ? Je n'est sais rien, peut être que le harnais est interne au modèle lui même, je ne saisis pas trop la nuance. Si quelqu'un sait. )
votre avatar
Luna en mode reflexion max semble un bon compromis entre consommation de token et qualité du code généré
votre avatar
A la vue du titre "le vrai prix" je pensais que l'article presenterait une règle de trois entre le prix payé par l'utilisateur, le chiffre d'affaire d'OpenAI et Anthropic et leur dette abyssale.
votre avatar
Oui moi aussi je m'attendais à quelque-chose sur ce terrain là.
Une liste des coûts variés (liste non exhaustive) :

  • Coût économique direct (électricité)

  • Coût de l'infra (puces, datacentre, etc...) jusqu'au coût carbone des métaux rares minés

  • Coût local (eau pompée, renchérissement de l'énergie pour les gens autour)

  • Coûts induits multiples (coût environnemental global, avec impacts locaux)

  • Coût pour les ayants droits (IP volé, manque à gagner, coût des procès)

  • Coûts pour les sociétés (cerveaux en vrac, dégats psychosociaux, sur les systèmes d'éducation, les pressions/chantages sur le marché de l'emploi)

  • Coût carbone induit par l'IA ("wahou grâce à l'IA j'ai de nouveau puits de pétrole découverts à aller crâmer")



Tout ça ne se chiffre pas en € très facilement et pourtant c'est bien le coût global qu'il faut mettre en balance avec les "avantages" de l'IA.