Le vrai prix de ChatGPT : notre analyse complète, de GPT-3.5 à GPT-6
OpenAille hiii pour la facture
Illustration : Flock
Le 10 septembre à 11h47
OpenAI propose une multitude de modèles utilisables dans ChatGPT, mais ce n’est pas toujours facile de s’y retrouver et de comprendre la tarification. Next vous propose des exemples concrets et chiffrés, avec en prime une comparaison avec Claude d’Anthropic.
Le vrai prix de ChatGPT : notre analyse complète, de GPT-3.5 à GPT-6
OpenAille hiii pour la facture
Illustration : Flock
OpenAI propose une multitude de modèles utilisables dans ChatGPT, mais ce n’est pas toujours facile de s’y retrouver et de comprendre la tarification. Next vous propose des exemples concrets et chiffrés, avec en prime une comparaison avec Claude d’Anthropic.
IA et algorithmes
IA
9 min
Après Claude d’Anthropic, analysons le vrai coût de ChatGPT, l’intelligence artificielle générative d’OpenAI qui a été la première à se lancer pour le grand public. Nous avons pour rappel publié cette semaine une analyse dédiée à GPT-6 Astra, dont une seule requête peut atteindre 33 dollars… et même 67 dollars en Fast mode.
- Le vrai prix de Claude : notre analyse de 11 modèles, avec 3 prompts et 200 requêtes
- GPT-6 Astra : jusqu’à 33 dollars pour un prompt (et ce n’est pas le plus cher d’OpenAI)
De GPT-3.5 Turbo à GPT-6 : trois prompts avec ou sans raisonnement
Comme avec Claude, nous utilisons l’API afin d’avoir le détail du nombre de tokens (ou jetons) en entrée, mais aussi ceux utilisés pour la réflexion du modèle et ceux en sortie avec la réponse écrite. Les IA génératives travaillent avec des tokens à la place des mots, ce sont des fragments de texte. Cela peut être un mot s’il est court, la partie d’un mot, de la ponctuation, etc.
Les sociétés utilisent les tokens pour établir des limites sur les forfaits et/ou facturer à l’usage. C’est vraiment l’unité de base des IA génératives. Nous pouvons ainsi calculer avec précision le prix et comparer les modèles. Plus la réponse et le raisonnement sont longs, plus le modèle utilise de tokens et, par conséquent, plus vite les limites des forfaits sont atteintes ou plus vite l’addition grimpe pour un paiement à l’usage (comme c’est le cas avec les API).
ChatGPT, de la version 5 à la 5.5, proposait un seul modèle principal, avec deux déclinaisons. GPT-5.5 Instant est la version sans raisonnement, GPT-5.5 Thinking avec plusieurs niveaux de raisonnement, de low à xhigh.
Avec GPT-5.6, la situation a changé avec trois familles de modèles : « Sol, notre modèle phare ; Terra, un modèle équilibré pour le travail quotidien ; et Luna, un modèle rapide et abordable », explique OpenAI. Ils peuvent être avec ou sans raisonnement, comme les versions précédentes.
Via l’API, nous avons aussi accès à d’autres modèles, notamment GPT-3.5-turbo, GPT-4 et 4-turbo, GPT-4o et GPT-4.1. Tous ces modèles sont sans raisonnement. Avec GPT-6 Astra (uniquement avec raisonnement, comme Fable d’Anthropic) qui vient de sortir, cela nous donne 14 modèles et 51 combinaisons à tester en fonction du niveau de raisonnement (quand il est ajustable, évidemment).
Nous avons repris exactement les mêmes prompts que pour Claude avec, en gras, le petit nom que nous leur avons attribué. Les voici pour mémoire :
Devinette : « Ô frère, fils de ma mère, ton père est le frère de mon enfant. Qui suis-je ? »
Carnet de voyage : « L’été prochain je vais avoir trois semaines de vacances. Je suis avec ma petite voiture électrique Sprind (charge à 30 kW max) et je voudrais visiter le sud de Bayonne à Montpellier en prenant mon temps. Propose-moi un carnet de voyage »
Extension : « Je veux une extension pour Chrome et Firefox qui me permet d’inverser les titres et les sous-titres sur le site d’actualité Next.ink. S’il n’y a pas de sous-titre, c’est que c’est un brief. Alors fais en sorte d’en inventer un à partir du titre du brief. L’extension doit avoir un sélecteur pour activer/désactiver l’inversion en direct sur la page »
ChatGPT : de 1 à 34 centimes en moyenne par prompt chez OpenAI
Commençons un résumé des tarifs en fonction de la génération des modèles. Il s’agit de la moyenne pour une seule requête, qui varie entre 1 et 34 centimes chez OpenAI (le double chez Anthropic) :
Il reste 65% de l'article à découvrir.
Déjà abonné ou lecteur ? Se connecter
Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.
Accédez en illimité aux articles
Profitez d'un média expert et unique
Intégrez la communauté et prenez part aux débats
Partagez des articles premium à vos contacts
expert et sans pub.
Commentaires (11)
Le 10 septembre à 13h09
De tout ce que j'ai pu tester, le plus équilibré et pertinent, me semblait être Sol - high.
Modifié le 10 septembre à 13h59
Edit: Le travail sur la consommation des tokens (à géométrie floue) et leur coût est remarquable. Mais, les résultats n'ont aucun intérêt pratique, ni économique, si ils sont présentés sans le contexte qui les rendrait pertinents.
Le 11 septembre à 12h06
Sur l’extension, je n’ai pas les moyens ni le temps de tester des dizaines/centaines de version d’une même extension. Quand au carnet de voyage, il n’y a pas une seule réponse possible, loin de là. Mais dans ces deux cas le cout en tokens et en dollars est intéressant à comparer je pense
Le 11 septembre à 15h18
De toute façon, même en intégrant l'évaluation de la performance (au sens large), il est difficile (voir impossible) de garantir que, pour un même type de prompt, le même modèle réagira toujours dans les mêmes proportions en terme de consommation de ressources. C'est un problème semblable à celui de la répétabilité, mais d'une dimension bien supérieure, qui demanderai des évaluations autrement plus poussées.
En tout cas, on progresse bien. Avant l'IA, on utilisait la logique floue (Fuzzy Logic). Maintenant, plus besoin de faire appel à la logique. L'IA repose toujours le flou, mais ce sont les coûts qui sont devenus flous (les moins vigilants peuvent faire l'économie du "l").
Le 10 septembre à 16h05
(au cas où: freshrss/firefox linux)
Le 11 septembre à 12h07
Modifié le 10 septembre à 16h10
Juste une remarque : GPT-5.6 n'est pas un modèle.
Luna, Terra et Sol sont trois modèles complètement différents, comme le sont par ex. Haïku, Sonnet et Opus.
Faire la moyenne des coûts entre les trois n'a aucun sens.
Comparer Haïku, Sonnet et Opus (on suppose dans leur dernière version) avec différentes générations de GPT n'a pas non plus de sens.
Le 10 septembre à 21h02
Dès que j'avais des tâches de code un peu trop hardues pour un model très léger et/ou local, je passais par Claude Sonet. Désormais, Sonet 5 est bien trop cher et verbeux à mon goût, sans m'impressionner sur la qualité de l'analyse par rapport à GPT 5.6 Luna, qui est très pertinent je trouve, peu verbeux, et surtout bien moins cher à tâche égale.
À noter que j'utilise les modèles via GitHub Copilot, donc c'est peut être une question d'implémentation. (D'ailleurs, GitHub Copilot est-il un "harnais" dans ce contexte ? Je n'est sais rien, peut être que le harnais est interne au modèle lui même, je ne saisis pas trop la nuance. Si quelqu'un sait. )
Le 11 septembre à 06h09
Le 11 septembre à 06h19
Le 11 septembre à 16h48
Une liste des coûts variés (liste non exhaustive) :
Tout ça ne se chiffre pas en € très facilement et pourtant c'est bien le coût global qu'il faut mettre en balance avec les "avantages" de l'IA.
Signaler un commentaire
Voulez-vous vraiment signaler ce commentaire ?