Connexion Premium

GPT-6 Astra : quand OpenAI annonce l’AGI, l’API présente la facture

L'AGI a une drôle de tête

GPT-6 Astra : quand OpenAI annonce l’AGI, l’API présente la facture

Avec GPT-6 Astra, OpenAI ressort le grand mot : AGI. Le nouveau modèle affiche des résultats spectaculaires sur un benchmark indépendant, mais il reste très cher, personne ou presque ne peut s’en servir, et il n’est certainement pas la preuve que l’intelligence artificielle générale est arrivée.

GPT-6 Astra fait entrer OpenAI dans l’ère de l’AGI, l’intelligence artificielle générale. C’est le message qu’a voulu faire passer Greg Brockman, le président de l’entreprise, qui a fait la tournée des popotes pour propager la bonne parole. On attendra d’en savoir plus, et surtout les tests indépendants, pour déterminer si Astra répond réellement aux critères pour le moins flous de l’AGI.

Ce modèle, aussi annoncé comme « un saut générationnel en matière de capacités », rien de moins, se limite pour le moment à la poignée d’organisations qui participent au programme Daybreak. OpenAI promet cependant que GPT-6 sera déployé « dans les prochains jours » auprès des abonnés Plus, Pro, Business et Entreprise, ainsi que via l’API et AWS.

Attention toutefois au coût, en particulier pour la tarification à l’usage avec l’API. GPT-6 Astra revient en effet au même prix que Fable 5.1 : 10 dollars par million de tokens en entrée, 50 dollars en sortie. La hausse est vertigineuse (+ 150 % en entrée comme en sortie) par rapport à GPT-5.6 Sol. Mais « j’ai l’impression que nous avons franchi un changement qualitatif », a déclaré Greg Brockman. Ça se paie.

OpenAI a tout de même souligné que grâce à sa grosse tête bien faite, Astra utilise « nettement moins de tokens au total par tâche », mais on ignore encore concrètement dans quelle mesure cette efficacité se traduira par des coûts plus bas. En tout cas, sur les benchs réalisés par OpenAI, Astra présente plutôt bien :

Le 1er septembre, OpenAI avait fait un point d’étape sur Astra et ses capacités en matière de cybersécurité. Le modèle n’est pas impliqué dans l’attaque d’Hugging Face, néanmoins l’entreprise en a profité pour intégrer les enseignements de cette fuite d’agents. « Nous estimons que les protections d’Astra réduisent suffisamment le risque de préjudices graves pour permettre sa sortie conformément à notre cadre de préparation ». Ouf.

Loin de l’AGI selon ARC-AGI-3

Un benchmark indépendant apporte un peu de nuance au message forcément marketing et flatteur de Greg Brockman. Astra est en effet passé au tamis d’ARC-AGI-3, un benchmark publié par l’ARC Prize Foundation, une organisation à but non lucratif cofondée par François Chollet, créateur de Keras, la bibliothèque open source pour créer et entraîner des réseaux de neurones, très utilisée.

ARC-AGI-3 ne dit pas qu’Astra est une AGI ; les auteurs indiquent clairement que saturer le bench ne constitue pas une preuve d’AGI. « Même si nous pensons qu’Astra représente un progrès significatif vers la généralisation, nous n’affirmons pas qu’il s’agit d’une AGI », écrivent-ils. Ceci étant dit, les résultats de GPT-6 n’en restent pas moins impressionnants : 62,7 % avec le harnais standard (le cadre de test commun et minimal utilisé pour évaluer tous les modèles de la même façon), et jusqu’à 99,9 % avec un harnais adapté aux spécificités du fournisseur.

Chaque point représente un niveau terminé par Astra en mode Max. Les points situés sous la ligne continue indiquent qu’Astra a utilisé moins d’actions que la référence humaine.

En mode Max, pour les niveaux résolus, Astra se montre bien plus efficace que les humains avec le harnais standard. Il utilise en effet moins d’actions que le médian humain dans 96 % des niveaux terminés, avec 51,7 % d’actions en moins par niveau en moyenne. Spectaculaire… tout comme le coût ! Jusqu’à 26 098 dollars pour le score standard à 62,7 %, et 18 817 dollars pour le 99,9 % avec le harnais « provider adapter ».

À titre de comparaison, les participants humains du test étaient rémunérés 115 dollars par session de 90 minutes, plus 5 dollars par jeu terminé, soit environ 12,78 dollars par jeu tenté avant bonus. La comparaison reste cependant imparfaite : côté humain, on rémunère surtout du temps de participation ; côté IA, on mesure une facture d’inférence.

La performance d’Astra demande donc à être nuancée (tout comme les déclarations enflammées du président d’OpenAI). Ce d’autant que les humains peuvent résoudre 100 % des environnements du benchmark, là où GPT-6 n’atteint pas 63 %. Le modèle peut se montrer plus efficace que le médian humain lorsqu’il comprend un niveau, mais il ne les comprend pas tous. Et puis ARC-AGI-3 reste très balisé, avec des mécaniques et des objectifs bien définis ne reflétant évidemment pas le monde réel. Il est cependant indéniable, au vu des résultats, que le modèle fait de gros progrès sur l’agentique.

Commentaires (4)

votre avatar
Ils préparent juste leur entrée en bourse...
votre avatar
Un abus de superlatifs comme à chaque fois. Tous les 2 mois il y a un fournisseur qui dit qu’il a atteint l’agi et qu’il est super giga bien meilleur que le précédent avec une super giga bien plus chère facture.
Comme le reste tout n’est marketing, annonces… il faudra ensuite trouver d’autres investisseurs crédules pour leur turbine à cash : ça crame toujours plus de cash.
Nul doute que le prix du token est encore subventionné.
votre avatar
Apple n'a toujours pas attaqué les fabricants de modèles d'IA pour plagiat de sa communication et infraction à son copyright sur les superlatifs ?
votre avatar