Claude Opus 5 veut faire presque aussi bien que Fable, pour moitié moins cher
2 min
IA et algorithmes
IA
Le temps où les modèles Opus étaient les plus puissants du catalogue d’Anthropic est terminé. Ce rôle est désormais dévolu à Fable et Mythos, mais le labo IA n’en a pas moins oublié son ancienne famille haut de gamme. Le lancement d’Opus 5 semble s’accompagner d’une prise de conscience de l’entreprise : les clients ont besoin de modèles certes costauds, mais aussi et surtout au bon rapport performances/prix.
Un des premiers arguments d’Anthropic porte ainsi sur les tarifs. Opus 5 se situe presque au niveau de Fable 5 pour certaines tâches, tout en étant facturé moitié moins cher. Les prix sont de 5 dollars par million de jetons en entrée, pour 25 dollars en sortie, soit la même chose qu’Opus 4.8. Fable 5, qui n’est accessible via l’API et des crédits d’utilisation, revient respectivement à 10 et 50 dollars.

Le labo insiste d’ailleurs lourdement sur le coût nécessaire pour réaliser une tâche, pas uniquement sur les résultats bruts des benchmarks. Sur CursorBench 3.1, au niveau d’effort maximal, les performances d’Opus 5 se placent à moins de 0,5 % du meilleur score de Fable 5 pour un coût par tâche deux fois moins élevé, selon le test réalisé par l’entreprise.

Le modèle obtient de meilleurs résultats que tous les autres avec les niveaux d’effort high, xhigh et max. Anthropic affirme qu’Opus 5 atteint l’état de l’art en matière de performances, ce qu’il faudra vérifier de manière indépendante.
En plus d’amélioration significatives sur les tâches liées à la recherche scientifique par rapport à Opus 4.8, ce nouveau modèle sait aussi générer des visuels « nettement plus convaincants » (chacun jugera) :
Opus 5 semble surtout progresser dans sa capacité à vérifier son propre travail, à corriger ses premières tentatives et à construire les outils qui lui manquent pour arriver au bout d’une tâche. En termes de cybersécurité, le modèle est présenté comme moins dangereux que Mythos 5 ; il serait presque aussi performant pour repérer des vulnérabilités, mais nettement moins efficace pour fabriquer les moyens de les exploiter.