Connexion Premium

La foire à la saucisse des benchmarks IA… peut-on leur faire confiance ?

Ness_01 est à 256 % sur tous les tests

La foire à la saucisse des benchmarks IA… peut-on leur faire confiance ?

Illustration : Flock

Les benchmarks sur l’IA générative sont largement utilisés par les sociétés, mais veulent-ils dire quelque chose ? Oui, à condition d’avoir l’ensemble des détails et des conditions des tests, qui ne sont que rarement mis en avant. La prudence est donc de mise.

Les modèles d’IA générative se succèdent à un rythme important, avec pléthore de chiffres et de benchmarks à chaque fois pour montrer à quel point chaque nouvelle génération bat la précédente et écrase la concurrence. Mais, ces chiffres sont-ils fiables ?

Pour le savoir, nous avons examiné plus d’une dizaine de communiqués et billets de blog d’OpenAI et d’Anthropic, soit les deux LLM commerciaux phares du moment : ChatGPT et Claude. Nous avons également analysé les annonces de Moonshot IA (Kimi K3) et Qwen (3.8-Max), ainsi que les résultats des tests d’Artificial Analysis, une société indépendante spécialisée dans les benchmarks IA générative.

Nous avons déjà expliqué comment les données pouvaient influencer en profondeur les résultats, mais ce n’est pas le seul problème. Mêmes benchmarks, mêmes données (parfois « cachées ») et pourtant des scores différents selon qui mesure et comment.

SWE-bench Pro : attentions aux jeux de données

Commençons avec SWE-bench Pro, un benchmark largement utilisé. Il est développé par Scale AI et permet, selon l’entreprise, de « fournir une évaluation rigoureuse et réaliste des agents d’IA pour l’ingénierie logicielle ». SWE-bench Pro est la version « Pro » de SWE-bench ? Oui et non, ce n’est pas réellement la même chose.

SWE-bench a été lancé en 2023 par des chercheurs de Princeton et Stanford. SWE-bench Pro est arrivé en 2025 par la société Scale AI. Attention donc à ne pas mélanger les deux, même si la version Pro se présente comme un successeur : « SWE-Bench Pro reprend là où SWE-Bench Verified s’est arrêté, avec des tâches plus diversifiées, une difficulté accrue et un code que les modèles n’ont pas encore vu ».

Dans SWE-bench Pro, il y a plusieurs types de tests différents, qui diffèrent sur les données utilisées. Parler de « SWE-bench Pro seul » ne veut donc rien dire… alors que c’est pourtant souvent utilisé comme référence.

Voici les trois tests :

  • Public Set : 731 tâches et 11 dépôts
  • Held-out Set : 858 tâches et 12 dépôts
  • Commercial ou Private Set : 276 tâches et 18 dépôts

Le Public et le Private sont les plus utilisés. Le premier a l’avantage et l’inconvénient d’être public : tout le monde peut l’utiliser, les données sont librement accessibles, des optimisations de modèles sont donc possibles (de manière volontaire ou non).

Avec Private, les modèles font face à des données inédites (en théorie). Les tests sur Public Set sont un peu des annales, tandis que l’examen final pourrait être comparé à Private Set. Held-Out serait alors un contrôle surprise antidopage effectué par Scale AI.

SWE-bench Pro : des écarts importants suivant les conditions et paramètres

Il reste 51% de l'article à découvrir.

Cadenas en colère - Contenu premium

Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.

Accédez en illimité aux articles

Profitez d'un média expert et unique

Intégrez la communauté et prenez part aux débats

Partagez des articles premium à vos contacts

Commentaires (4)

votre avatar
Ness_01 est à 256 % sur tous les tests
d'ailleurs, on n'entend plus beaucoup @Ness_01 c'est bien dommage :oops:
votre avatar
votre avatar
Je m'attendais à voir ExploitGym cité dans les benchmarks, mais non.
votre avatar
Perso, les benchmark, j'ai toujours vu ça en "selon la méthodo qui m'arrange, je suis le meilleur".