Connexion Premium

Google lance Gemini 3.8 Flash et sa déclinaison Cyber

Troisième sortie en seulement six semaines pour Google : la firme de Mountain View vient en effet de déployer la version 3.8 de son modèle Gemini Flash, la famille censée offrir le meilleur rapport entre rapidité et coût de traitement des requêtes. Cette nouvelle mouture succède aux versions 3.6 et 3.7, mises en ligne à trois semaines d’intervalle.

Gemini 3.8 Flash est présenté comme le meilleur workhorse model de Google, c’est-à-dire un modèle dédié à des tâches utilitaires. Et d’après les benchmarks publiés par l’entreprise, il tiendrait la route face à des modèles dits frontière. Elle revendique ainsi un score de 73,7 % sur le test DeepSWE, qui mesure les performances en développement logiciel avancé, contre 74 % pour Opus 5 chez Anthropic et 72,7 % chez OpenAI avec GPT-5.6 Sol.

En développement agentique (missions de code autonomes dans le terminal), Gemini 3.8 Flash se paierait même le luxe de dépasser d’un cheveu Opus 5. Google revendique également des performances en hausse sur les tâches liées à la finance, au monde du droit, à l’interprétation de documents complexes (principalement scientifiques) ou à la recherche en biologie.

Comparaison entre Gemini Flash 3.8, son prédécesseur 3.7 et plusieurs modèles concurrents – source Google

Sur les tâches complexes impliquant du raisonnement ou une subdivision, Google prévient toutefois que le gain de performances promis avec Gemini 3.8 Flash se fait au prix d’une consommation plus élevée de tokens :

« Ces gains de performance découlent d’un choix de conception fondamental : Flash 3.8 travaille davantage. Sur les tâches complexes, il fait preuve d’une plus grande rigueur, en exécutant des étapes de raisonnement supplémentaires et en appelant les outils de manière itérative. Le modèle peut parfois utiliser plus de jetons pour optimiser les performances, notamment lorsque le niveau d’effort est élevé. »

Gemini 3.8 Flash est dès à présent disponible au travers des canaux courants d’IA chez Google, en API ou au travers de l’application Gemini pour les souscripteurs d’un forfait Google AI Pro ou Ultra. Pour ces derniers, c’est également lui qui sous-tend les Aperçus IA intégrés par le moteur à ses résultats de recherche.

Google affiche une tarification agressive pour le lancement, avec 0,75 dollar par million de tokens en entrée et 3,75 dollars par million de tokens en sortie. Ce prix n’est cependant valable que jusqu’au 31 décembre, date à laquelle la facturation se fera sur une base fixée à 1,50 / 7,50 dollars par million de tokens.

Google déploie dans le même temps la variante Cyber de son nouveau modèle, dotée de capacités spécifiques au monde de la cybersécurité. L’accès à ce dernier est cependant réservé aux organisations et entreprises enregistrées dans le programme Fairwind.

Commentaires (1)

votre avatar
Hum... Voyons voir, Qwen 3.8 27B UD-IQ4_XS en modèle local tournant sur un gpu avec 16Gb de vram sur llama.cpp, obtient un score de ~73% sur terminalbench.

Considérant que le gpu en question consomme 180w à pleine charge (un gpu amd type RX 9060 XT), il faut compter environ 5h30 pour consommer 1KWh, sur une moyenne de 23 centimes on peut sortir ~530 000 tokens.
En chiffre réels il faut compter autour de 0,43€/million de tokens.

Autant dire que pour la majorité des tâches non critiques, l'assistance d'un modèle local privé est bien moins coûteux et suffisant... Mais plus lent.

Ceci dit, si l'on dispose d'une installation solaire, là, encore, le coût chute drastiquement, de même que l'impact sur le réseau électrique. Les panneaux solaires à poser au sol, avec micro-onduleurs, sont devenus très accessibles.

Bon, évidemment, tout ça est conditionné à des investissements, mais en général le commun des mortels utilise un gpu pour jouer, et du solaire pour ses besoins domestiques, aussi.