Connexion Premium

Qwen3.8-Max : Alibaba revient dans la course pour rivaliser avec Fable 5 et Kimi K3

Sera-t-il le survivant ?

Qwen3.8-Max : Alibaba revient dans la course pour rivaliser avec Fable 5 et Kimi K3

15 jours après l’arrivée du modèle Kimi K3 de Moonshot AI, une autre entreprise chinoise, Alibaba, sort un modèle à plus de 2 000 milliards de paramètres. Comme en 2025, avec le « moment DeepSeek », les entreprises chinoises montrent qu’elles sont capables de suivre le rythme des leaders états-uniens.

Après Kimi K3 de Moonshot AI et ses 2 800 milliards de paramètres, Alibaba renforce l’idée que les entreprises chinoises du secteur ne se laissent pas distancer par Anthropic et OpenAI.

En effet, l’entreprise, d’abord spécialisée dans l’e-commerce, vient de sortir Qwen3.8-Max, un modèle à 2 400 milliards de paramètres. C’est là encore une Mixture of Experts, avec 95 milliards de paramètres actifs pour chaque token (il faut néanmoins charger l’intégralité du modèle en mémoire), contre 104,2 milliards pour Kimi K3.

Certes, c’est dans les deux cas un peu moins que ce que revendique Kimi K3, mais le nombre de paramètres ne fait pas tout et Alibaba prétend, benchmarks à son avantage à l’appui, que Qwen3.8-Max a des résultats globalement comparables à Gemini 3.1-Pro et GPT 5.6 Sol. Ça serait le cas aussi en le comparant à Fable 5 concernant les tâches de raisonnement multimodal, d’« agent visuel » (analyse automatique d’images) et de code, d’analyse de documents ou de « compréhension du monde ».

Comme Moonshot AI (qui a tenu promesse le jour J), Alibaba promet de libérer les poids de Qwen3.8-Max pour en faire un modèle « open source ». L’entreprise chinoise se laisse une exclusivité d’une semaine sur son QwenCloud mais affirme que « les poids du modèle seront mis à disposition en open source sur Hugging Face et ModelScope la semaine prochaine ».

Concurrencer Anthropic sur le code et l’automatisation des tâches de bureau

Avec les benchmarks mis en avant par Alibaba, l’entreprise vise clairement à concurrencer Anthropic concernant le code ainsi que l’automatisation des tâches de bureau. Elle raconte avoir testé son modèle sur trois « défis » dans lesquels « chaque résultat devait être obtenu en écrivant et en exécutant du code, sans aucune aide humaine » : le projet « oh-my-cli » (que Qwen3.8-Max a mis 10 jours à générer et que l’entreprise partage sur GitHub), la reproduction du code d’un article scientifique et un concours de mise en situation demandant de comprendre correctement ce que souhaite le client. Alibaba assure que dans ces trois tâches, son modèle ne s’est pas seulement contenté « de suivre un plan prédéfini : il évolue de lui-même grâce à des boucles de rétroaction ».

Des prix affichés cassés mais une consommation rapide des tokens

Concernant les prix, Alibaba affiche des prix cassés par rapport à ses concurrents : 2 dollars par million de tokens en entrée et 6 dollars par million en sortie. C’est encore moins cher que les prix affichés par Moonshot AI pour Kimi K3.

Rappelons notre comparatif des coûts par million de tokens en ajoutant Qwen3.8-Max :

En entrée :

  • Qwen3.8-Max : 2 dollars
  • Kimi K3 : 3 dollars
  • GPT-5.6 sol : 5 dollars
  • Fable 5 : 10 dollars
  • Opus 4.8 : 5 dollars

En sortie :

  • Qwen3.8-Max : 6 dollars
  • Kimi K3 : 15 dollars
  • GPT-5.6 sol : 30 dollars
  • Fable 5 : 50 dollars
  • Opus 4.8 : 25 dollars

Reste que cette différence de prix est difficile à évaluer réellement. En effet, comme nous l’avions déjà expliqué, les entreprises d’IA générative parlent de prix par million de tokens alors que ceux-ci ne sont pas égaux entre les entreprises et parfois même entre des modèles d’une même société. Ainsi, en mai dernier, nous montrions qu’Opus 4.7 cramait ses tokens beaucoup plus vite qu’Opus 4.6.

Déjà, certains utilisateurs de Qwen3.8-Max se plaignent d’avoir utilisé leur quota très rapidement. « Quatre prompts. C’est tout ce qu’il a fallu pour épuiser mon quota de 5 heures. Utilisé à 100 %. Mon quota hebdomadaire en est déjà à 31,2 % », affirme l’un d’entre eux sur X.

S’il est difficile de savoir si Qwen3.8-Max remplacera les modèles d’Anthropic dans les pratiques des développeurs, les investisseurs semblent voir les signes d’un deuxième « moment DeepSeek ». L’action Alibaba a bondi lundi de 7 % à Hong Kong, enregistrant sa plus forte hausse depuis près d’un mois, constatait Bloomberg.

Commentaires (17)

votre avatar
J'attends les quantisation équivalentes à 27B / 35BA3B.

On est ici dans le cycle
votre avatar
Il n'y aura surement pas, c'est comme les variantes 3.5 (0.8B, 2B, 4B, 9B, 122B-A10B, 397B-A17B) qui n'existent pas en 3.6.
votre avatar
Le 3.8 27b a été annoncé
votre avatar
Question peut-être bête mais la consommation des tokens est plutôt liée à tokenisation ou verbosité des réponses ?
Si la tokenisation est plus "fine" (= plus de tokens), est-ce que le modèle pourrait bénéficier d'une genre de finesse/nuance supplémentaire ?

Réponse pour novice attendue, sortez les métaphores si besoin :D
votre avatar
Plus ça va plus tout cela ressemble a une course de spermatozoïdes...

-Preums
-Non, moi d'abord
-Non, je suis devant
-Non, poussez vous, moi d'abord!

...quand bien même on voit jour après jour que le mur se rapproche (ou le latex).
votre avatar
Allo Maman ici bébé ... Ref de vieux :frown:
votre avatar
Qwen3.8-Max, un modèle à 2 400 milliards de paramètres.
Heuhahaha… 2 400 milliards ? Haha, 2 400 milliards. Ah vous êtes charmant mais… Vous voyez déjà ce que ça
fait un milliard, @MartinClavey ? :D
votre avatar
J'avoue ne pas avoir compris, désolé. C'est possible d'être plus explicite ou c'est moi qui n'ai pas une ref ?
votre avatar
Désolé, je pensais que c'était une référence commune.
votre avatar
Ahah, je la connais mais j'avais pas fait le lien !
votre avatar
J'avoue que le nombre faramineux de paramètres des modèles d'IA me laisse pantois/perplexe/dubitatif.
Tu m'étonnes qu'on ne sache plus trop bien comment ça fonctionne là dedans ...
votre avatar
Nope... On a jamais su.
votre avatar
Nope... On a jamais su.
Hmmmm, je vais chipoter - comme à mon habitude diront certains.

On sait très bien comment fonctionne un réseau de neurones, et comment fonctionne la méthode d'apprentissage.

En revanche on ne sait pas pourquoi faire ainsi donne d'aussi bons résultats.

Et si vous me dites que personne ne peut se représenter exactement les variables internes, je vous répondrais que, à part le niveau de complexité, entraîner un réseau jusqu'à ce qu'il fournisse les bons outputs n'est pas différent d'un ingé son qui règle les niveaux jusqu'à ce que la sono soit adaptée à la salle ; le bassiste n'a pas à connaître les réglages pour en profiter.
votre avatar
Si tu me parles de comment fonctionne le neurone (neurone formel). Pour vulgariser pourquoi N1 dit à N2, 'up' en fonction de a = 1 ou 2. Et ainsi de suite dans les chaines (n connexions). Je suis complètement d'accord.

Maintenant la largeur du réseau, la vitesse et le nombre de connexion simultanées, etc. qui composent le tout. C'est juste humainement impossible d'expliquer une simple reconnaissance d'une image de fraise tellement c'est long à tout déplier. Et donc la compréhension factuelle qui va avec. On pourra vulgariser des choses. Le doute va persister quand même car on ne peut pas tout vérifier / contrôler, peser, mesurer etc.

On ne saura trop rappeler qu'on dit intelligence alors qu'on est dans un système statistique qui profite de la main d’œuvre à bas cout pour apprendre...
votre avatar
Ce que je veux dire, c'est que le comment ça marche est assez bien documenté et compris. Si on néglige quelques détails, un LLM ce n'est finalement (oui, je simplifie drastiquement) qu'une gigantesque machine à états finis, dont l'état courant est représenté par les vecteurs internes, et les transitions par un réseau neuronal et le transformeur.

Ce qui est fascinant n'est pas tant la taille du truc qui le rend impossible à appréhender, mais bien le fait que d'un traitement stochastique d'une représentation purement textuelle émerge une capacité à raisonner symboliquement.

Avec en toile de fond les implications de tout ceci sur l'hypothèse de Sapir-Whorf

fr.wikipedia.org Wikipedia
votre avatar
capacité à raisonner symboliquement
Je pense que le mot raisonner ne s'applique pas à ces systèmes. D'ailleurs comment le faire ? On (comme l'humanité) ne comprend toujours pas comment cela fonctionne dans le cerveau humain...

Ce que cela sort peut paraitre bluffant. J'en conviens. Mais... y'a plein de petits problèmes pour rester gentil.
votre avatar
D'accord que raisonner est un concept anthropomorphique trop fort, je n'aurais pas dû utilier ce terme.

Il n'en demeure pas moins qu'un LLM, en se contentant de faire des phrases comme un vulgaire marin arrive à effectuer des inférences logiques sur le fonctionnement d'un bloc de code, par exemple : oui, telle variable n'est pas initialisée à la bonne valeur quand on entre dans ce "if".

C'est évidemment une anecdote, mais je l'ai vu faire sur du code d'un DSL, et il avait inféré que le mot clé %ACTION définissait une sous-routine qu'on invoquait en assignant à la pseudo-variable ActionIndex, un mode d'appel disons ... ésotérique.

Je ne dis pas que ces déductions logiques sont forcément vraies ni même pertinentes, je dis juste que c'est bien plus que simplement bluffant, il y a bien émergence d'une fonctionnalité déductive distincte du principe de base qui est une simple complétion de phrase.