Qwen3.8-Max : Alibaba revient dans la course pour rivaliser avec Fable 5 et Kimi K3
Sera-t-il le survivant ?
Le 04 août à 12h11
15 jours après l’arrivée du modèle Kimi K3 de Moonshot AI, une autre entreprise chinoise, Alibaba, sort un modèle à plus de 2 000 milliards de paramètres. Comme en 2025, avec le « moment DeepSeek », les entreprises chinoises montrent qu’elles sont capables de suivre le rythme des leaders états-uniens.
Qwen3.8-Max : Alibaba revient dans la course pour rivaliser avec Fable 5 et Kimi K3
Sera-t-il le survivant ?
15 jours après l’arrivée du modèle Kimi K3 de Moonshot AI, une autre entreprise chinoise, Alibaba, sort un modèle à plus de 2 000 milliards de paramètres. Comme en 2025, avec le « moment DeepSeek », les entreprises chinoises montrent qu’elles sont capables de suivre le rythme des leaders états-uniens.
IA et algorithmes
IA
4 min
Après Kimi K3 de Moonshot AI et ses 2 800 milliards de paramètres, Alibaba renforce l’idée que les entreprises chinoises du secteur ne se laissent pas distancer par Anthropic et OpenAI.
En effet, l’entreprise, d’abord spécialisée dans l’e-commerce, vient de sortir Qwen3.8-Max, un modèle à 2 400 milliards de paramètres. C’est là encore une Mixture of Experts, avec 95 milliards de paramètres actifs pour chaque token (il faut néanmoins charger l’intégralité du modèle en mémoire), contre 104,2 milliards pour Kimi K3.
-
Vendredi 20 mars 2026 à 11h47 20/03/2026 11h47
Certes, c’est dans les deux cas un peu moins que ce que revendique Kimi K3, mais le nombre de paramètres ne fait pas tout et Alibaba prétend, benchmarks à son avantage à l’appui, que Qwen3.8-Max a des résultats globalement comparables à Gemini 3.1-Pro et GPT 5.6 Sol. Ça serait le cas aussi en le comparant à Fable 5 concernant les tâches de raisonnement multimodal, d’« agent visuel » (analyse automatique d’images) et de code, d’analyse de documents ou de « compréhension du monde ».
Comme Moonshot AI (qui a tenu promesse le jour J), Alibaba promet de libérer les poids de Qwen3.8-Max pour en faire un modèle « open source ». L’entreprise chinoise se laisse une exclusivité d’une semaine sur son QwenCloud mais affirme que « les poids du modèle seront mis à disposition en open source sur Hugging Face et ModelScope la semaine prochaine ».
Concurrencer Anthropic sur le code et l’automatisation des tâches de bureau
Avec les benchmarks mis en avant par Alibaba, l’entreprise vise clairement à concurrencer Anthropic concernant le code ainsi que l’automatisation des tâches de bureau. Elle raconte avoir testé son modèle sur trois « défis » dans lesquels « chaque résultat devait être obtenu en écrivant et en exécutant du code, sans aucune aide humaine » : le projet « oh-my-cli » (que Qwen3.8-Max a mis 10 jours à générer et que l’entreprise partage sur GitHub), la reproduction du code d’un article scientifique et un concours de mise en situation demandant de comprendre correctement ce que souhaite le client. Alibaba assure que dans ces trois tâches, son modèle ne s’est pas seulement contenté « de suivre un plan prédéfini : il évolue de lui-même grâce à des boucles de rétroaction ».
Des prix affichés cassés mais une consommation rapide des tokens
Concernant les prix, Alibaba affiche des prix cassés par rapport à ses concurrents : 2 dollars par million de tokens en entrée et 6 dollars par million en sortie. C’est encore moins cher que les prix affichés par Moonshot AI pour Kimi K3.
Rappelons notre comparatif des coûts par million de tokens en ajoutant Qwen3.8-Max :
En entrée :
- Qwen3.8-Max : 2 dollars
- Kimi K3 : 3 dollars
- GPT-5.6 sol : 5 dollars
- Fable 5 : 10 dollars
- Opus 4.8 : 5 dollars
En sortie :
- Qwen3.8-Max : 6 dollars
- Kimi K3 : 15 dollars
- GPT-5.6 sol : 30 dollars
- Fable 5 : 50 dollars
- Opus 4.8 : 25 dollars
Reste que cette différence de prix est difficile à évaluer réellement. En effet, comme nous l’avions déjà expliqué, les entreprises d’IA générative parlent de prix par million de tokens alors que ceux-ci ne sont pas égaux entre les entreprises et parfois même entre des modèles d’une même société. Ainsi, en mai dernier, nous montrions qu’Opus 4.7 cramait ses tokens beaucoup plus vite qu’Opus 4.6.
Déjà, certains utilisateurs de Qwen3.8-Max se plaignent d’avoir utilisé leur quota très rapidement. « Quatre prompts. C’est tout ce qu’il a fallu pour épuiser mon quota de 5 heures. Utilisé à 100 %. Mon quota hebdomadaire en est déjà à 31,2 % », affirme l’un d’entre eux sur X.
S’il est difficile de savoir si Qwen3.8-Max remplacera les modèles d’Anthropic dans les pratiques des développeurs, les investisseurs semblent voir les signes d’un deuxième « moment DeepSeek ». L’action Alibaba a bondi lundi de 7 % à Hong Kong, enregistrant sa plus forte hausse depuis près d’un mois, constatait Bloomberg.
Commentaires (17)
Abonnez-vous pour prendre part au débat
Déjà abonné ou lecteur ? Se connecter
Cet article est en accès libre, mais il est le produit d'une rédaction qui ne travaille que pour ses lecteurs, sur un média sans pub et sans tracker. Soutenez le journalisme tech de qualité en vous abonnant.
Accédez en illimité aux articles d'un média expert
Profitez d'au moins 1 To de stockage pour vos sauvegardes
Intégrez la communauté et prenez part aux débats
Partagez des articles premium à vos contacts
Abonnez-vousModifié mardi à 13h10
On est ici dans le cycle
Modifié mardi à 20h30
Mercredi à 14h30
Mardi à 13h12
Si la tokenisation est plus "fine" (= plus de tokens), est-ce que le modèle pourrait bénéficier d'une genre de finesse/nuance supplémentaire ?
Réponse pour novice attendue, sortez les métaphores si besoin
Mardi à 13h34
-Preums
-Non, moi d'abord
-Non, je suis devant
-Non, poussez vous, moi d'abord!
...quand bien même on voit jour après jour que le mur se rapproche (ou le latex).
Mardi à 15h19
Mardi à 15h32
fait un milliard, @MartinClavey ?
Mercredi à 10h41
Mercredi à 14h57
Mercredi à 15h06
Mercredi à 15h19
Tu m'étonnes qu'on ne sache plus trop bien comment ça fonctionne là dedans ...
Jeudi à 10h04
Vendredi à 09h26
On sait très bien comment fonctionne un réseau de neurones, et comment fonctionne la méthode d'apprentissage.
En revanche on ne sait pas pourquoi faire ainsi donne d'aussi bons résultats.
Et si vous me dites que personne ne peut se représenter exactement les variables internes, je vous répondrais que, à part le niveau de complexité, entraîner un réseau jusqu'à ce qu'il fournisse les bons outputs n'est pas différent d'un ingé son qui règle les niveaux jusqu'à ce que la sono soit adaptée à la salle ; le bassiste n'a pas à connaître les réglages pour en profiter.
Vendredi à 17h31
Maintenant la largeur du réseau, la vitesse et le nombre de connexion simultanées, etc. qui composent le tout. C'est juste humainement impossible d'expliquer une simple reconnaissance d'une image de fraise tellement c'est long à tout déplier. Et donc la compréhension factuelle qui va avec. On pourra vulgariser des choses. Le doute va persister quand même car on ne peut pas tout vérifier / contrôler, peser, mesurer etc.
On ne saura trop rappeler qu'on dit intelligence alors qu'on est dans un système statistique qui profite de la main d’œuvre à bas cout pour apprendre...
Modifié hier à 06h14
Ce qui est fascinant n'est pas tant la taille du truc qui le rend impossible à appréhender, mais bien le fait que d'un traitement stochastique d'une représentation purement textuelle émerge une capacité à raisonner symboliquement.
Avec en toile de fond les implications de tout ceci sur l'hypothèse de Sapir-Whorf
Hier à 09h49
Ce que cela sort peut paraitre bluffant. J'en conviens. Mais... y'a plein de petits problèmes pour rester gentil.
Hier à 12h37
Il n'en demeure pas moins qu'un LLM, en se contentant de faire des phrases comme un vulgaire marin arrive à effectuer des inférences logiques sur le fonctionnement d'un bloc de code, par exemple : oui, telle variable n'est pas initialisée à la bonne valeur quand on entre dans ce "if".
C'est évidemment une anecdote, mais je l'ai vu faire sur du code d'un DSL, et il avait inféré que le mot clé %ACTION définissait une sous-routine qu'on invoquait en assignant à la pseudo-variable ActionIndex, un mode d'appel disons ... ésotérique.
Je ne dis pas que ces déductions logiques sont forcément vraies ni même pertinentes, je dis juste que c'est bien plus que simplement bluffant, il y a bien émergence d'une fonctionnalité déductive distincte du principe de base qui est une simple complétion de phrase.
Signaler un commentaire
Voulez-vous vraiment signaler ce commentaire ?