Lancé par Alibaba le 3 août 2026, Qwen3.8-Max associe une architecture Mixture-of-Experts de 2 400 milliards de paramètres, dont 95 milliards activés, à une fenêtre de contexte annoncée d’un million de tokens et à des capacités multimodales et agentiques.
Les évaluations publiées montrent une progression nette en codage et sur certaines tâches professionnelles, mais elles ne permettent pas d’établir une supériorité générale.
L’intérêt du modèle se situe surtout dans la combinaison entre poids disponibles, service cloud enrichi et exécution de tâches longues.
Ce qui vient de se passer
Alibaba Cloud a officiellement présenté Qwen3.8-Max le 3 août 2026. L’entreprise le décrit comme son modèle Qwen le plus grand et le plus capable à cette date, avec 2 400 milliards de paramètres, une architecture à experts, une fenêtre de contexte pouvant atteindre un million de tokens et la prise en charge du texte, des images et de la vidéo en entrée dans son service Model Studio.[1][2]
Le modèle est proposé par API dans plusieurs régions, notamment en Chine, à Singapour, en Allemagne, aux États-Unis, au Japon et à Hong Kong. La documentation indique toutefois que certaines fonctions varient selon la région. La recherche Web est par exemple disponible dans certains environnements, mais pas dans toutes les implantations du service initial.[2]
Depuis le lancement, la situation a évolué. Alibaba a publié sur Hugging Face les poids du modèle Qwen3.8-2.4T-A95B. La fiche officielle précise cependant que Qwen3.8-Max correspond à une version de service fondée sur cette base, enrichie notamment par l’entrée visuelle, les outils intégrés, le mode sans raisonnement et un contexte d’un million de tokens activé par défaut.[3] Parler d’un unique produit entièrement identique entre API et téléchargement serait donc imprécis.
Ce qui est réellement nouveau
Le premier changement tient à l’échelle du modèle. Qwen3.8-2.4T-A95B compte 2 400 milliards de paramètres au total, mais seulement 95 milliards sont activés pour traiter chaque token. Cette architecture Mixture-of-Experts permet d’augmenter la capacité globale sans mobiliser l’ensemble du réseau à chaque étape. La fiche technique indique 512 experts, dont dix experts routés et un expert partagé sont activés.[3]
Le deuxième changement concerne le positionnement agentique. Qwen3.8-Max n’est pas seulement présenté comme un système de réponse conversationnelle. Alibaba le destine à des tâches de codage, de recherche, de travail professionnel et d’exécution sur de longues séquences. Dans ces scénarios, le modèle planifie plusieurs étapes, utilise des outils, observe les résultats et ajuste sa trajectoire.
Le troisième changement réside dans l’articulation entre modèle ouvert et service géré. Les poids textuels peuvent être téléchargés sous une licence spécifique Qwen3.8-Max, tandis que les fonctions les plus intégrées sont fournies dans le cloud. Cette distinction crée deux propositions différentes : davantage de contrôle et de personnalisation en auto-hébergement, ou davantage de fonctions prêtes à l’emploi dans l’API.
Executive MBA AI & Business
Transformation
Le MBA repensé pour l’ère de l’IA. Pour dirigeants expérimentés qui veulent piloter la transformation de leur organisation. Paris, Nice & Dubai.
Comment fonctionne Qwen3.8-Max
Qwen3.8-Max s’appuie sur une architecture hybride combinant un mécanisme Mixture-of-Experts et plusieurs formes d’attention. Un routeur sélectionne les experts jugés pertinents pour chaque token. Le modèle peut ainsi répartir ses capacités entre différentes spécialisations sans activer ses 2 400 milliards de paramètres en même temps.
La version à poids disponibles dispose d’un contexte natif de 262 144 tokens, extensible jusqu’à environ 1,01 million de tokens. Dans Model Studio, Alibaba annonce un contexte total d’un million de tokens, avec jusqu’à 991 808 tokens d’entrée et 131 072 tokens de sortie selon les paramètres utilisés.[2][3] Cette capacité facilite l’analyse de grands dépôts logiciels ou de documents volumineux, mais elle ne garantit pas que toutes les informations seront mobilisées avec la même précision.
Dans un workflow agentique, le modèle reçoit un objectif, décompose la mission, appelle des fonctions ou des outils, puis utilise les résultats pour poursuivre son travail. Pour le codage, cela peut inclure l’examen d’un dépôt, la génération de modifications et l’exécution de tests. Pour des usages professionnels, la version gérée accepte également des contenus visuels et vidéo, produit du texte structuré et peut exploiter la recherche Web lorsque la région le permet.[2]
Fonctionnalités et contraintes techniques
| Capacité ou contrainte | Ce qu’il faut comprendre |
|---|---|
| Architecture MoE | 2 400 milliards de paramètres au total, dont 95 milliards activés par token selon Alibaba. |
| Contexte | 262 144 tokens nativement pour les poids publiés, avec une extension possible à environ 1,01 million. Le service Max annonce 1 million de tokens par défaut. |
| Multimodalité | Texte, image et vidéo en entrée dans Model Studio. La sortie documentée reste textuelle. |
| Agents et outils | Appels de fonctions, sorties structurées, outils intégrés et recherche Web selon la région. |
| Déploiement local | Poids disponibles sur Hugging Face, mais l’échelle du modèle impose une infrastructure très importante. |
| Personnalisation | Le fine-tuning du service Max est indiqué comme non pris en charge dans la documentation consultée. |
Ce que les benchmarks permettent réellement d’affirmer
Le tableau publié par l’équipe Qwen montre une amélioration importante par rapport à Qwen3.7-Max. Qwen3.8-Max obtient 86,6 sur Terminal-Bench 2.1 contre 74,5 pour son prédécesseur, 67,7 sur SWE-bench Pro contre 60,6 et 93,0 sur PaperBench contre 64,8.[3] Ces résultats soutiennent l’idée d’un progrès en codage et en reproduction de travaux, dans les conditions choisies par l’équipe.
| Évaluation | Qwen3.7-Max | Qwen3.8-Max | Lecture prudente |
|---|---|---|---|
| Terminal-Bench 2.1 | 74,5 | 86,6 | Progression nette, mais GPT-5.6 Sol est donné à 88,8 dans le même tableau. |
| SWE-bench Pro | 60,6 | 67,7 | Amélioration, mais score inférieur aux 80,0 attribués à Fable 5. |
| DeepSWE 1.1 | 21,6 | 56,6 | Gain important, mais retard sur Fable 5 et GPT-5.6 Sol. |
| PaperBench | 64,8 | 93,0 | Meilleur score du tableau publié, à confirmer par des reproductions indépendantes. |
| IFBench | 79,1 | 82,8 | Progression sur le suivi d’instructions dans le protocole retenu. |
Ces chiffres ne permettent pas de désigner un meilleur modèle de manière générale. Les performances varient fortement selon les tâches. Les protocoles, les outils disponibles, le nombre de tentatives, le budget de raisonnement et le contexte maximal peuvent différer. Une évaluation conduite ou compilée par le fournisseur reste une source primaire utile, mais elle ne remplace pas une comparaison indépendante homogène.
Le classement Arena fournit un autre signal, fondé sur des préférences d’utilisateurs. Le 13 septembre 2026, Qwen3.8-Max apparaissait au 22e rang général du classement texte, avec un score de 1 481 ± 6 et 16 670 votes.[4] Ce résultat confirme sa compétitivité, mais il montre aussi que le rang de cinquième annoncé au lancement n’était pas stable dans le temps. Les classements évoluent avec les nouveaux modèles, le nombre de votes et la méthode de calcul.
Un contexte d’un million de tokens ne garantit pas une mémoire parfaite
Une très grande fenêtre de contexte permet de transmettre davantage de documents ou de code dans une même session. Elle réduit le besoin de découper artificiellement certains corpus et peut faciliter les tâches qui exigent des références dispersées dans un ensemble volumineux.
Cependant, capacité d’entrée et qualité d’exploitation ne sont pas équivalentes. Un modèle peut accepter un million de tokens sans retrouver chaque détail avec la même fiabilité, relier correctement des éléments éloignés ou maintenir une stratégie cohérente pendant toute la séquence. Les performances dépendent aussi de l’organisation du corpus, de la formulation de la demande et des mécanismes de récupération d’information associés.
Pour une entreprise, l’enjeu consiste donc moins à remplir la fenêtre qu’à préparer les données : sélection des sources, contrôle des versions, segmentation logique, droits d’accès et évaluation des réponses. Un contexte très long ne remplace pas une architecture documentaire ni une gouvernance des connaissances.
Le coût peut favoriser les usages agentiques, mais il doit être calculé sur la mission complète
Dans la région de Singapour destinée aux usages internationaux, Alibaba affiche un tarif standard de 2 dollars par million de tokens en entrée et 6 dollars par million en sortie. Dans plusieurs autres régions globales, la documentation indique 1,65 dollar en entrée et 4,951 dollars en sortie. Des tarifs spécifiques existent pour le cache et peuvent évoluer avec les promotions.[2]
Ces prix paraissent attractifs pour un modèle de cette catégorie, mais le coût réel d’un agent ne se résume pas à un appel. Une mission longue peut multiplier les itérations, les sorties, les appels d’outils et les contrôles. Il faut donc mesurer le coût par tâche réussie, la latence, le taux d’erreur et le travail de vérification humaine, plutôt que comparer uniquement le prix affiché par million de tokens.
Pourquoi cela compte pour les organisations
Qwen3.8-Max élargit le choix des entreprises entre API gérée et déploiement contrôlé. Le service cloud fournit des fonctions multimodales, des outils et une disponibilité régionale. Les poids publiés offrent davantage de possibilités d’inspection et d’adaptation, mais leur taille rend l’auto-hébergement difficile et coûteux. La disponibilité technique n’équivaut donc pas à une accessibilité opérationnelle.
Pour les équipes de développement, la capacité à travailler sur des trajectoires longues peut automatiser certaines phases de diagnostic, de génération, de test et de documentation. Cette automatisation exige néanmoins des environnements isolés, des permissions minimales, une traçabilité des actions et une revue humaine des changements avant leur intégration.
Pour les métiers de la connaissance, la multimodalité et le contexte long peuvent soutenir l’analyse de rapports, de contrats, de vidéos ou de corpus internes. Les organisations doivent toutefois définir quelles données peuvent être envoyées, dans quelle région elles sont traitées, combien de temps elles sont conservées et quelles obligations contractuelles s’appliquent.
Les enjeux de responsabilité et de gouvernance
Le premier enjeu concerne les données. Une fenêtre d’un million de tokens facilite l’envoi de volumes massifs de documents, y compris des informations personnelles, confidentielles ou protégées. En Europe, le RGPD continue de s’appliquer lorsque des données personnelles sont traitées. Les entreprises doivent vérifier la base juridique, la minimisation, les transferts éventuels, la sécurité et les droits des personnes. L’AI Act ne remplace pas ces obligations.
Le deuxième enjeu porte sur l’autonomie des agents. Un modèle capable d’utiliser des outils ou d’exécuter du code peut produire des actions indésirables, propager une erreur ou accéder à une ressource hors périmètre. La supervision doit être conçue avant le déploiement : bac à sable, liste d’outils autorisés, validation humaine pour les opérations sensibles, journalisation et mécanisme d’arrêt.
Le troisième enjeu tient à la licence et à l’ouverture. Les poids sont accessibles sous une licence spécifique Qwen3.8-Max, qui ne doit pas être assimilée automatiquement à une licence open source standard.[3] Toute réutilisation professionnelle exige une lecture des conditions applicables, notamment pour la redistribution, les usages autorisés et les responsabilités.
Enfin, la documentation consultée ne fournit pas d’empreinte énergétique complète pour l’entraînement ou l’inférence. L’architecture MoE réduit la part de paramètres activés, mais cela ne suffit pas à démontrer un bénéfice environnemental global. La taille du modèle, les contextes longs et les trajectoires agentiques peuvent rester très coûteux en calcul. En l’absence de mesure publiée, il faut conserver cette incertitude.
Ce qu’il faudra observer maintenant
La portée réelle de Qwen3.8-Max dépendra de la reproduction indépendante de ses résultats, des retours en production et de la stabilité des performances sur les tâches longues. Il faudra aussi suivre les différences entre les versions, puisque la documentation mentionne déjà un instantané Qwen3.8-Max-0902 améliorant le codage, la collaboration entre agents et la compréhension visuelle.[2]
Le modèle montre qu’un système de très grande taille peut combiner poids disponibles et service cloud enrichi, sans que les deux offres soient strictement identiques. Cette hybridation est probablement plus structurante que le nombre brut de paramètres. Pour les organisations, la question centrale n’est pas de savoir si Qwen3.8-Max bat tous ses concurrents, mais s’il répond à un besoin mesurable avec un niveau acceptable de coût, de contrôle, de sécurité et de conformité.
Pour aller plus loin
Pour approfondir les transformations illustrées par Qwen3.8-Max, découvrez ces analyses consacrées aux modèles à poids ouverts, aux agents IA, à la souveraineté technologique et à la gestion des données.
Sources
[1] Alibaba Cloud, 3 août 2026, Alibaba Unveils Qwen3.8-Max: Its Largest and Most Capable Flagship Model to Date. Consulter la source
[2] Alibaba Cloud Model Studio, documentation Qwen3.8-Max, mise à jour le 11 septembre 2026, consultée le 22 septembre 2026. Consulter la documentation
[3] Qwen, fiche officielle Qwen3.8-2.4T-A95B sur Hugging Face, consultée le 22 septembre 2026. Consulter la fiche du modèle
[4] Arena Intelligence, Text Arena Leaderboard, état affiché au 13 septembre 2026. Consulter le classement
[5] The Verge, 3 août 2026, China’s Alibaba Takes Another Swipe at America’s AI Supremacy. Lire l’article

