En cinq jours, trois des principaux laboratoires d'IA chinois ont enchaîné des gestes qui, pris isolément, semblent se contredire. DeepSeek a relevé ses tarifs API jusqu'à 1 100 % sur certains paliers. Alibaba, la même semaine, a ouvert les poids d'un modèle phare à 2,4 T de paramètres qu'il n'avait jamais publié. Zhipu AI a livré GLM-5.3, faisant bondir les benchmarks de code d'environ 6x en réutilisant exactement le même modèle de base que son prédécesseur — sans réentraînement. Ensemble, ces trois mouvements indiquent que les labs chinois ne se battent plus seulement sur le prix, mais sur le pouvoir de tarifer. Cet article parcourt la chronologie, la grille tarifaire, les trois stratégies, puis un contrôle de facture en six étapes.
01

Chronologie : ce qui s'est passé, et quand

En reculant d'un cran, le tableau se précise : le 30 juillet, OpenAI a baissé de 80 % le tarif de son palier le moins cher (GPT-5.6 Luna), puis les 6–7 août a fait de Luna le défaut gratuit, avec des chats texte illimités. Autrement dit, pendant que les labs chinois relevaient leurs prix et ouvraient les poids de leurs modèles phares, les labs américains coupaient les tarifs et passaient en gratuité côté grand public — au même moment. Ce n'est pas un hasard ; ce sont les deux faces d'une même bataille tarifaire.

DateÉvénement
16 juillet 2026Moonshot AI ouvre les poids de Kimi K3 (2,8 T de paramètres), ce qui attire l'attention des autorités de sécurité américaines
2–3 août 2026Alibaba prévisualise, puis lance, Qwen3.8-Max en API hébergée
10 août 2026Meta publie Muse Glimmer (30B, Apache 2.0) et laisse entendre des poids ouverts pour le phare Muse Spark 1.2
12 août 2026Alibaba publie les poids ouverts de Qwen3.8-2.4T-A95B sur Hugging Face/ModelScope ; xAI livre Grok 4.6
13 août 2026DeepSeek-V4-Pro passe en GA et annonce une hausse effective le 17 août ; Google livre Gemini 3.7 Flash à tarif réduit
14 août 2026Zhipu livre GLM-5.3, en réutilisant la base 743B de GLM-5.2
17 août 2026, 00:00 heure de PékinLa nouvelle grille DeepSeek entre en vigueur
01

Les pourcentages des titres mélangent les postes de facturation : « 11x », « plus de 1 100 % » et « 350 % » sont tous exacts — ils correspondent respectivement à l'entrée cache-hit, à la sortie et à l'entrée cache-miss.

02

Poids ouverts n'égale pas Apache 2.0 : Qwen3.8-Max repose sur une licence maison qui conserve un levier tarifaire sur les gros usages commerciaux.

03

Même base, grand saut : GLM-5.3 n'a pas réentraîné le modèle de fondation ; c'est le RL de post-training, mis à l'échelle, qui a fait le travail.

04

« Modèle chinois = le moins cher » se fissure : DeepSeek hors pointe reste sous Claude Opus 5, mais n'est plus l'option la moins chère tout court.

05

Deux entonnoirs, un même mois : les labs chinois ouvrent les poids des phares et relèvent des tarifs étagés ; les labs américains vont vers le gratuit et le bon marché côté grand public.

02

Les chiffres : paliers DeepSeek, specs Qwen3.8, scores GLM-5.3

La nouvelle grille DeepSeek s'applique à 00:00 heure de Pékin le 17 août. Les heures de pointe sont 9h–12h et 14h–18h, heure de Pékin. Le chiffre « 1 100 % » des titres concerne spécifiquement l'entrée cache-hit en pointe — le palier qui partait le plus près de zéro. Le tarif de sortie, celui qui pèse le plus sur la plupart des factures réelles, a augmenté de 350 %.

Poste de facturation (pour 1M tokens)Ancien tarifNouveau hors pointeNouveau pointeHausse en pointe
V4-Flash cache hit (entrée)¥0.02¥0.05¥0.10~400%
V4-Flash cache miss (entrée)¥1.0¥1.5¥3.0200%
V4-Flash sortie¥2.0¥4.5¥9.0350%
V4-Pro cache hit (entrée)¥0.025¥0.15¥0.30~1,100%
V4-Pro cache miss (entrée)¥3.0¥4.5¥9.0200%
V4-Pro sortie¥6.0¥13.5¥27.0350%

Qwen3.8-2.4T-A95B est la première fois qu'Alibaba ouvre les poids d'un modèle de palier Max (phare) ; Qwen3.5/3.6/3.7 Max sont restés API uniquement.

SpécificationDétail
Paramètres2.4T au total, 95B actifs par token (MoE, 512 experts, 10 routés + 1 partagé)
Fenêtre de contexte262,144 tokens natifs (checkpoint ouvert), extensible à ~1.01M ; la version Max hébergée vaut 1M par défaut
Cadence de sortieAperçu 2 août → API en ligne 3 août → poids ouverts 12 août
Tarif API (international)$2/M entrée, $6/M sortie
LicencePas Apache 2.0 — une « Qwen3.8-Max License » maison

Ces chiffres GLM sont les scores déclarés par Zhipu — aucune re-exécution tierce indépendante n'a encore été publiée. GLM-5.3 reste derrière GPT-5.6 Sol (34.6 %) et Claude Fable 5 (33.7 %) sur Terminal-Bench 3.0 ; c'est un très bon résultat open-weight, pas une victoire frontier nette.

BenchmarkGLM-5.2GLM-5.3Écart
Terminal-Bench 3.04.6%28.3%+23.7 pts
DeepSWE v1.146.2%66.9%+20.7 pts
Agents' Last Exam (CLI)23.8%28.5%+4.7 pts
CyberGym77.2%84.5%+7.3 pts
AutomationBench26.2%48.2%+22.0 pts

Une modélisation de coût indépendante montre qu'une charge lourde réaliste (environ 84M tokens/mois, surtout hors pointe, moitié cache hits) voit une facture plutôt proche de 1.8x — réelle, mais loin des multiples les plus alarmistes des titres.

03

Trois stratégies : DeepSeek, Alibaba et Zhipu

DeepSeek : du tarif plat au tarif selon l'heure — un problème de capacité, pas un virage stratégique. La lecture la plus facile est « le modèle chinois le moins cher a fini par céder à la pression sur les marges ». En regardant la structure, c'est plutôt l'inverse : une entreprise qui, pour la première fois, rend visibles ses contraintes de calcul dans la grille. L'ancien tarif plat, toujours bas, fonctionnait comme outil d'acquisition tant que la capacité GPU suivait la demande. Une fois l'usage devenu exponentiel sans que la capacité suive, quelque chose devait devenir explicite — et « encourager une planification plus souple des charges » dans l'annonce officielle est du langage d'entreprise pour « notre calcul en pointe est désormais rare, décalez vous-mêmes vos charges ».

Un détail que la couverture internationale a surtout manqué : aux heures de pointe, le tarif de l'API officielle DeepSeek dépasse désormais plusieurs revendeurs tiers (GMI Cloud, Novita et d'autres listent aujourd'hui V4 Pro sous le nouveau tarif de pointe DeepSeek). L'idée que « l'API officielle est toujours le moyen le moins cher de faire tourner DeepSeek » — un pilier de sa réputation — est rompue pour la première fois.

Alibaba : les poids ouverts achètent la bienveillance de l'écosystème ; une licence maison protège le plafond de revenus. L'ouverture des poids de Qwen3.8-Max n'est pas un geste de générosité simple. Alibaba a fait deux choses en même temps : publier le checkpoint complet à 2.4T de paramètres en téléchargement libre, et y attacher une licence maison — pas l'Apache 2.0 permissive des plus petits Qwen — qui impose à toute activité « Model-as-a-Service » ou « AI Work Assistant » gagnant plus de $50 million sur une période de 12 mois de négocier une licence commerciale séparée, et qui impose aux produits à 100M+ d'utilisateurs actifs mensuels ou $20M+ de revenus mensuels d'afficher clairement le nom du modèle.

La logique : offrir les poids pour conquérir l'adhésion des développeurs (surtout à l'international, où un « modèle made in China » suscite encore une certaine réserve chez les acheteurs entreprise), tout en gardant un levier tarifaire sur la poignée d'acteurs réellement capables de monter un métier d'inférence concurrent par-dessus. C'est un pari nettement différent de Muse Glimmer de Meta, livré sous Apache 2.0 sans restriction — « poids ouverts » ne veut pas dire la même chose d'une sortie à l'autre.

Une rumeur à tuer nettement : des messages ont circulé selon lesquels la licence Alibaba interdirait les téléchargements depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud. C'est faux. Le texte publié ne contient aucune clause géographique ou territoriale — rappel utile que, dans un cycle de sorties aussi rapide, vérifier la source primaire (le fichier LICENSE, pas le fil d'annonce) prend quelques secondes et évite de répéter une affirmation déjà démentie.

GLM-5.3 : pas de nouvelle base, seulement un plus gros pari de post-training — et c'est là l'histoire. Le fait le plus intéressant sur GLM-5.3 n'est pas le score, c'est la méthode : même base à 743B de paramètres que GLM-5.2, pas de réentraînement, et un saut d'environ 6x sur Terminal-Bench 3.0 (4.6 % → 28.3 %) uniquement en mettant à l'échelle les environnements d'apprentissage par renforcement en post-training. Cela confirme une tendance qui se construit depuis des mois dans l'industrie : à mesure que les lois d'échelle du préentraînement montrent des rendements décroissants, l'échelle du RL de post-training devient un levier de performance indépendant, avec un plancher de coût bien plus bas que le réentraînement d'un nouveau modèle de fondation. La barrière d'entrée baisse vraiment, et c'est pourquoi des labs de milieu de tableau, sans budget de calcul à l'échelle d'OpenAI, peuvent encore rattraper sur les benchmarks agentiques et de code.

Note : Traitez les scores GLM déclarés par l'éditeur comme auto-déclarés jusqu'à une re-exécution tierce. Le 28.3 % sur Terminal-Bench 3.0 est un très bon marqueur open-weight, pas une victoire frontier sur GPT-5.6 Sol ou Claude Fable 5.

04

DeepSeek reste-t-il le modèle frontier le moins cher ?

Conversion RMB–USD à ~¥7.15/$1, approximative. La réponse courte : non. Même après la hausse, le tarif hors pointe de DeepSeek V4-Pro reste bien sous Claude Opus 5, mais ce n'est plus l'option la moins chère sur la table — le tarif international de Qwen3.8-Max et Luna d'OpenAI passent tous deux sous le hors pointe DeepSeek. « Modèle chinois = modèle le moins cher » valait pour l'essentiel de 2025 et du début 2026 ; ce n'est plus une hypothèse sûre.

ModèleEntrée (pour 1M tokens)Sortie (pour 1M tokens)Poids ouverts ?
DeepSeek V4-Pro (pointe)¥9.0 (~$1.26)¥27.0 (~$3.78)Non
DeepSeek V4-Pro (hors pointe)¥4.5 (~$0.63)¥13.5 (~$1.89)Non
Qwen3.8-Max (API internationale)$2.00$6.00Oui (licence maison)
OpenAI GPT-5.6 Luna$0.20$1.20Non
Claude Opus 5 (implicite, selon le ratio de comparaison d'Alibaba)~$5.00~$25.00Non

Remis dans un cadre plus large, un motif se dessine. Sur à peu près le mois écoulé, les principaux labs chinois ont enchaîné des sorties majeures à un rythme que la presse financière intérieure a commencé à appeler « trois mises à jour de modèle par semaine » (一周三更) — DeepSeek, Alibaba et Zhipu, plus Kimi K3 de Moonshot (poids ouverts le 16 juillet, 2,8 T de paramètres) et MiniMax H3 avant eux. La couverture chinoise présente largement cela comme des sorties open-weight chinoises qui « forcent une revalorisation mondiale de l'industrie de l'IA ».

Pendant ce temps, les labs américains jouent l'inverse côté grand public : OpenAI a coupé de 80 % le tarif de son palier le moins cher (30 juillet) puis a rendu ce modèle gratuit et illimité pour tous une semaine plus tard (6–7 août) ; Google a livré un modèle orienté code à la moitié du prix de son prédécesseur vieux de trois semaines (13 août). Ainsi, pendant que les labs chinois ouvrent les poids des phares et introduisent des tarifs étagés, plus élevés, sur le haut de gamme contraint en calcul, les labs américains courent vers le gratuit et le bon marché côté consommateur. Les deux stratégies sont réelles ; elles optimisent simplement des parties différentes de l'entonnoir.

Il y a aussi une couche géopolitique à nommer avec soin. L'ouverture des poids de Kimi K3 de Moonshot en juillet a déjà attiré l'attention des autorités de sécurité américaines ; le choix par Alibaba de cette fenêtre précise pour ouvrir un phare à 2.4T a été lu par certains analystes comme une manière de verrouiller l'adhésion internationale et un récit de « parité technologique » avant un éventuel durcissement réglementaire. C'est une interprétation informée, pas un fait confirmé — mais c'est une part du contexte difficile à voir si l'on ne lit que la presse tech anglophone, qui a surtout traité ces sorties comme des news produit isolées plutôt que comme un motif national coordonné.

05

Points contestés, contrôle de facture en six étapes, trois chiffres citables

Le titre « 1 100 % » est techniquement exact mais trompeur sans contexte. Il ne s'applique qu'à l'entrée cache-hit en heures de pointe, le palier qui partait le plus près de zéro. Le tarif de sortie — le coût qui domine la plupart des factures réelles — a augmenté de 350 %. Des médias différents ont cité des paliers différents comme s'il s'agissait de toute l'histoire.

Les affirmations selon lesquelles Qwen3.8-Max tourne sur les puces maison Zhenwu M890 d'Alibaba (rapportées par plusieurs médias financiers chinois comme preuve d'une pile d'inférence entièrement en silicium domestique) n'ont pas été confirmées de façon indépendante par la documentation technique d'Alibaba ni par des benchmarks tiers. Traitez cela comme un reportage proche du fournisseur, non vérifié, jusqu'à confirmation.

La découverte rapportée par GLM-5.3 d'une « vulnérabilité grave » dans Cursor vient du reportage de VentureBeat et de la propre divulgation de Zhipu ; les détails techniques précis de la vulnérabilité n'ont pas été rendus publics, donc l'affirmation doit se lire comme un constat de sécurité issu du fournisseur, non audité de façon indépendante.

Les reportages selon lesquels le ministère du Commerce chinois (MOFCOM) préparerait des contrôles d'exportation de rétorsion sur les technologies IA/semi-conducteurs sont spéculatifs et sourcés à des médias non confirmés, pas à une annonce officielle. Traitez cela comme un contexte de fond, pas comme un fait établi.

Prudence : Vérifiez les derniers tarifs officiels et les termes de licence avant de republier. Les points signalés ci-dessus comme non vérifiés (affirmations sur les puces domestiques, le rapport de vulnérabilité Cursor et les rumeurs de contrôle d'exportation) n'ont pas été confirmés de façon indépendante.

01

Séparez les postes de facturation : N'appliquez pas « 1 100 % » à toute la facture. Notez ancien vs nouveau tarif pour l'entrée cache-hit, l'entrée cache-miss et la sortie, séparément.

02

Projetez le trafic sur les fenêtres de pointe de Pékin : La pointe est 9h–12h et 14h–18h, heure de Pékin ; hors pointe vaut la moitié du tarif de pointe. Décaler la charge change plus la facture que changer de modèle, pour beaucoup d'équipes.

03

Mesurez le taux de cache-hit : L'entrée cache-hit reste bon marché en valeur absolue. L'entrée cache-miss et la sortie dominent les factures à usage lourd.

04

Comparez la pointe officielle aux revendeurs : GMI Cloud, Novita et d'autres peuvent encore passer sous la pointe officielle DeepSeek. « L'officiel est toujours le moins cher » ne tient plus.

05

Lisez la licence Qwen avant de self-héberger : L'usage personnel et interne est largement indemne. Une activité MaaS ou AI Work Assistant au-delà de $50M sur une période de 12 mois exige une licence commerciale séparée. Les produits à 100M+ MAU ou $20M+ de revenus mensuels doivent afficher le nom du modèle. Il n'y a aucune interdiction géographique.

06

Placez évals et agents 24/7 sur un nœud capable de basculer hors pointe : Les portables s'endorment et perdent le réseau. Pour des évals isolées, des expériences de post-training ou de la CI iOS, commencez par le centre d'aide.

A

Entrée cache-hit V4-Pro en pointe ¥0.30 / 1M tokens : En hausse depuis ¥0.025, environ 1 100 %. C'est de là que vient le chiffre des titres.

B

Qwen3.8-2.4T-A95B : 2.4T au total, 95B actifs, contexte natif 262K ; API internationale $2 entrée / $6 sortie par million de tokens.

C

GLM-5.3 Terminal-Bench 3.0 : 4.6 % → 28.3 % (+23.7 pts) sur la même base 743B, sans réentraînement ; toujours sous GPT-5.6 Sol à 34.6 % et Claude Fable 5 à 33.7 %.

Les mauvaises alternatives se nomment facilement. Migrer sur le multiple des titres surestime la facture pour les usages hors pointe à fort cache. Traiter les poids Qwen comme Apache 2.0 fera trébucher les grands déploiements commerciaux. Faire tourner 24/7 des évals et des agents sur un portable qui s'endort bute sur le réseau et les privilèges. Pour un environnement de production plus stable, adapté à la CI/CD iOS et à l'automatisation d'agents IA, la location cloud Mac Mini KVMNODE est en général le meilleur choix : Apple Silicon dédié, accès sudo, nœuds multi-régions, formules jour/semaine/mois. Voir tarifs et la page de commande.

Au 17 août 2026. Sources : annonce tarifaire officielle DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn et V2EX ; dépôts officiels Qwen d'Alibaba (Hugging Face / ModelScope) et reportage du South China Morning Post sur les termes de licence ; page technique GLM-5.3 de Zhipu (Z.ai), plus VentureBeat et StableLearn ; blog officiel de Meta AI Research et VentureBeat sur Muse Glimmer ; Yicai et Sohu Finance sur le rythme du cycle de sorties open-weight chinois.