Chronologie : cinq jours, trois laboratoires
En surface, les gestes se contredisent. DeepSeek annonce jusqu'à 1 100 % sur certaines lignes. Alibaba, la même semaine, publie un checkpoint fleuron jamais ouvert. Zhipu livre GLM-5.3 et multiplie les scores de coding sans réentraîner le socle. Les trois mouvements se lisent comme un basculement : de la guerre des prix vers le pouvoir de tarifer.
| Date | Événement |
|---|---|
| 16 juillet 2026 | Moonshot AI ouvre Kimi K3 (2,8 billions de paramètres), déjà sous regard sécuritaire américain |
| 2–3 août | Alibaba préannonce puis lance Qwen3.8-Max en API hébergée |
| 10 août | Meta publie Muse Glimmer (30B, Apache 2.0) et évoque l'ouverture de Muse Spark 1.2 |
| 12 août | Alibaba met Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6 |
| 13 août | DeepSeek-V4-Pro passe en GA et annonce la hausse au 17 août ; Google baisse Gemini 3.7 Flash |
| 14 août | Zhipu livre GLM-5.3 sur le socle 743B de GLM-5.2 |
| 17 août, 00:00 heure de Pékin | Les nouveaux tarifs DeepSeek s'appliquent |
En reculant encore : le 30 juillet, OpenAI baisse de 80 % son palier le moins cher, GPT-5.6 Luna ; les 6–7 août, Luna devient le modèle par défaut des comptes gratuits, texte illimité. Pendant que les labos chinois ajoutent hausse et ouverture, les labos américains ajoutent gratuité et baisse côté grand public. Ce n'est pas un hasard : deux faces du même combat tarifaire.
Les chiffres
Grille DeepSeek (au 17 août, 00:00 heure de Pékin)
Heures de pointe : 9 h–12 h et 14 h–18 h à Pékin. Montants en dollars par million de tokens, convertis au taux de la note source.
| Poste | Ancien | Heures creuses | Pointe | Hausse pointe |
|---|---|---|---|---|
| V4-Flash entrée cache hit | $0,0028 | $0,007 | $0,014 | ~400 % |
| V4-Flash entrée cache miss | $0,14 | $0,21 | $0,42 | 200 % |
| V4-Flash sortie | $0,28 | $0,63 | $1,26 | 350 % |
| V4-Pro entrée cache hit | $0,0035 | $0,021 | $0,042 | ~1 100 % |
| V4-Pro entrée cache miss | $0,42 | $0,63 | $1,26 | 200 % |
| V4-Pro sortie | $0,84 | $1,89 | $3,78 | 350 % |
Le « 1 100 % » des titres ne vise que l'entrée cache hit en pointe — la ligne qui partait de presque zéro. La sortie, qui pèse sur la plupart des factures, monte de 350 %. Des modèles tiers estiment qu'une charge lourde (environ 84 M de tokens/mois, surtout en heures creuses, moitié de hits) voit plutôt ~1,8×.
Qwen3.8-2.4T-A95B : spécifications
C'est la première fois qu'Alibaba ouvre un modèle Max (fleuron). Qwen3.5 / 3.6 / 3.7 Max restaient API only — un choix qui parle aussi aux équipes Apple qui comparent inférence distante et poste local.
GLM-5.3 contre GLM-5.2 : même socle, post-entraînement seul
| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 |
| CyberGym | 77,2 % | 84,5 % | +7,3 |
| AutomationBench | 26,2 % | 48,2 % | +22,0 |
Chiffres auto-déclarés par Zhipu, sans rerun tiers publié. Sur Terminal-Bench 3.0, GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %) restent devant. Premier peloton open-weight, pas un sacre frontier.
Hors pointe API : un Mac physique dédié
Évals locales, agents et chaînes Xcode sur un nœud Apple Silicon exclusif, Root/sudo complet, facturé au jour — les cas d'usage RUVCLOUD détaillent le flux.
Trois stratégies
DeepSeek : du forfait bas au tarif horaire — un problème de capacité
La lecture facile parle de marge. La structure dit plutôt : la contrainte de calcul devient visible sur la grille. L'ancien tarif plat tenait tant que les GPU suivaient. Quand le volume a explosé, « encourager un ordonnancement plus souple » a signifié « la pointe manque, décalez vous-mêmes ».
Détail souvent omis : en pointe, l'API officielle dépasse plusieurs revendeurs (GMI Cloud, Novita et d'autres affichent encore V4 Pro sous le nouveau tarif de pointe). « L'officiel est toujours le moins cher » ne tient plus.
Alibaba : les poids achètent l'écosystème, la licence protège le plafond
L'ouverture n'est pas un don simple. Le checkpoint 2,4 billions se télécharge, mais la licence n'est pas l'Apache 2.0 des petits Qwen. Un métier « Model-as-a-Service » ou « AI Work Assistant » à plus de 50 millions de dollars sur douze mois doit négocier une licence commerciale. Un produit à plus de 100 millions d'actifs mensuels ou 20 millions de dollars de revenu mensuel doit afficher le nom du modèle.
Les poids gagnent les développeurs, surtout hors de Chine. Les quelques acteurs capables d'y monter un métier d'inférence restent sous levier. Muse Glimmer, Apache 2.0 sans clause, n'est pas le même degré d'« open weights ».
La rumeur d'une interdiction de téléchargement pour les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud est fausse. Le texte publié n'a aucune clause territoriale. Le fichier LICENSE suffit.
GLM-5.3 : pas de nouveau socle, un pari post-entraînement plus large
L'intérêt n'est pas le score, c'est la méthode : même base 743B que GLM-5.2, pas de réentraînement, Terminal-Bench 3.0 de 4,6 % à 28,3 % en élargissant les environnements RL. Quand le préentraînement s'essouffle, l'échelle du post-entraînement devient un levier autonome, moins cher qu'un nouveau fondationnel.
Comparatif : DeepSeek reste-t-il le fleuron le moins cher ?
| Modèle | Entrée / 1 M | Sortie / 1 M | Poids ouverts |
|---|---|---|---|
| DeepSeek V4-Pro (pointe) | $1,26 | $3,78 | Non |
| DeepSeek V4-Pro (heures creuses) | $0,63 | $1,89 | Non |
| Qwen3.8-Max (API internationale) | $2 | $6 | Oui (licence propre) |
| OpenAI GPT-5.6 Luna | $0,20 | $1,20 | Non |
| Claude Opus 5 (ratio Alibaba) | ~$5 | ~$25 | Non |
Réponse courte : non. Les heures creuses restent sous Claude Opus 5, mais plus au plancher. Qwen3.8-Max international et Luna sous-cotent la nouvelle creuse sur au moins un axe. « Modèle chinois = moins cher » valait en 2025 et début 2026 ; ce n'est plus une hypothèse sûre.
Points contestés ou non vérifiés
- « 1 100 % » est exact et trompeur sans contexte. Uniquement l'entrée cache hit en pointe. Sortie : +350 %.
- Inférence sur puces Zhenwu M890 : reprises financières, pas de doc technique Alibaba ni benchmark tiers. Non vérifié.
- Faille « grave » Cursor via GLM-5.3 : VentureBeat et Zhipu. Détails techniques absents. Source vendeur, non auditée.
- Contrôles d'exportation de rétorsion : spéculation médiatique, pas d'annonce officielle.
Deux guerres de prix en parallèle
Depuis environ un mois, les labos chinois en tête publient à un rythme que la presse financière locale appelle « trois mises à jour par semaine » — DeepSeek, Alibaba, Zhipu, plus Kimi K3 (16 juillet, 2,8 billions) et MiniMax H3. Le cadrage local : les poids ouverts forcent une re-tarification mondiale.
Les labos américains font l'inverse côté grand public : −80 % chez OpenAI le 30 juillet, puis gratuit et illimité une semaine plus tard ; Google, le 13 août, un modèle coding à la moitié du prix de son prédécesseur de trois semaines. En haut : tarifs étagés et fleurons ouverts. En bas : gratuit et bas. Deux stratégies, deux étages du tunnel.
Couche géopolitique : Kimi K3 a déjà attiré un regard américain ; la fenêtre Alibaba pour 2,4 billions se lit parfois comme un ancrage d'influence avant un durcissement possible — interprétation, pas fait établi. Pour l'environnement d'évaluation, voir la chronologie des évasions de sandbox.
Tarifs, licence et benchmarks reflètent l'information publique à la parution. Entrées primaires : Hugging Face, ModelScope, clauses chez South China Morning Post.
En conclusion
DeepSeek inscrit la pénurie sur la grille. Alibaba échange un fleuron contre l'esprit développeur et garde le plafond commercial. Zhipu montre qu'une échelle de post-entraînement, sans nouveau socle, suffit à entrer dans le premier peloton ouvert. La question bascule de « qui est le moins cher » à « qui fixe l'heure, la licence et la facture ».
Si l'équipe a encore besoin d'un vrai macOS pour agents, évals locales ou lots en heures creuses, pointe API et baie maison appartiennent à la même feuille. Les nœuds Apple Silicon physiques dédiés, Root/sudo compris, sont sur la page tarifs ; on peut louer au jour quand la machine locale est la ligne la plus contrôlable.
Pour aller plus loin
FAQ
DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude ?
Les heures creuses restent sous Claude Opus 5, mais plus au plancher. GPT-5.6 Luna ($0,20 / $1,20) et Qwen3.8-Max international ($2 / $6) sous-cotent la nouvelle creuse sur au moins un axe. Relativement bon marché pour un fleuron, plus le moins cher tout court.
Puis-je utiliser les poids Qwen3.8-Max gratuitement dans un produit commercial ?
Oui dans la plupart des cas — projets personnels et usage interne. Le seuil vise un métier « Model-as-a-Service » ou « AI Work Assistant » à plus de 50 millions de dollars sur douze mois. Au-delà de 100 millions de MAU ou 20 millions de dollars de revenu mensuel, le nom du modèle doit être visible.
Le téléchargement est-il interdit aux États-Unis, à l'UE ou au Royaume-Uni ?
Non. Aucune restriction géographique dans le texte publié. Les limites tiennent au chiffre d'affaires, pas au lieu.
Quelle est la vraie différence entre GLM-5.3 et GLM-5.2 ?
Aucune au niveau du socle — 743 milliards de paramètres des deux côtés. Le saut d'environ 6× sur Terminal-Bench 3.0 vient du RL élargi en post-entraînement, sans réentraînement du fondationnel.
Meta ouvrira-t-il vraiment le fleuron, pas seulement Muse Glimmer ?
Pas encore. Muse Glimmer est un distillat 30B. Zuckerberg a dit que les poids de Muse Spark 1.2 arriveraient « bientôt ». Tant que la livraison n'a pas lieu, c'est une intention, pas un fait.