Zeitachse: fünf Tage, drei Labore

An der Oberfläche widersprechen sich die Züge. DeepSeek hebt einzelne Tarifzeilen um bis zu 1100 % an. Alibaba legt in derselben Woche ein Flaggschiff mit 2,4 Billionen Parametern offen, das zuvor nie als Gewichtssatz erschien. Zhipu liefert GLM-5.3 und hebt Coding-Benchmarks um rund das Sechsfache — ohne neues Vortraining. Zusammen verschiebt sich der Wettbewerb von „wer ist billiger“ zu „wer setzt Stunde, Lizenz und Rechnung“.

DatumEreignis
16. Juli 2026Moonshot AI veröffentlicht Kimi K3 (2,8 Bio. Parameter); US-Sicherheitsinteresse war bereits da
2.–3. AugustAlibaba kündigt Qwen3.8-Max an und schaltet die gehostete API frei
10. AugustMeta liefert Muse Glimmer (30 Mrd., Apache 2.0) und kündigt offene Gewichte für Muse Spark 1.2 an
12. AugustAlibaba stellt Qwen3.8-2.4T-A95B auf Hugging Face / ModelScope; xAI liefert Grok 4.6
13. AugustDeepSeek-V4-Pro geht GA, Preiserhöhung ab 17. August; Google senkt Gemini 3.7 Flash
14. AugustZhipu liefert GLM-5.3 auf der 743-Mrd.-Basis von GLM-5.2
17. August, 00:00 PekingzeitNeue DeepSeek-Tarife gelten

Weiter gezoomt: Am 30. Juli senkte OpenAI die günstigste Stufe GPT-5.6 Luna um 80 %, am 6.–7. August wurde Luna Standard für kostenlose Konten mit unbegrenztem Text. Während chinesische Labore Preise anheben und Flaggschiff-Gewichte öffnen, verbilligen US-Labore die Konsumschicht. Das ist dieselbe Preisauseinandersetzung von zwei Enden.

Die Zahlen

DeepSeek-Tarif, Zeile für Zeile (ab 17. August, 00:00 Pekingzeit)

Spitzenzeiten: 9–12 Uhr und 14–18 Uhr Pekingzeit. Beträge in USD je 1 Mio. Tokens, umgerechnet zum Kurs der Quellennotiz. Wer Prompts an Drittanbieter-APIs schickt, bleibt für personenbezogene Daten in der DSGVO-Verantwortung — Zeitfenster ändern daran nichts.

PositionAltNebenzeit neuSpitze neuAnstieg Spitze
V4-Flash Cache-Hit Eingabe$0,0028$0,007$0,014~400 %
V4-Flash Cache-Miss Eingabe$0,14$0,21$0,42200 %
V4-Flash Ausgabe$0,28$0,63$1,26350 %
V4-Pro Cache-Hit Eingabe$0,0035$0,021$0,042~1100 %
V4-Pro Cache-Miss Eingabe$0,42$0,63$1,26200 %
V4-Pro Ausgabe$0,84$1,89$3,78350 %

Die Schlagzeile „1100 %“ gilt nur für Cache-Hit-Eingabe zur Spitze — die Zeile, die zuvor fast bei null lag. Ausgabe, die die meisten Rechnungen trägt, stieg um 350 %. Drittanalysen rechnen für eine schwere Last (rund 84 Mio. Tokens/Monat, überwiegend Nebenzeit, etwa 50 % Hits) mit etwa 1,8× statt mit der Headline.

Qwen3.8-2.4T-A95B: Eckdaten

Qwen3.8-Max, offener Checkpoint
Parameter2,4 Bio. gesamt / 95 Mrd. aktiv
ArchitekturMoE, 512 Experten, 10 geroutet + 1 geteilt
Kontext262.144 Tokens nativ, erweiterbar auf ~1,01 Mio.
Gehostetes Max1 Mio. Tokens Standard
Takt2. Aug. Vorschau → 3. API → 12. Gewichte
Internationale API$2 / $6 je 1 Mio. Tokens
Lizenzeigene Qwen3.8-Max License, nicht Apache 2.0

Erstmals öffnet Alibaba ein Max-Flaggschiff. Qwen3.5 / 3.6 / 3.7 Max blieben API-only.

GLM-5.3 gegen GLM-5.2: dieselbe Basis, nur Post-Training

BenchmarkGLM-5.2GLM-5.3Delta
Terminal-Bench 3.04,6 %28,3 %+23,7
DeepSWE v1.146,2 %66,9 %+20,7
Agents' Last Exam (CLI)23,8 %28,5 %+4,7
CyberGym77,2 %84,5 %+7,3
AutomationBench26,2 %48,2 %+22,0

Werte stammen von Zhipu. Eine unabhängige Wiederholung fehlt. Auf Terminal-Bench 3.0 liegen GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %) weiter vorn. Das ist erste Liga unter offenen Gewichten, kein Frontier-Sieg.

Neben der Spitzen-API: kontrollierbare lokale Last

Lokale Evals, Agenten und macOS-Toolchains auf einem dedizierten physischen Apple-Silicon-Knoten mit Root/sudo — Tagesmiete und Szenarien stehen bei RUVCLOUD.

Anwendungsfälle ansehen

Drei Strategien, drei Logiken

DeepSeek: von Pauschalpreis zu Tageszeit — Kapazität, kein Imagewechsel

Die bequeme Lesart lautet Margendruck. Die Tarifstruktur liest sich eher als erste sichtbare Compute-Rechnung. Der alte Flattarif funktionierte, solange GPU-Angebot die Nachfrage hielt. Als das Volumen exponentiell wuchs, wurde „flexiblere Lastverschiebung“ zur Umschreibung für knappe Spitzenkapazität.

Ein Detail, das internationale Texte oft auslassen: Zur Spitze liegt die offizielle API über mehreren Wiederverkäufern (GMI Cloud, Novita und andere listen V4 Pro derzeit unter dem neuen Spitzentarif). „Offiziell ist immer am günstigsten“ gilt nicht mehr.

Alibaba: Gewichte für das Ökosystem, Lizenz für die Erlösobergrenze

Die Freigabe ist kein schlichtes Geschenk. Der 2,4-Billionen-Checkpoint ist frei ladbar, die Lizenz ist nicht das permissive Apache 2.0 der kleineren Qwen-Modelle. Ein „Model-as-a-Service“- oder „AI-Work-Assistant“-Geschäft mit mehr als 50 Mio. USD in zwölf Monaten braucht eine gesonderte kommerzielle Lizenz. Produkte mit über 100 Mio. monatlich Aktiven oder über 20 Mio. USD Monatsumsatz müssen den Modellnamen sichtbar führen.

Gewichte gewinnen Entwickler — besonders international. Die Handvoll Firmen, die darauf ein Inferencing-Geschäft bauen können, bleibt verhandelbar. Meta Muse Glimmer unter uneingeschränktem Apache 2.0 ist eine andere Wette. „Open weights“ ist kein einheitlicher Grad.

Das Gerücht, Downloads aus den USA, der EU, dem Vereinigten Königreich und Südkorea seien verboten, ist falsch. Der veröffentlichte Text enthält keine Gebietsklausel. Die LICENSE-Datei schlägt den Ankündigungsthread.

GLM-5.3: kein neues Fundament, größeres Post-Training

Relevant ist das Verfahren: dieselbe 743-Mrd.-Basis wie GLM-5.2, kein Retraining, Terminal-Bench 3.0 von 4,6 % auf 28,3 % allein durch skalierte RL-Umgebungen. Wenn Vortraining abflacht, wird Post-Training-RL zum eigenen Hebel — mit deutlich niedrigerer Eintrittsschwelle als ein neues Foundation-Modell.

Vergleich: bleibt DeepSeek das günstigste Frontier-Modell?

ModellEingabe / 1 Mio.Ausgabe / 1 Mio.Offene Gewichte
DeepSeek V4-Pro (Spitze)$1,26$3,78Nein
DeepSeek V4-Pro (Nebenzeit)$0,63$1,89Nein
Qwen3.8-Max (internationale API)$2$6Ja (eigene Lizenz)
OpenAI GPT-5.6 Luna$0,20$1,20Nein
Claude Opus 5 (impliziert, Alibaba-Verhältnis)~$5~$25Nein

Kurz: nein. Die Nebenzeit bleibt klar unter Claude Opus 5, liegt aber nicht mehr am Boden der Tabelle. Internationale Qwen3.8-Max-Preise und Luna unterbieten die neue Nebenzeit auf mindestens einer Achse. „Chinesisches Modell = günstigstes Modell“ galt 2025 und Anfang 2026; als Annahme ist das unsicher.

Strittig oder ungeprüft

  • „1100 %“ ist rechnerisch korrekt und ohne Kontext irreführend. Nur Cache-Hit-Eingabe zur Spitze. Ausgabe: +350 %.
  • Zhenwu-M890-Inferenz stützt sich auf Finanzberichte, nicht auf Alibaba-Technikdokumente oder Drittbenchmarks. Ungeprüft.
  • „Schwere Cursor-Lücke“ durch GLM-5.3 kommt von VentureBeat und Zhipu. Technische Details fehlen. Herstellerangabe, nicht auditiert.
  • Vergeltungs-Exportkontrollen sind Medienvermutung, keine amtliche Mitteilung.

Zwei Preiskriege parallel

Seit etwa einem Monat liefern Chinas Top-Labore in einem Takt, den Finanzmedien „drei Updates pro Woche“ nennen — DeepSeek, Alibaba, Zhipu, zuvor Kimi K3 (16. Juli, 2,8 Bio.) und MiniMax H3. Die lokale Rahmung lautet: offene Gewichte erzwingen eine globale Neubepreisung.

US-Labore tun das Gegenteil in der Konsumschicht: OpenAI −80 % am 30. Juli, eine Woche später frei und unbegrenzt; Google am 13. August ein Coding-Modell zum halben Preis des drei Wochen alten Vorgängers. Oben: gestufte, höhere Preise und offene Flaggschiffe. Unten: frei und billig. Beides sind Strategien, nur an verschiedenen Trichtern.

Die geopolitische Schicht: Kimi K3 zog bereits US-Prüfinteresse. Alibabas Fenster für 2,4 Bio. Parameter wird als Sicherung internationaler Sichtbarkeit vor möglicher Verschärfung gelesen — Interpretation, kein Beleg. Zur Eval-Umgebung siehe die Sandbox-Escape-Zeitachse.

Preise, Lizenz und Benchmarks gelten zum Veröffentlichungsstand. Primärquellen: Hugging Face, ModelScope, Lizenzberichte bei der South China Morning Post.

Fazit

DeepSeek schreibt Knappheit in den Tarif. Alibaba tauscht Flaggschiff-Gewichte gegen Entwickler und behält die kommerzielle Decke. Zhipu zeigt, dass Post-Training-Skala ohne neues Fundament in die erste offene Liga reicht. Die Frage wechselt von „wer ist am billigsten“ zu „wer setzt Stunde, Lizenz und Rechnung“.

Wer Agenten, lokale Evals oder Nebenzeit-Batches auf echtem macOS braucht, stellt Spitzen-API und eigenes Rack in dieselbe Tabelle. Dedizierte physische Apple-Silicon-Knoten mit Root/sudo stehen auf der Preisseite; Tagesmiete ist der schnellere Weg, wenn die lokale Maschine die kontrollierbarere Zeile ist.

Häufige Fragen

Ist DeepSeek nach der Erhöhung noch günstiger als GPT-5.6 oder Claude?

Die Nebenzeit bleibt unter Claude Opus 5, ist aber nicht mehr das absolute Minimum. GPT-5.6 Luna ($0,20 / $1,20) und internationale Qwen3.8-Max-Preise ($2 / $6) unterbieten die neue Nebenzeit auf mindestens einer Achse. Für ein Frontier-Modell bleibt DeepSeek relativ günstig, nicht mehr pauschal am billigsten.

Darf ich Qwen3.8-Max-Gewichte kostenlos in einem kommerziellen Produkt nutzen?

Für die meisten Fälle ja — persönliche Projekte und interne Nutzung bleiben unberührt. Die Schwelle gilt für „Model-as-a-Service“ oder „AI Work Assistant“ mit über 50 Mio. USD in zwölf Monaten; dann braucht es eine gesonderte Lizenz. Über 100 Mio. MAU oder 20 Mio. USD Monatsumsatz erfordern die sichtbare Modellnennung.

Gilt ein Downloadverbot für die USA, die EU oder das Vereinigte Königreich?

Nein. Die veröffentlichte Lizenz enthält keine Gebietsbeschränkung. Die Grenzen hängen am Umsatz, nicht am Standort.

Was unterscheidet GLM-5.3 von GLM-5.2 wirklich?

Nichts auf der Basis — beide nutzen 743 Mrd. Parameter. Der Sprung um das Sechsfache auf Terminal-Bench 3.0 kommt allein aus skaliertem Reinforcement Learning im Post-Training.

Wird Meta das Flaggschiff wirklich öffnen, nicht nur Muse Glimmer?

Noch nicht. Muse Glimmer ist ein 30-Mrd.-Destillat. Zuckerberg hat offene Gewichte für das geschlossene Muse Spark 1.2 „bald“ angekündigt. Bis zur Lieferung bleibt das Absicht, kein Fakt.