Timeline: was passiert ist — und wann
Weiter ausgezoomt wird das Bild klarer: Am 30. Juli senkte OpenAI die Preise der günstigsten Stufe (GPT-5.6 Luna, minus 80 %), am 6.–7. August wurde Luna der kostenlose Default mit unbegrenzten Textchats. Während chinesische Labs Preise anheben und Flaggschiff-Gewichte öffnen, senken US-Labs Preise und gehen auf der Consumer-Schicht auf Free — zur selben Zeit. Das ist kein Zufall; es sind zwei Seiten desselben Preiswettbewerbs.
| Datum | Ereignis |
|---|---|
| 16. Juli 2026 | Moonshot AI veröffentlicht Kimi K3 als Open Weights (2,8T Parameter); US-Sicherheitsprüfung folgt |
| 2.–3. Aug. 2026 | Alibaba previewt Qwen3.8-Max, dann startet die gehostete API |
| 10. Aug. 2026 | Meta veröffentlicht Muse Glimmer (30B, Apache 2.0) und kündigt Open Weights für das Flaggschiff Muse Spark 1.2 an |
| 12. Aug. 2026 | Alibaba legt Qwen3.8-2.4T-A95B Open Weights auf Hugging Face/ModelScope; xAI liefert Grok 4.6 |
| 13. Aug. 2026 | DeepSeek-V4-Pro geht GA und kündigt eine Preiserhöhung zum 17. Aug. an; Google liefert rabattiertes Gemini 3.7 Flash |
| 14. Aug. 2026 | Zhipu liefert GLM-5.3 und nutzt die 743B-Basis von GLM-5.2 |
| 17. Aug. 2026, 00:00 Peking-Zeit | DeepSeeks neue Preise gelten |
Schlagzeilen-Prozente mischen Abrechnungspositionen: «11x», «über 1.100 %» und «350 %» sind alle korrekt — sie treffen Cache-Hit-Input, Output und Cache-Miss-Input.
Open Weights sind nicht Apache 2.0: Qwen3.8-Max nutzt eine eigene Lizenz, die bei großen kommerziellen Nutzern den Preishebel behält.
Dieselbe Basis, großer Sprung: GLM-5.3 hat das Foundation-Modell nicht neu trainiert; skaliertes Post-Training-RL hat die Arbeit gemacht.
«Chinesisches Modell = günstigstes» bricht: DeepSeek Off-Peak unterbietet Claude Opus 5 weiter, ist aber nicht mehr eindeutig die billigste Option.
Zwei Trichter, ein Monat: Chinesische Labs öffnen Flaggschiff-Gewichte und heben gestufte Preise; US-Labs gehen auf der Consumer-Schicht auf Free und Billig.
Die Zahlen: DeepSeek-Tarife, Qwen3.8-Specs, GLM-5.3-Scores
Das neue DeepSeek-Preisblatt gilt seit 00:00 Peking-Zeit am 17. August. Peak-Stunden sind 9–12 Uhr und 14–18 Uhr Peking-Zeit. Die Schlagzeile «1.100 %» trifft genau den Peak-Cache-Hit-Input — die Stufe, die zuvor am nächsten an kostenlos lag. Der Output-Preis, der die meisten realen Rechnungen bestimmt, stieg um 350 %.
| Abrechnungsposition (pro 1M Tokens) | Alter Preis | Neu Off-Peak | Neu Peak | Peak-Anstieg |
|---|---|---|---|---|
| V4-Flash Cache-Hit (Input) | ¥0,02 | ¥0,05 | ¥0,10 | ~400 % |
| V4-Flash Cache-Miss (Input) | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash Output | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro Cache-Hit (Input) | ¥0,025 | ¥0,15 | ¥0,30 | ~1.100 % |
| V4-Pro Cache-Miss (Input) | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro Output | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Qwen3.8-2.4T-A95B ist das erste Mal, dass Alibaba ein Max-Flaggschiff als Open Weights veröffentlicht; Qwen3.5/3.6/3.7 Max blieben API-only.
| Spec | Detail |
|---|---|
| Parameter | 2,4T gesamt, 95B aktiv pro Token (MoE, 512 Experts, 10 geroutet + 1 shared) |
| Kontextfenster | 262.144 Tokens nativ (offener Checkpoint), erweiterbar auf ~1,01M; gehostete Max-Version defaultet auf 1M |
| Release-Takt | Preview 2. Aug. → API live 3. Aug. → Open Weights 12. Aug. |
| API-Preis (international) | $2/M Input, $6/M Output |
| Lizenz | Nicht Apache 2.0 — eine eigene «Qwen3.8-Max License» |
Die GLM-Zahlen sind Zhipus eigene gemeldete Scores — ein unabhängiger Drittanbieter-Rerun liegt noch nicht vor. GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %); es ist ein Spitzenwert unter Open-Weight-Modellen, kein Frontier-Sieg.
| Benchmark | GLM-5.2 | GLM-5.3 | Änderung |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 Punkte |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 Punkte |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 Punkte |
| CyberGym | 77,2 % | 84,5 % | +7,3 Punkte |
| AutomationBench | 26,2 % | 48,2 % | +22,0 Punkte |
Unabhängige Kostenmodellierung zeigt: Ein realistischer Heavy-Usage-Workload (rund 84M Tokens/Monat, überwiegend Off-Peak, zur Hälfte Cache-Hits) landet näher bei 1,8× — real, aber weit unter den schärfsten Schlagzeilen.
Drei Strategien: DeepSeek, Alibaba und Zhipu
DeepSeek: vom Flattarif zu tageszeitabhängigen Preisen — das ist ein Kapazitätsproblem, keine Strategie-Kehre. Die einfachste Fehllektüre lautet: «Chinas günstigstes Modell ist dem Margendruck gewichen.» Die Tarifstruktur liest sich eher umgekehrt: Das Unternehmen macht Compute-Engpässe zum ersten Mal im Preisblatt sichtbar. Der alte, durchgängig billige Flattarif funktionierte als Kundengewinnung, solange GPU-Kapazität mit der Nachfrage mithielt. Als die Nutzung exponentiell wuchs und die Kapazität nicht, musste etwas explizit werden — und «flexiblere Workload-Planung anregen» in der offiziellen Ankündigung ist Konzernsprache für «Peak-Compute ist knapp, verschiebt die Last selbst».
Ein Detail, das die internationale Berichterstattung meist übersieht: Zu Peak-Stunden liegt DeepSeeks eigene offizielle API jetzt über mehreren Drittanbieter-Resellern (GMI Cloud, Novita und andere listen V4 Pro derzeit unter DeepSeeks neuem Peak-Satz). Die Annahme, «die offizielle API ist immer der günstigste Weg, DeepSeek zu fahren» — ein Kern der Reputation — gilt zum ersten Mal nicht mehr.
Alibaba: Open Weights kaufen Ecosystem-Goodwill; eine eigene Lizenz schützt die Umsatzdecke. Das Open-Weighting von Qwen3.8-Max ist keine schlichte Großzügigkeit. Alibaba hat zwei Dinge gleichzeitig getan: den vollständigen 2,4T-Parameter-Checkpoint zum freien Download veröffentlicht und eine eigene Lizenz angehängt — nicht das permissive Apache 2.0 der kleineren Qwen-Modelle. Jedes «Model-as-a-Service»- oder «AI Work Assistant»-Geschäft mit über $50 Millionen Umsatz in einem beliebigen 12-Monats-Zeitraum muss eine separate kommerzielle Lizenz verhandeln; Produkte mit 100M+ monatlich aktiven Nutzern oder $20M+ Monatsumsatz müssen den Modellnamen prominent zeigen.
Die Logik: Gewichte verschenken, um Entwickler-Mindshare zu gewinnen (besonders international, wo «Modell aus China» bei Enterprise-Käufern noch zögern auslöst), und den Preishebel bei der Handvoll Firmen behalten, die darauf ein konkurrierendes Inferenzgeschäft bauen können. Das ist eine andere Wette als Metas Muse Glimmer unter uneingeschränktem Apache 2.0 — «Open Weights» meint in beiden Releases nicht dasselbe.
Ein Gerücht, das explizit sterben sollte: Online kursierte die Behauptung, Alibabas Lizenz verbiete Downloads aus den USA, der EU, dem Vereinigten Königreich und Südkorea. Das ist falsch. Der veröffentlichte Lizenztext enthält keine geografische oder territoriale Klausel — eine nützliche Erinnerung, in einem so schnellen Release-Zyklus die Primärquelle zu prüfen (die LICENSE-Datei, nicht den Ankündigungs-Thread).
GLM-5.3: kein neues Basismodell, nur eine größere Post-Training-Wette — und das ist die eigentliche Story. Die interessanteste Tatsache zu GLM-5.3 ist nicht der Score, sondern die Methode: dieselbe 743B-Parameter-Basis wie GLM-5.2, kein Retraining, und rund 6× auf Terminal-Bench 3.0 (4,6 % → 28,3 %) allein durch skaliertes Reinforcement Learning im Post-Training. Das bestätigt einen Trend, der sich seit Monaten branchenweit aufbaut — während Pretraining-Skalierungsgesetze abnehmende Erträge zeigen, wird Post-Training-RL-Skalierung ein eigener Performance-Hebel mit deutlich niedrigerer Kostenschwelle als ein neues Foundation-Modell. Die Einstiegshürde sinkt, und genau deshalb können Mid-Tier-Labs ohne OpenAI-Compute-Budget bei agentischen und Coding-Benchmarks aufholen.
Hinweis: GLM-Scores der Vendor-Meldung als Selbstangabe behandeln, bis ein Drittanbieter-Rerun vorliegt. Die 28,3 % auf Terminal-Bench 3.0 sind ein Spitzenwert unter Open Weights, kein Frontier-Sieg gegen GPT-5.6 Sol oder Claude Fable 5.
Ist DeepSeek noch das günstigste Frontier-Modell?
RMB-zu-USD-Umrechnung bei ~¥7,15/$1, näherungsweise. Die kurze Antwort: nein. Auch nach der Erhöhung liegt DeepSeek V4-Pro Off-Peak weiter klar unter Claude Opus 5, ist aber nicht mehr eindeutig die billigste Option — sowohl der internationale Preis von Qwen3.8-Max als auch OpenAIs Luna unterbieten DeepSeeks Off-Peak-Satz. «Chinesisches Modell = günstigstes Modell» galt den Großteil von 2025 und Anfang 2026; das ist keine sichere Annahme mehr.
| Modell | Input (pro 1M Tokens) | Output (pro 1M Tokens) | Open Weights? |
|---|---|---|---|
| DeepSeek V4-Pro (Peak) | ¥9,0 (~$1,26) | ¥27,0 (~$3,78) | Nein |
| DeepSeek V4-Pro (Off-Peak) | ¥4,5 (~$0,63) | ¥13,5 (~$1,89) | Nein |
| Qwen3.8-Max (internationale API) | $2,00 | $6,00 | Ja (eigene Lizenz) |
| OpenAI GPT-5.6 Luna | $0,20 | $1,20 | Nein |
| Claude Opus 5 (impliziert, nach Alibabas eigenem Vergleichsverhältnis) | ~$5,00 | ~$25,00 | Nein |
Im größeren Rahmen wird ein Muster sichtbar. Ungefähr im vergangenen Monat haben Chinas Top-Labs Major-Releases in einem Takt ausgeliefert, den die inländische Finanzpresse «drei Modell-Updates pro Woche» (一周三更) nennt — DeepSeek, Alibaba und Zhipu, plus zuvor Moonshots Kimi K3 (Open Weights 16. Juli, 2,8T Parameter) und MiniMax H3. Chinesische Berichterstattung rahmt das breit als Open-Weight-Releases, die «eine globale Neubewertung der KI-Branche erzwingen».
US-Labs fahren auf der Consumer-Schicht den Gegenzug: OpenAI senkte die günstigste Stufe am 30. Juli um 80 % und machte das Modell eine Woche später (6.–7. Aug.) für alle Nutzer kostenlos und unbegrenzt; Google lieferte am 13. August ein coding-fokussiertes Modell zum halben Preis des drei Wochen alten Vorgängers. Während chinesische Labs Flaggschiff-Gewichte öffnen und am compute-knappen oberen Ende gestufte, höhere Preise einführen, rennen US-Labs am Consumer-Ende Richtung Free und Billig. Beides sind echte Strategien; sie optimieren nur unterschiedliche Teile des Trichters.
Es gibt auch eine geopolitische Schicht, die vorsichtig zu benennen ist. Moonshots Kimi-K3-Open-Weighting im Juli zog bereits US-Sicherheitsprüfung nach sich; dass Alibaba genau dieses Fenster nutzt, um ein 2,4T-Flaggschiff zu öffnen, lesen manche Analysten als Versuch, internationalen Mindshare und eine «technologische Parität»-Erzählung festzuziehen, bevor mögliche regulatorische Verschärfung greift. Das ist eine informierte Interpretation, kein bestätigter Fakt — aber Teil des Kontexts, der leicht unsichtbar bleibt, wenn man nur englischsprachige Tech-Presse liest, die diese Releases meist als isolierte Produktnews behandelt statt als nationales Muster.
Was umstritten ist, ein Sechs-Schritte-Rechnungsscheck und drei zitierbare Zahlen
Die Schlagzeile «1.100 %» ist technisch korrekt, ohne Kontext aber irreführend. Sie gilt nur für Peak-Cache-Hit-Input, die Stufe, die zuvor am nächsten bei null lag. Der Output-Preis — der Kostenblock, der die meisten realen Rechnungen dominiert — stieg um 350 %. Verschiedene Medien haben unterschiedliche Stufen zitiert, als wären sie die ganze Story.
Behauptungen, Qwen3.8-Max laufe auf Alibabas eigenen Zhenwu-M890-Chips (von mehreren chinesischen Finanzmedien als Beleg für einen vollständig inländischen Inferenz-Stack berichtet), hat Alibabas eigene technische Dokumentation oder Drittanbieter-Benchmarks nicht unabhängig bestätigt. Das als vendor-nah, unbestätigt behandeln, bis es bestätigt ist.
GLM-5.3s gemeldete Entdeckung einer «schweren Schwachstelle» in Cursor stammt aus der Berichterstattung von VentureBeat und Zhipus eigener Disclosure; konkrete technische Details der Schwachstelle sind nicht öffentlich, die Aussage also als vendor-seitig, nicht unabhängig auditiert lesen.
Berichte, Chinas Handelsministerium (MOFCOM) bereite möglicherweise gegnerische Exportkontrollen für KI-/Halbleitertechnik vor, sind spekulativ und stützen sich auf unbestätigte Medienberichte, nicht auf eine offizielle Ankündigung. Als Hintergrundkontext behandeln, nicht als feststehenden Fakt.
Vorsicht: Aktuelle offizielle Preise und Lizenzbedingungen vor einer Weiterveröffentlichung prüfen. Die oben als unbestätigt markierten Punkte (inländische Chip-Claims, der Cursor-Schwachstellenbericht und Exportkontroll-Gerüchte) sind nicht unabhängig bestätigt.
Abrechnungspositionen trennen: «1.100 %» nicht auf die ganze Rechnung legen. Alter vs. neuer Preis für Cache-Hit-Input, Cache-Miss-Input und Output getrennt erfassen.
Traffic auf Pekinger Peak-Fenster mappen: Peak ist 9–12 Uhr und 14–18 Uhr Peking-Zeit; Off-Peak kostet die Hälfte des Peak-Satzes. Lastverschiebung ändert die Rechnung für viele Teams stärker als ein Modellwechsel.
Cache-Hit-Rate messen: Cache-Hit-Input bleibt absolut günstig. Cache-Miss-Input und Output dominieren Heavy-Usage-Rechnungen.
Offiziellen Peak mit Resellern vergleichen: GMI Cloud, Novita und andere können DeepSeeks offiziellen Peak weiter unterbieten. «Offiziell ist immer am günstigsten» gilt nicht mehr.
Qwen-Lizenz vor dem Self-Hosting lesen: Persönliche und interne Nutzung bleiben weitgehend unberührt. Ein MaaS- oder AI-Work-Assistant-Geschäft über $50M in einem beliebigen 12-Monats-Zeitraum braucht eine separate kommerzielle Lizenz. Produkte mit 100M+ MAU oder $20M+ Monatsumsatz müssen den Modellnamen zeigen. Es gibt kein geografisches Verbot. Wer die Gewichte selbst hostet und dabei personenbezogene Daten verarbeitet, muss die Datenverarbeitung DSGVO-konform aufsetzen.
Evals und 24/7-Agenten auf einen Knoten legen, der Off-Peak verschieben kann: Laptops schlafen und verlieren Netz. Für isolierte Evals, Post-Training-Experimente oder iOS-CI zuerst ins Hilfezentrum.
V4-Pro Peak-Cache-Hit-Input ¥0,30 / 1M Tokens: Von ¥0,025, rund 1.100 %. Hierher kommt die Schlagzeilenzahl.
Qwen3.8-2.4T-A95B: 2,4T gesamt, 95B aktiv, 262K nativer Kontext; internationale API $2 Input / $6 Output pro Million Tokens.
GLM-5.3 Terminal-Bench 3.0: 4,6 % → 28,3 % (+23,7 Punkte) auf derselben 743B-Basis, ohne Retraining; weiter unter GPT-5.6 Sol mit 34,6 % und Claude Fable 5 mit 33,7 %.
Die schwachen Alternativen sind leicht zu benennen. Migration nach Schlagzeilen-Multiple überzeichnet die Rechnung für Off-Peak-Nutzer mit hoher Cache-Quote. Qwen-Gewichte wie Apache 2.0 behandeln fällt großen kommerziellen Deployments auf die Füße. 24/7-Evals und Agenten auf einem schlafenden Laptop stoßen an Netz- und Rechtegrenzen. Für eine stabilere Produktionsumgebung für iOS-CI/CD und AI-Agent-Automation ist KVMNODE Mac-Mini-Cloud-Miete meist die bessere Lösung: dediziertes Apple Silicon, sudo-Zugang, Mehrregionen-Knoten, Tages-/Wochen-/Monatslaufzeiten. Siehe Preise und die Bestellseite.
Stand: 17. August 2026. Quellen: DeepSeeks offizielle Preisankündigung, gegencheckt gegen Wall Street CN, IT Home, AIGC.cn und V2EX; Alibabas offizielle Qwen-Repositories (Hugging Face / ModelScope) und South China Morning Post zur Lizenz; Zhipu (Z.ai) GLM-5.3-Technikseite, plus VentureBeat und StableLearn; Meta AI Researchs offizieller Blog und VentureBeat zu Muse Glimmer; Yicai und Sohu Finance zum Takt von Chinas Open-Weight-Release-Zyklus.