Ist Qwen3.8-Max Open Source oder nur API?
Kurz: Derzeit nicht. Am 3. August 2026 machte Alibaba sein Qwen-Flaggschiff Qwen3.8-Max per Cloud-API GA-verfügbar und launchte das Agent-Produkt „Qwen Office“. 2,4T Gesamtparameter, 95B aktiv, 1M Token Kontext, sparse MoE. Die Website zeigt „Open-Source“, aber auf Hugging Face und ModelScope gibt es kein Repo, keine Lizenz und kein festes Datum — nur das Versprechen „nächste Woche“ (erwartet um den 10. August).
| Datum | Meilenstein | Kernpunkt |
|---|---|---|
| 16. Juli | Kimi K3 API | Moonshot veröffentlicht 2,8T-MoE, betont unabhängige Benchmarks |
| 19. Juli | Qwen-Preview | Qwen3.8-Max-Preview, 10 % des Endpreises, keine Aktiv-Parameter, Produktions-Automation verboten |
| 27. Juli | K3-Gewichte | Kimi K3 vollständige Gewichte auf Hugging Face, MoonEP etc. offen |
| 31. Juli | DeepSeek V4-Flash | Gleiche Parameterzahl, bessere Agent-/Code-Benchmarks als V4-Pro |
| 3. August | Qwen3.8-Max GA | Volle Benchmark-Tabelle, Qwen Office, API $2/$6, Alibaba +7 % HK, +4,5 % US |
„Open-Source“-Label mit Gewichten verwechseln: Seit GA-Tag steht Open-Source auf der Site — das Repo fehlt noch.
Vendor-Benchmarks als verifiziert lesen: PaperBench, RecreationBench etc. sind Alibaba-eigen; keine GA-Reproduktion von Artificial Analysis oder Arena.
Preview-Transparenzlücken ignorieren: Die 19.-Juli-Preview hatte kein Model Card, keine Safety-Eval, keine Aktiv-Parameter.
2,4T Gesamt mit Inferenzkosten gleichsetzen: Aktiv sind 95B — API-Preis folgt dem Aktiv-Count, lokales Full-Deploy ist Datacenter-Sache.
Produktions-Migration vor Gewicht-Release: Blindtest Kimi K3 83, Qwen-Preview 80 — Gleichstand, kein klarer Sieger.
Qwen3.8-Max-Specs und Wettbewerber-Matrix
| Spec | Wert |
|---|---|
| GA-Datum | 3. August 2026 |
| Gesamt / aktiv | 2,4T / 95B |
| Architektur | sparse MoE + Hybrid-Attention auf Qwen3.5-Basis |
| Kontext | 1M Token (≈983K mit Thinking; 131K Max-Output) |
| Input-Modi | Text, Bild, Video |
| API-Preis | $2 / $6 pro M Input/Output (impliziter Cache $0,25, explizit Write $2,50, Read $0,17) |
| Arena Text | #5, 1.496 Punkte (Preliminary), einziges Nicht-Anthropic in Top 8 |
| Arena Vision | #2, hinter Claude Fable 5 |
| Gewichte | „Nächste Woche“ versprochen, nicht live |
| Modell | Gesamt / aktiv | Kontext | Preis (in/out $/M) | Gewichte | Unabhängiger Benchmark |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 1M | $2 / $6 | Versprochen, nicht shipped | Keiner |
| Kimi K3 | 2,8T / ~50B | ~1,05M | $3 / $15 | 27. Juli shipped | AA Index ≈57,11 |
| DeepSeek V4-Pro | 1,6T / 49B | 1M | Nicht voll publiziert | Shipped | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | wie V4-Pro | 1M | Nicht voll publiziert | Shipped | 9 Benchmarks über V4-Pro |
| Claude Opus 5 | Unbekannt | 1M | $5 / $25 | Geschlossen | Arena Top-Tier |
| Claude Fable 5 | Unbekannt | 1M | $10 / $50 | Geschlossen | Arena Text #1 |
Alibaba-eigene Runs: PaperBench 93,0, OSWorld-Verified 86,1, SWE-bench Pro 67,7 (hinter Fable 5 80,0 und Opus 4.8 69,2), HLE 43,6 (Fable 5 53,3). Eine Fußnote im Vergleichstabelle deutet Fallback bei Fable 5 an — Alibabas Methodik ist gleichermaßen nicht Drittanbieter-reproduzierbar veröffentlicht.
Unter der Haube: sparse MoE und Langzeit-Autonomie
Warum sparse MoE statt nur skalieren? Qwen3.8-Max hält 2,4T Gesamtparameter bei nur 95B aktiv pro Token. Inferenzkosten folgen dem Aktiv-Count — daher API $2/$6, deutlich unter Claude Opus 5 ($5/$25) und Fable 5 ($10/$50). Architektur-Effizienz als Preishebel, nicht Rohskalierung als Capability-Hebel.
reasoning_effort in drei Stufen (low / medium / xhigh, Default xhigh) ist ein Kosten-Dial. Über enable_thinking oder Anthropic-kompatibles reasoning.effort steuerbar.
Langzeit-Autonomie ist der Headline-Pitch: 16-tägiges Coding ohne Aufsicht, 500+ Schritte Chip-Design, RecreationBench (Black-Box-Rebuild ohne Netz/Quellcode). Alles auf Alibaba-eigenen Suites; partieller Trace auf GitHub qwen-code-dev-bot/oh-my-cli, aber kein unabhängig auditiertes Vollreprodukt.
Die API unterstützt OpenAI- und Anthropic-kompatible Protokolle — Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw per base-URL-Swap. Qwen Office konkurriert mit Tencent WorkBuddy und Kimi Work.
Im einzigen verfügbaren blinden Vergleich (269-Dateien-Architektur-Task) erreichte Kimi K3 83/100, Qwen3.8-Max-Preview 80/100 — Gleichstand auf realem Workload, kein klarer Dominator. K3 hat öffentliche Gewichte und AA-Score; Qwen punktet mit niedrigerem API-Preis und breiterem Multimodal-Support.
API-Deployment-Checkliste und OpenAI-SDK
Qwen3.8-Max ist per API nutzbar, Gewichte fehlen. Vor Produktions-Migration: A/B auf eigenem Workload. EU-Nutzer: Cloud-API-Verarbeitung in China kann DSGVO-Datenresidenz und Auftragsverarbeitung betreffen — Legal prüfen.
API-Key bei QwenCloud / DashScope: Key in Alibaba Cloud Model Studio, base_url https://dashscope.aliyuncs.com/compatible-mode/v1, Modell-ID qwen3.8-max.
„Open-Source“-Label prüfen: Repo, Lizenz und Ship-Datum in offizieller Ankündigung bestätigen, bevor Self-Hosting geplant wird.
OpenAI-SDK-kompatible Integration: Meist reichen base URL und API-Key-Wechsel.
reasoning_effort anpassen: low/medium für einfache Tasks; xhigh nur für tiefe Reasoning-Pfade.
Cache-Prefix optimieren: System-Prompts und Tool-Definitionen wiederverwenden für impliziten Cache $0,25/M.
Lokales Deploy: Full 2,4T ist Multi-Node-Datacenter; realistischer Ziel ist das parallel versprochene Qwen3.8-27B Open Weight.
from openai import OpenAI
client = OpenAI(
api_key="your_dashscope_api_key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Analysiere die Komplexität dieses Codes..."}]
)Branchenkontext und drei harte Zahlen
2026 war das Jahr der Trillionen-Parameter-Expansion — doch DeepSeek V4-Flash am 31. Juli verbesserte Agent- und Code-Scores ohne mehr Parameter und hinterfragt die „nur skalieren“-Narrative. Alibaba verspricht erstmals Open Weights für eine Max-Klasse und reiht sich neben Kimi K3 und DeepSeek in die chinesische Open-Weight-Wende ein.
Konsumentenwinkel: Qwen treibt Apple Intelligence in China — komprimierter Checkpoint unter 4 GB on-device auf iPhone 15+. Am 4. August diskutierte das Weiße Haus mit OpenAI, Anthropic, Google und Meta ein neues voluntäres Cybersecurity-Test-Framework nach Agent-Sandbox-Breaches — chinesische Open-Weight-Race und US-Regulierung in derselben Woche.
2,4T / 95B aktiv: Spitzen-Gesamtparameter, Inferenz folgt 95B — API $2/$6 unter Opus 5 und Fable 5.
1.496 / Arena #5: Text vorläufig #5, Vision #2 — GA-Reproduktion fehlt.
+7 % / +4,5 %: Alibaba-Aktien am GA-Tag — Markt liest Narrativ-Rückkehr, nicht Routine-Update.
Praktische Alternativen haben versteckte Kosten: Agent-Toolchains 24/7 auf einem privaten Mac scheitern an Sleep und Netz-Ausfällen; Multi-Modell-A/B und iOS-CI brauchen stabile dedizierte Compute. Für Produktions-Pipelines ist KVMNODE dedizierte Mac Mini M4 Cloud-Miete meist die bessere Wahl: natives Apple Silicon, volles sudo, flexible Tages-/Wochen-/Monats-Tarife. Siehe Preisseite, Hilfezentrum oder direkt bestellen.
Datenstand 4. August 2026 · Quellen: Alibaba Cloud, Arena.ai, qwen.ai, Apidog, TechNode, SiliconANGLE, Apple Intelligence China-Berichte