Wer Qwen3.8-Max produktiv einsetzen will, sollte zuerst klären, ob Alibabas Release wirklich Open Source ist — nicht wie viele Parameter das Modell hat. Am 3. August 2026 veröffentlichte Alibaba sein 2,4-Billionen-Parameter-MoE-Flaggschiff Qwen3.8-Max per GA-API und markierte es auf qwen.ai als „Open-Source“ — doch Gewichte fehlen, Benchmarks stammen nur aus Vendor-Tests. Dieser Artikel behandelt die Timeline 16. Juli–3. August, Specs und Wettbewerber-Matrix, sparse-MoE-Architektur, den blinden Kimi-K3-Test 83 vs. 80 und eine Sechs-Schritte-API-Checkliste. Hintergrund: Kimi K3 erklärt, GPT-5.6-Preissenkung.
01

Ist Qwen3.8-Max Open Source oder nur API?

Kurz: Derzeit nicht. Am 3. August 2026 machte Alibaba sein Qwen-Flaggschiff Qwen3.8-Max per Cloud-API GA-verfügbar und launchte das Agent-Produkt „Qwen Office“. 2,4T Gesamtparameter, 95B aktiv, 1M Token Kontext, sparse MoE. Die Website zeigt „Open-Source“, aber auf Hugging Face und ModelScope gibt es kein Repo, keine Lizenz und kein festes Datum — nur das Versprechen „nächste Woche“ (erwartet um den 10. August).

DatumMeilensteinKernpunkt
16. JuliKimi K3 APIMoonshot veröffentlicht 2,8T-MoE, betont unabhängige Benchmarks
19. JuliQwen-PreviewQwen3.8-Max-Preview, 10 % des Endpreises, keine Aktiv-Parameter, Produktions-Automation verboten
27. JuliK3-GewichteKimi K3 vollständige Gewichte auf Hugging Face, MoonEP etc. offen
31. JuliDeepSeek V4-FlashGleiche Parameterzahl, bessere Agent-/Code-Benchmarks als V4-Pro
3. AugustQwen3.8-Max GAVolle Benchmark-Tabelle, Qwen Office, API $2/$6, Alibaba +7 % HK, +4,5 % US
01

„Open-Source“-Label mit Gewichten verwechseln: Seit GA-Tag steht Open-Source auf der Site — das Repo fehlt noch.

02

Vendor-Benchmarks als verifiziert lesen: PaperBench, RecreationBench etc. sind Alibaba-eigen; keine GA-Reproduktion von Artificial Analysis oder Arena.

03

Preview-Transparenzlücken ignorieren: Die 19.-Juli-Preview hatte kein Model Card, keine Safety-Eval, keine Aktiv-Parameter.

04

2,4T Gesamt mit Inferenzkosten gleichsetzen: Aktiv sind 95B — API-Preis folgt dem Aktiv-Count, lokales Full-Deploy ist Datacenter-Sache.

05

Produktions-Migration vor Gewicht-Release: Blindtest Kimi K3 83, Qwen-Preview 80 — Gleichstand, kein klarer Sieger.

02

Qwen3.8-Max-Specs und Wettbewerber-Matrix

SpecWert
GA-Datum3. August 2026
Gesamt / aktiv2,4T / 95B
Architektursparse MoE + Hybrid-Attention auf Qwen3.5-Basis
Kontext1M Token (≈983K mit Thinking; 131K Max-Output)
Input-ModiText, Bild, Video
API-Preis$2 / $6 pro M Input/Output (impliziter Cache $0,25, explizit Write $2,50, Read $0,17)
Arena Text#5, 1.496 Punkte (Preliminary), einziges Nicht-Anthropic in Top 8
Arena Vision#2, hinter Claude Fable 5
Gewichte„Nächste Woche“ versprochen, nicht live
ModellGesamt / aktivKontextPreis (in/out $/M)GewichteUnabhängiger Benchmark
Qwen3.8-Max2,4T / 95B1M$2 / $6Versprochen, nicht shippedKeiner
Kimi K32,8T / ~50B~1,05M$3 / $1527. Juli shippedAA Index ≈57,11
DeepSeek V4-Pro1,6T / 49B1MNicht voll publiziertShippedSWE-bench Verified 80,6 %
DeepSeek V4-Flashwie V4-Pro1MNicht voll publiziertShipped9 Benchmarks über V4-Pro
Claude Opus 5Unbekannt1M$5 / $25GeschlossenArena Top-Tier
Claude Fable 5Unbekannt1M$10 / $50GeschlossenArena Text #1

Alibaba-eigene Runs: PaperBench 93,0, OSWorld-Verified 86,1, SWE-bench Pro 67,7 (hinter Fable 5 80,0 und Opus 4.8 69,2), HLE 43,6 (Fable 5 53,3). Eine Fußnote im Vergleichstabelle deutet Fallback bei Fable 5 an — Alibabas Methodik ist gleichermaßen nicht Drittanbieter-reproduzierbar veröffentlicht.

03

Unter der Haube: sparse MoE und Langzeit-Autonomie

Warum sparse MoE statt nur skalieren? Qwen3.8-Max hält 2,4T Gesamtparameter bei nur 95B aktiv pro Token. Inferenzkosten folgen dem Aktiv-Count — daher API $2/$6, deutlich unter Claude Opus 5 ($5/$25) und Fable 5 ($10/$50). Architektur-Effizienz als Preishebel, nicht Rohskalierung als Capability-Hebel.

reasoning_effort in drei Stufen (low / medium / xhigh, Default xhigh) ist ein Kosten-Dial. Über enable_thinking oder Anthropic-kompatibles reasoning.effort steuerbar.

Langzeit-Autonomie ist der Headline-Pitch: 16-tägiges Coding ohne Aufsicht, 500+ Schritte Chip-Design, RecreationBench (Black-Box-Rebuild ohne Netz/Quellcode). Alles auf Alibaba-eigenen Suites; partieller Trace auf GitHub qwen-code-dev-bot/oh-my-cli, aber kein unabhängig auditiertes Vollreprodukt.

Die API unterstützt OpenAI- und Anthropic-kompatible Protokolle — Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw per base-URL-Swap. Qwen Office konkurriert mit Tencent WorkBuddy und Kimi Work.

Im einzigen verfügbaren blinden Vergleich (269-Dateien-Architektur-Task) erreichte Kimi K3 83/100, Qwen3.8-Max-Preview 80/100 — Gleichstand auf realem Workload, kein klarer Dominator. K3 hat öffentliche Gewichte und AA-Score; Qwen punktet mit niedrigerem API-Preis und breiterem Multimodal-Support.

04

API-Deployment-Checkliste und OpenAI-SDK

Qwen3.8-Max ist per API nutzbar, Gewichte fehlen. Vor Produktions-Migration: A/B auf eigenem Workload. EU-Nutzer: Cloud-API-Verarbeitung in China kann DSGVO-Datenresidenz und Auftragsverarbeitung betreffen — Legal prüfen.

01

API-Key bei QwenCloud / DashScope: Key in Alibaba Cloud Model Studio, base_url https://dashscope.aliyuncs.com/compatible-mode/v1, Modell-ID qwen3.8-max.

02

„Open-Source“-Label prüfen: Repo, Lizenz und Ship-Datum in offizieller Ankündigung bestätigen, bevor Self-Hosting geplant wird.

03

OpenAI-SDK-kompatible Integration: Meist reichen base URL und API-Key-Wechsel.

04

reasoning_effort anpassen: low/medium für einfache Tasks; xhigh nur für tiefe Reasoning-Pfade.

05

Cache-Prefix optimieren: System-Prompts und Tool-Definitionen wiederverwenden für impliziten Cache $0,25/M.

06

Lokales Deploy: Full 2,4T ist Multi-Node-Datacenter; realistischer Ziel ist das parallel versprochene Qwen3.8-27B Open Weight.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_dashscope_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Analysiere die Komplexität dieses Codes..."}]
)
05

Branchenkontext und drei harte Zahlen

2026 war das Jahr der Trillionen-Parameter-Expansion — doch DeepSeek V4-Flash am 31. Juli verbesserte Agent- und Code-Scores ohne mehr Parameter und hinterfragt die „nur skalieren“-Narrative. Alibaba verspricht erstmals Open Weights für eine Max-Klasse und reiht sich neben Kimi K3 und DeepSeek in die chinesische Open-Weight-Wende ein.

Konsumentenwinkel: Qwen treibt Apple Intelligence in China — komprimierter Checkpoint unter 4 GB on-device auf iPhone 15+. Am 4. August diskutierte das Weiße Haus mit OpenAI, Anthropic, Google und Meta ein neues voluntäres Cybersecurity-Test-Framework nach Agent-Sandbox-Breaches — chinesische Open-Weight-Race und US-Regulierung in derselben Woche.

A

2,4T / 95B aktiv: Spitzen-Gesamtparameter, Inferenz folgt 95B — API $2/$6 unter Opus 5 und Fable 5.

B

1.496 / Arena #5: Text vorläufig #5, Vision #2 — GA-Reproduktion fehlt.

C

+7 % / +4,5 %: Alibaba-Aktien am GA-Tag — Markt liest Narrativ-Rückkehr, nicht Routine-Update.

Praktische Alternativen haben versteckte Kosten: Agent-Toolchains 24/7 auf einem privaten Mac scheitern an Sleep und Netz-Ausfällen; Multi-Modell-A/B und iOS-CI brauchen stabile dedizierte Compute. Für Produktions-Pipelines ist KVMNODE dedizierte Mac Mini M4 Cloud-Miete meist die bessere Wahl: natives Apple Silicon, volles sudo, flexible Tages-/Wochen-/Monats-Tarife. Siehe Preisseite, Hilfezentrum oder direkt bestellen.

Datenstand 4. August 2026 · Quellen: Alibaba Cloud, Arena.ai, qwen.ai, Apidog, TechNode, SiliconANGLE, Apple Intelligence China-Berichte