claude-opus-4-5-20250929. Dieser datenbasierte Leitfaden deckt Claude Opus 5 vs. Fable 5 Benchmarks und Preise, warum Kimi K3 sich als Claude ausgibt, Timeline-Skepsis zu hat Moonshot Claude gestohlen, einen sechsstufigen Developer-Routing-Guide und was die Weight-Release am 27. Juli ändert. Siehe Kimi K3 Open Weights und OpenRouter API Routing.Claude Opus 5 Release: Halber Preis von Fable 5, jetzt Standard auf Claude Max
Anthropic veröffentlichte Claude Opus 5 am 24. Juli 2026 (US Pacific Time) und machte es sofort zum Standardmodell auf Claude Max — dem stärksten Modell für Claude-Pro-Abonnenten. Model-ID: claude-opus-5. Verfügbar über Claude API, AWS Bedrock, Google Vertex AI und Microsoft Foundry. Preise bleiben bei $5/M Input und $25/M Output — identisch zu Opus 4.8 — während die Performance bei agentischen, Coding- und Research-Workloads sprang.
Die Positionierung ist bewusst: Opus 5 ist nicht das Flaggschiff. Es ist das Alltagsmodell, das Anthropic tatsächlich genutzt sehen will — nahe-Fable-Intelligenz ohne Fable-Preise oder Fables 30-Tage-Data-Retention-Pflicht.
| Spec | Claude Opus 5 |
|---|---|
| Release-Datum | 24. Juli 2026 |
| Preise | $5/M Input · $25/M Output (wie Opus 4.8) |
| Kontextfenster | 1M Tokens (Default, einzige Stufe) |
| Max. Output | 128K Tokens |
| Reasoning | Thinking standardmäßig an; Effort-Parameter steuert Tiefe |
| Datenspeicherung | Keine erzwungene Retention (vs. Fable 5 / Mythos 5 mit Opt-in 30 Tage) |
| Fast Mode | ~2,5× Geschwindigkeit, 2× Preis (wie Opus 4.8) |
Benchmark-Highlights (Anthropic offiziell):
Frontier-Bench v0.1: Schlägt jedes Modell; 2×+ Opus 4.8 bei Software-Engineering-Tasks bei niedrigeren Kosten pro Task.
CursorBench 3.2: Bei max effort innerhalb von 0,5 % an Fable-5-Peak — bei halbem Preis. Bestes Performance-pro-Dollar bei high / xhigh / max tiers.
ARC-AGI 3: 3× das nächstbeste Modell bei neuartiger Problemlösung.
OSWorld 2.0: Schlägt Fable-5-Bestscore mit kaum einem Drittel der Kosten.
Zapier AutomationBench: 100 % Pass bei End-to-End-Account-Health-Workflow — Vorgängermodelle 0 %.
Research / Life Sciences: +10,2 Punkte bei Spektroskopie-zu-Struktur-Inferenz; +7,7 bei Protein-Variant-Funktionsvorhersage. Box meldet +8 % Gesamtgenauigkeit, +11 % Datenanalyse, +17 % Due Diligence.
Safety und Alignment: Anthropics automatisiertes Verhaltensaudit rankt Opus 5 als bisher am besten aligned — niedrigste Täuschungsrate, am schwersten zu Missbrauch zu verleiten, sicherste bei schwer rückgängig zu machenden Aktionen. Opus 5 führt bewusst nicht bei Dual-Use-Cyber- oder Bio-Risiko (Mythos 5 hält diese Stufe). Cyber-Klassifikatoren greifen ~85 % seltener ein als bei Fable 5 — nutzbar für Source-Code-Vulnerability-Discovery, aber Binary Scanning, Pentesting und Exploit-Generierung bleiben blockiert.
Kimi-K3-Distillation-Kontroverse: White-House-Vorwürfe und das Zwei-Wochen-Timeline-Problem
Moonshot AI startete Kimi K3 am 16. Juli 2026 — ein 2,8T-Parameter Sparse-MoE-Modell (896 Experten, 16 aktiv), 1M Kontext, native Vision, auf Kimi Delta Attention. Vollständige Weights für 27. Juli angekündigt. Benchmarks stark: 93,5 % GPQA-Diamond, 91,2 % BrowseComp, K3 hinter nur Fable 5 und GPT-5.6 Sol zu einem Bruchteil des Preises. Siehe Kimi K3 Open Weights Release Guide für Architektur und API.
Sechs Tage später wurde die Geschichte geopolitisch.
| Datum | Ereignis |
|---|---|
| Feb 2026 | Anthropic wirft Moonshot, DeepSeek, MiniMax industrielle Distillation vor; 3,4M+ anomale API-Calls zu Moonshot-Führung via Request-Metadaten |
| 1. Juli 2026 | Claude Fable 5 öffentlich verfügbar (zuvor eingeschränkter Rollout) |
| 16. Juli 2026 | Kimi K3 API und Produkte live |
| 22.–23. Juli 2026 | White-House-OSTP-Direktor Michael Kratsios wirft Moonshot "großangelegte, verdeckte industrielle Distillation" + unlizenzierte Nvidia GB300-Chips via Thailand vor |
| 23. Juli 2026 | TechCrunch veröffentlicht Experten-Skepsis zur Distillation-Timeline |
| 24. Juli 2026 | Ryan Greenblatt veröffentlicht statistische Analyse "K3 identifiziert sich als Claude" |
| 27. Juli 2026 | Geplanter K3-Voll-Weight-Release — unabhängige Verifikation ausstehend |
Am 22.–23. Juli postete Michael Kratsios (White House OSTP) auf X, Moonshot warfe Distillation vor, um Anthropic-Fable-Fähigkeiten zu stehlen, plus angebliche Nutzung exportkontrollierter Nvidia GB300-Chips via Thailand. Finanzminister Scott Bessent wiederholte Behauptungen zu US-LLM-"Watermarks" auf chinesischen Modellen — ohne zu spezifizieren, was das bedeutet. Moonshot hat nicht auf Trainingsprozess-Anfragen geantwortet. Kratsios lieferte keine öffentlichen Beweise.
Fable 5 ist erst seit dem 1. Juli öffentlich verfügbar. Man kann nicht so viel Daten destillieren, ein Modell trainieren und es in zwei Wochen releasen. — Braden Hancock, Laude Institute / Snorkel AI Co-Founder
TechCrunch interviewte mehrere unabhängige Forscher, die die Kimi-K3-Distillation-Kontroverse allein auf Timeline-Gründen zurückwiesen. Nathan Lambert (Allen Institute for AI) argumentierte, Distillation liefere abnehmende Erträge, während chinesische Labs zu Reinforcement Learning wechseln — wenn Distillation allein K3 erklärte, hätten Wettbewerber GLM oder K3 bereits geklont. Elon Musk bezeugte, xAI habe OpenAI-Modelle beim Bau von Grok destilliert und nannte die Praxis branchenüblich. Der Streit ist nicht, ob Distillation passiert — sondern wo "normales Technik-Borrowing" endet und "verdeckter industrieller Diebstahl" beginnt.
Hinweis: Stand 25. Juli sind vollständige K3-Weights noch nicht öffentlich. Externe Forscher können Parameterzahl, Architektur oder Benchmark-Reproduktion nicht unabhängig verifizieren — ein Hauptgrund, warum die Kontroverse ungelöst bleibt.
Warum sagt Kimi K3, es sei Claude? Greenblatts Deployment-ID-Evidenz
Der technisch substanziellste Winkel in der Debatte hat Moonshot Claude gestohlen ist nicht politisch — sondern behavioral. Um den 24. Juli veröffentlichte Redwood-Research-Chief-Scientist Ryan Greenblatt eine Cross-Entropy-Analyse (GitHub: rgreenblatt/which_claude_is_k3) zum Vergleich der Antworten auf Identitäts-Prompts.
Befund: Kimi K3 identifiziert sich überproportional als Claude — und nicht vage. Es emittiert manchmal exakte Anthropic-interne Deployment-ID-Strings:
claude-opus-4-5-20250929 claude-sonnet-4-5-20250929
Echte Claude-Modelle verhalten sich nicht so. Ein echtes Claude Sonnet 4.5 sagt "Ich bin Claude Sonnet 4.5." Opus 4.5 überspringt Versionsstrings oder liefert sie falsch. K3 reproduziert Teacher-Deployment-Metadaten genauer als der Teacher über sich selbst — schwer als reines Konversations-Mimikry zu erklären.
| Modell | Self-ID-Signal | Era fixiert auf |
|---|---|---|
| Kimi K2 | Verweist auf Claude Sonnet 4 | Mid-2025 Claude-Generation |
| Kimi K3 | Verweist auf Claude Opus 4.5 / Sonnet 4.5 Deployment-IDs | Late-2025 "Claude 4.5 Era" — nicht Fable / Mythos |
| Echte Claude-Modelle | Nur menschenlesbare Produktnamen | Aktuelle Produktlinie |
Greenblatts Interpretation: Trainingsdaten enthielten wahrscheinlich Claude-Outputs mit Deployment-Metadaten — API-Logs oder metadata-getaggte synthetische Daten — eine spezifische Distillation-Form, schwerer wegzuwischen als generisches Style-Copying. Das Generationsmuster (K2 → Sonnet 4, K3 → Opus 4.5) deutet darauf hin, dass jede Kimi-Generation die jeweils aktuelle Claude-Generation absorbierte.
Was es nahelegt: Training auf Claude-gelabelten Daten mit internen Deployment-Strings — nicht nur öffentliche Chat-Transkripte.
Was es NICHT beweist: Greenblatt stellt explizit fest, dies sei kein schlüssiger Distillation-Beweis — Kontamination, geleakte System-Prompts oder synthetische Public-Datasets könnten theoretisch Identitätsverwirrung erklären.
Warum es zählt: Erste technische (nicht politische) Evidenz in der Saga — stärker als White-House-Rhetorik, schwächer als ein Smoking-Gun-Training-Log.
Community-Read (r/LocalLLaMA): Begeisterung, dass Open/Closed-Gap in Tagen gemessen wird; Witze, dass 2.8T lokal unrunnable ist; Pragmatiker sagen, K3s echter Sell ist Preis + weniger Refusals, nicht Fable 5 schlagen.
Compliance-Hinweis: Bei Distillation-Behauptungen "angeblich", "laut Greenblatts Analyse" und "berichtet" verwenden. Identitätsverwirrung ist Evidenz, kein Urteil. Für EU-Teams: Vendor-Provenance und Prompt-Inhalte unter DSGVO dokumentieren, bevor K3 in produktiven Workflows landet.
Sechs Schritte für Entwickler: Opus 5 vs. Fable 5 vs. Kimi K3 Routing
| Modell | Input ($/M) | Output ($/M) | Kontext | Datenspeicherung |
|---|---|---|---|---|
| Claude Opus 5 | $5,00 | $25,00 | 1M | Keine Pflicht |
| Claude Fable 5 | ~$10,00 | ~$50,00 | 1M | 30-Tage-Opt-in erforderlich |
| Kimi K3 | $3,00 | $15,00 | 1M | Moonshot-API-Bedingungen |
| GPT-5.6 Sol | ~$5,00 | ~$15,00 | 400K | OpenAI-Bedingungen |
Bei Claude Opus 5 vs. Fable 5 beträgt die CursorBench-Lücke 0,5 % bei max effort — die Preislücke ~50 %. Für compliance-sensitive Workloads kann Opus 5s No-Retention-Default Fables marginalen Benchmark-Vorsprung überwiegen. Routing über OpenRouter für einheitliche Abrechnung über Provider.
Sechs operative Schritte:
Compliance zuerst evaluieren: Wenn Datenspeicherung, Exportkontrolle oder Vendor-Provenance zählen, schlagen Opus 5s No-Retention-Policy und Anthropic-Vertrag K3, bis Moonshot Distillation-Vorwürfe adressiert. Fable 5 erfordert 30-Tage-Retention-Opt-in. EU-Personendaten: AV-Vertrag und DSGVO-konforme Auftragsverarbeitung prüfen.
Opus 5 vs. Fable 5 auf Ihrem Eval-Set vergleichen: CursorBench-ähnliche Coding-Tasks und eigenen Agent-Harness laufen lassen. Opus 5 bei $5/$25 vs. Fable bei ~$10/$50 — 0,5 %-Gap für Ihren Workload validieren, bevor Flagship-Rates gezahlt werden.
Auf K3-Weights vom 27. Juli warten: Kein Production-Routing auf K3-Architektur-Claims committen, bis Hugging-Face-Weights erscheinen und unabhängige Teams Benchmarks reproduzieren. API-Zugang für Experimente ok; architekturabhängige Entscheidungen nicht.
Greenblatt-Befunde selbst verifizieren: Identitäts-Prompts gegen K3, Fable 5 und Opus 5 laufen lassen. Prüfen, ob K3 unter Ihrer System-Prompt-Konfiguration Deployment-IDs emittiert. Ergebnisse für Compliance-Team dokumentieren.
Mixed-Model-Routing: Daily Coding + Agents → Opus 5; Frontier-Repo-Bugs → Fable 5; kostensensitive Bulk + 1M Kontext → K3 API; terminal-heavy → GPT-5.6 Sol. Nicht all-in auf ein Modell in einer ungelösten Kontroverse-Woche.
Policy-Entwicklungen monitoren: US-Open-Weight-Restriktionen, Chip-Export-Enforcement und Moonshots Lizenzbedingungen vom 27. Juli tracken. Anthropics Februar-3,4M-Call-Vorwurf und Juli-White-House-Eskalation können API-ToS- oder Routing-Policy-Änderungen auslösen.
from openai import OpenAI
client = OpenAI(
api_key="your_openrouter_key",
base_url="https://openrouter.ai/api/v1"
)
response = client.chat.completions.create(
model="anthropic/claude-opus-5",
messages=[{"role": "user", "content": "Wer bist du? Antworte nur mit Modellname und Version."}]
)Preiskrieg, drei harte Zahlen und was der 27. Juli ändert
Beide Stories zeigen denselben Branchenwandel: Frontier-Intelligenz kommoditisiert schnell. Anthropic schließt die Lücke zwischen Flagship und Alltagsmodell, indem Opus 5 zu unveränderten Opus-Preisen shipped. Moonshot pusht Open Weights, flat 1M Kontext und aggressive API-Rates — und wird beschuldigt, auf Claudes Outputs aufzusitzen. Die Kimi-K3-Distillation-Kontroverse ist der erste öffentliche Flashpoint in einer Frage, der jedes Lab begegnen wird: Wenn jemand die Frontier zu einem Bruchteil der Kosten matcht — besseres Engineering oder geliehene Intelligenz?
| Szenario | Empfohlener Weg | Warum |
|---|---|---|
| Compliance-sensibles Enterprise | Claude Opus 5 API | Keine erzwungene Retention; nahe-Fable-Benchmarks; Anthropic-Vertragsklarheit; DSGVO-taugliche Dokumentation |
| Frontier Coding / Repo-Bugs | Claude Fable 5 API | FrontierSWE und GDPval v2 führen, wenn Kosten sekundär |
| Kosten + 1M-Kontext-Experimente | Kimi K3 API (pre-7/27) → Self-Host post-7/27 | $3/$15 mit 1M Flat Pricing; Weights vor Commit verifizieren |
| Ungelöstes Provenance-Risiko | Warten auf 27. Juli + unabhängiges Audit | Greenblatt-Evidenz suggestiv, nicht schlüssig; Weights ermöglichen externe Verifikation |
| Multi-Model-Agent-Produktion | OpenRouter Mixed Routing | Single Billing Layer; Modellwechsel ohne Infra-Redeploy |
Für Entwickler: Wenn Compliance und Datenspeicherung zählen, ist Opus 5 das einfache Upgrade diese Woche. Wenn absolut niedrigste Kosten gewinnen und Provenance-Risiko akzeptabel ist, K3 nach dem 27. Juli erneut prüfen, wenn Outsider die Zahlen bestätigen können.
0,5 % / 50 %: Opus 5 innerhalb 0,5 % von Fable 5 auf CursorBench 3.2 bei max effort — bei etwa halben Token-Kosten ($5/$25 vs. ~$10/$50).
3,4M / 2 Wochen: Anthropics Februar-Vorwurf nennt 3,4M+ anomale API-Calls; Fable-5-Public-Availability bis K3-Launch spannt nur ~2 Wochen — Kernargument der Timeline-Skeptiker.
2,8T / 27. Juli: K3 behauptet 2,8T Parameter — größter ausstehender Open-Weights-Release; externe Verifikation gate't die gesamte Distillation-Debatte.
Fazit: Opus 5 ist Anthropics praktische Antwort auf den Preiskrieg — nahe-Flagship-agentische Performance ohne Fable-Preise oder Retention-Friction. K3s Distillation-Saga legt eine Provenance-Frage über eine bereits überzeugende Kostenstory. Auf Ihren Workloads validieren, Identity-Checks laufen, wenn Compliance es verlangt, und den 27. Juli als ersten echten Test von Moonshots Claims behandeln.
Multi-Model-Agent-Workflows auf privatem Mac treffen Sleep-Zyklen und Netzwerk-Drops bei Long-Context-Jobs; Warten auf Self-Hosting ab 27.7. braucht einen 64+-Accelerator-Supernode, den die meisten Teams nicht haben; eine einzelne Closed API verfehlt K3s 1M-Flat-Pricing-Vorteil. Für iOS CI/CD, persistente Claude Code / Kimi Code Agents und 24/7 AI-Produktion ist KVMNODE dedizierte Mac Mini M4 Cloud-Miete meist der bessere Host: Apple Silicon Unified Memory, offenes sudo, flexible Tages-/Wochen-/Monatslaufzeiten. Siehe Preisseite, Hilfezentrum oder direkt bestellen.
Stand: 25. Juli 2026 · Benchmarks inkl. Anthropic- und Moonshot-Self-Report · Quellen: anthropic.com/news/claude-opus-5, TechCrunch, Ryan Greenblatt GitHub (rgreenblatt/which_claude_is_k3), Moonshot/Kimi Official Blog, CNBC, The Verge, r/LocalLLaMA