Gemma-4-Leitfäden
Kimi K3: Moonshot AIs 2,8T Open-Weight-Modell erklärt

Kimi K3: Moonshot AIs 2,8T Open-Weight-Modell erklärt
Moonshot AI veröffentlichte Kimi K3 am 16. Juli 2026 – und innerhalb eines Tages kletterte es an die Spitze von LMArenas Frontend Code Arena, überholte Claude Fable 5 und erzielte einen Artificial Analysis Intelligence Index-Wert vor Claude Opus 4.8. Mit 2,8 Billionen Parametern gilt es als das bislang größte veröffentlichte Open-Weight-Modell – von einem Unternehmen, das drei Jahre zuvor noch ein wenig bekanntes Pekinger Startup war.
Dieser Leitfaden erklärt, was Kimi K3 wirklich ist, was bestätigt ist und was noch aussteht (die öffentlichen Gewichte sind noch nicht herunterladbar), und wo Sie die Zahlen finden, die für eine echte Evaluation zählen.

Kurzantwort
- Veröffentlicht: 16. Juli 2026 von Moonshot AI (gegründet von CEO Yang Zhilin).
- Größe: 2,8 Billionen Gesamtparameter – das bislang größte veröffentlichte Open-Weight-Modell.
- Architektur: Mixture-of-Experts mit Moonshots Stable LatentMoE-Framework (16 von 896 Experten pro Token aktiv), basierend auf zwei hauseigenen Innovationen: Kimi Delta Attention (hybrider linearer Attention-Mechanismus) und Attention Residuals (Drop-in-Ersatz für Standard-Residual-Verbindungen).
- Kontextfenster: 1.048.576 Token (~1M), mit nativer visueller Verständnisfähigkeit und einem dauerhaft aktiven „Thinking Mode“.
- Open Weights: Als Open-Weight unter einer Modified-MIT-ähnlichen Lizenz angekündigt, aber die herunterladbaren Gewichte waren zum Launch noch nicht live – Moonshot hat sich verpflichtet, sie bis 27. Juli 2026 zu veröffentlichen. Bis dahin beschreibt „Open Source“ den Plan, nicht etwas, das Sie herunterladen können.
- Zugang heute: Moonshots eigene API (
platform.kimi.ai), OpenRouter (moonshotai/kimi-k3) und die Consumer-Kimi-App/Web-Chat. Hugging-Face-Self-Hosting ist noch nicht verfügbar. - Position vs. Claude: Schlägt Claude Opus 4.8 im Artificial Analysis Intelligence Index und in mehreren agentischen/Coding-Benchmarks; liegt bei den meisten Benchmarks hinter dem neueren Claude Fable 5 zurück, gewinnt aber bei langfristigem agentischem Coding und kostet einen Bruchteil des Preises.
Was Kimi K3 wirklich ist
Kimi K3 ist Moonshot AIs neuestes Flaggschiff-Modell, positioniert als Open-Weight-Frontier-System, das die größten Closed-Source-Labs bei agentischem Coding, Tool-Nutzung und allgemeinem Reasoning direkt herausfordert – während es die Gewichte veröffentlicht (bzw. vorerst deren Veröffentlichung verspricht).
Der relevante Rahmen: Das ist kein inkrementelles Point Release. Moonshot sprang direkt zu einem 2,8T-Parameter-Modell – mehr als doppelt so groß wie der Vorgänger Kimi K2.6 (~1T Parameter) – und kombinierte es mit neuer Architektur statt nur mehr Scale nach altem Rezept. Die Marktreaktion war unmittelbar – Berichterstattung verband das Release mit einem breiteren Abverkauf bei KI-Chip-Aktien, in der Logik, dass ein so leistungsfähiges, so günstiges und offen verfügbares Modell die Kalkulation verändert, wie viel Compute der Rest der Branche kaufen muss.
Architektur und Spezifikationen
Zwei Techniken leisten unter der Haube den Großteil der Arbeit – beide waren zuvor als offene Forschung vom Moonshot-Team veröffentlicht worden, bevor sie in einem ausgelieferten Modell auftauchten:
- Kimi Delta Attention — hybrider linearer Attention-Mechanismus, der Long-Context-Inferenz schnell hält, ohne den üblichen quadratischen Aufwand standardmäßiger Attention.
- Attention Residuals — Drop-in-Ersatz für konventionelle Residual-Verbindungen, der laut Moonshot beim Skalieren des Modells konsistentere Gewinne liefert.
- Stable LatentMoE — das Routing-Framework hinter der Mixture-of-Experts-Schicht. Von 896 Experten insgesamt sind 16 pro Token aktiv – so bleibt ein 2,8T-Parameter-Modell rechnerisch handhabbar, statt bei jedem Forward Pass Compute im Umfang von 2,8T Parametern zu benötigen.
Neben der Architektur liefert K3:
- Ein 1.048.576-Token-Kontextfenster (~1M Token) für Eingabe und Ausgabe.
- Native visuelle Verständnisfähigkeit — Bildeingabe ist eingebaut, nicht nachträglich angeflanscht.
- Einen dauerhaft aktiven Reasoning-Modus („Thinking Mode“) statt eines Umschalters, den man sich merken muss.
Moonshot hat angekündigt, dass ein vollständiger technischer Bericht mit Trainings- und Evaluationsdetails die Veröffentlichung der öffentlichen Gewichte begleiten wird. Bis dahin gelten architektonische Details über die hier zusammengefassten hinaus als vorläufig.
Ist Kimi K3 Open Source?
Das ist die am häufigsten gesuchte Frage zu K3 – und die ehrliche Antwort hat zwei Teile:
Der Plan ist Open-Weight. Moonshot hat erklärt, K3 erscheint unter einer Modified-MIT-ähnlichen Lizenz – dem gleichen Ansatz wie Kimi K2.6 (freizügig für die überwältigende Mehrheit der Nutzer, mit einer Attributionsklausel, die erst bei sehr großem Deployment-Scale greift).
Die Gewichte sind noch nicht herunterladbar. Zum Launch ist Kimi K3 nur über Moonshots gehostete API, OpenRouter und die Consumer-App erreichbar – nichts davon liefert oder erfordert die zugrunde liegende Modelldatei. Moonshot hat sich verpflichtet, die eigentlichen Gewichte zusammen mit dem technischen Bericht bis 27. Juli 2026 zu veröffentlichen. Bis zu diesem Datum ist „Kimi K3 ist Open Source“ eine Aussage über Absicht und Lizenzierung, nicht etwas, das Sie heute per git clone oder mit vLLM ausführen können.
Wenn Sie speziell Self-Hosted-, On-Prem-Inferenz benötigen, ist der praktische Schritt jetzt: Lesezeichen setzen und nach dem 27. Juli erneut prüfen – und die Hardware-Diskussion separat budgetieren, denn ein 2,8T-Parameter-Modell (selbst ein sparsames MoE) braucht deutlich mehr Speicher als K2.6.
Wie Kimi K3 abschneidet
Vollständige Aufschlüsselung: Kimi K3 Benchmarks: wie es wirklich abschneidet
Die Kurzversion: Im Artificial Analysis Intelligence Index erzielt K3 57 – vor Claude Opus 4.8s 56, hinter Claude Fable 5s 60. Bei agentischen Benchmarks speziell – GDPval-AA, BrowseComp, langfristiges Coding – ist K3 wirklich konkurrenzfähig mit den teuersten Closed-Source-Modellen auf dem Markt und manchmal vorne. Es eroberte außerdem innerhalb weniger Stunden nach dem Release Platz #1 in LMArenas Frontend Code Arena und überholte Claude Fable 5.
Schwächer ist es bei reasoning-lastigen akademischen Benchmarks wie GPQA Diamond und Humanity's Last Exam, wo Claude Opus 4.8 noch knapp vorne liegt.
Was Kimi K3 kostet
Vollständige Aufschlüsselung: Kimi K3 Preise: API-Kosten und Abonnementpläne
Die Kurzversion: Die API kostet 3 $ pro Million Input-Token und 15 $ pro Million Output-Token, mit gecachtem Input bei 0,30 $ pro Million – ein 90-%-Rabatt, der bei agentischen und RAG-Workloads viel ausmacht. Das unterbietet Claude Opus 4.8 auf Input und Output um etwa das 1,7-fache. Die Consumer-App hat fünf Abonnement-Stufen von kostenlos (Adagio) bis 199 $/Monat (Vivace) – diese decken Chat-App und Tools, nicht API-Nutzung.
Vergleich mit Claude und anderen Modellen
Vollständige Aufschlüsselung: Kimi K3 vs Claude: Fable 5 und Opus 4.8 im Vergleich
Die Kurzversion: Gegen Claude Opus 4.8 gewinnt K3 bei Benchmarks und Preis – ein ziemlich klarer Upgrade, wenn Opus 4.8 Ihre Baseline war. Gegen das neuere Claude Fable 5 ist das Bild enger: Fable 5 gewinnt insgesamt mehr Benchmarks (groß etwa 8 von 14 im Head-to-Head), besonders bei Frontier Engineering und Vision-Aufgaben, aber K3 gewinnt bei langfristigem agentischem Coding und terminalgetriebener Arbeit – und das zu einem Bruchteil von Fable 5s Kosten.
K3 erschien im gleichen Zeitfenster wie GLM 5.2 und zuvor Kimi K2.6 als konkurrierende Open-Weight-Optionen – wenn Sie speziell offene Modelle evaluieren, sind unser GLM 5.2 Test und der Kimi K2.6 vs GLM-5.1-Vergleich nützliche Begleitlektüre, während ein direkter K3-vs-GLM-5.2-Breakdown in Arbeit ist.
Wie Sie heute auf Kimi K3 zugreifen
Vier Wege – keiner erfordert derzeit die (noch nicht veröffentlichten) Gewichte:
- Moonshots eigene API unter
platform.kimi.ai— anmelden, Schlüssel erstellen, Abrechnung pro Token. Siehe den Preisleitfaden für Setup-Schritte. - OpenRouter, gelistet als
moonshotai/kimi-k3— sinnvoll, wenn Sie bereits mehrere Provider über OpenRouter routen und K3 als Drop-in-Option wollen. - Die Consumer-Kimi-App und Web-Chat — kostenlose Stufe verfügbar (Adagio), mit bezahlten Stufen bis 199 $/Monat für stärkere Nutzung, Agent-Credits und Tools. Das ist getrennte Abrechnung von der API.
- Kimi Code, Moonshots Terminal-Coding-Agent, für Abonnenten, die K3 in einen CLI-Coding-Workflow einbinden wollen.
Noch nicht verfügbar: Hugging-Face-Gewichte und damit jede Form echten Self-Hostings.
Kimi K3 vs Kimi K2.6: was sich wirklich geändert hat
Wenn Sie Kimi K2.6 Anfang 2026 evaluiert oder deployed haben, ist K3 kein kleiner Versions-Sprung:
| Kimi K2.6 | Kimi K3 | |
|---|---|---|
| Gesamtparameter | ~1T | 2,8T |
| Kontextfenster | 256K | ~1M |
| Architektur | Standard-MoE-Attention | Kimi Delta Attention + Attention Residuals + Stable LatentMoE |
| Visuelle Eingabe | Bild + experimentelles Video | Native Bildverständnis |
| Reasoning-Modus | Umschalter (Thinking / Instant) | Dauerhaft aktiver Thinking Mode |
| Open Weights | Verfügbar auf Hugging Face | Ausstehend, erwartet 27. Juli 2026 |
K2.6 bleibt eine vernünftige Wahl, wenn Sie es bereits integriert haben und weder das größere Kontextfenster noch die neueste Benchmark-Position brauchen. Für jede neue Evaluation starten Sie mit K3.
Für wen Kimi K3 geeignet ist
- Teams, die agentische Coding-Tools bauen — die Langzeithorizont-Agent- und Terminal-Benchmarks sind, wo K3 relativ zum Preis am stärksten ist.
- Alle, die derzeit für Claude Opus 4.8 zahlen, wo Kosten pro Aufgabe zählen — K3 schlägt es bei den Benchmarks, die den meisten Teams wichtig sind, und kostet spürbar weniger.
- Frontend-lastige Workflows — das #1-Ergebnis in LMArenas Frontend Code Arena ist ein echtes, verifizierbares Signal, nicht nur eine Selbstangabe.
- Long-Context- und RAG-Pipelines, die vom ~1M-Kontextfenster und den 90-%-günstigeren gecachten Input-Preisen profitieren können.
Für wen Warten sinnvoller ist
- Alle, die heute Self-Hosted-, On-Prem-Inferenz brauchen. Die Gewichte sind noch nicht da. Nach dem 27. Juli 2026 erneut prüfen.
- Teams, deren Workload stark auf akademischen Reasoning-Benchmarks lastet (Wettkampf-Mathe, GPQA-artige Wissenschaft) — Claude Opus 4.8 und Fable 5 haben dort noch einen Vorsprung.
- Alle, die ein vollständig ausgereiftes, unabhängig verifiziertes Benchmark-Bild brauchen. K3 ist Tage alt; einige kursierende Zahlen stammen noch aus Vendor-Berichten oder einem einzelnen Aggregator und werden sich verfeinern, wenn mehr der Community eigene Evaluationen fährt.
FAQ
Was ist Kimi K3? Kimi K3 ist Moonshot AIs Flaggschiff-Sprachmodell, veröffentlicht am 16. Juli 2026. Es ist ein 2,8-Billionen-Parameter Mixture-of-Experts-Modell mit ~1M-Token-Kontextfenster, nativer visueller Verständnisfähigkeit und dauerhaft aktivem Reasoning-Modus, positioniert als Open-Weight-Konkurrent zu Claude und GPT.
Ist Kimi K3 Open Source? Es ist als Open-Weight unter einer Modified-MIT-ähnlichen Lizenz konzipiert, aber die eigentlich herunterladbaren Gewichte waren zum Launch nicht verfügbar. Moonshot hat sich verpflichtet, sie zusammen mit einem vollständigen technischen Bericht bis 27. Juli 2026 zu veröffentlichen.
Ist Kimi K3 kostenlos? Die Consumer-Chat-App hat eine kostenlose Stufe (Adagio). Die API ist kostenpflichtig: 3 $/M Input und 15 $/M Output-Token, ohne kostenlosen Produktions-Tier. Siehe den Preisleitfaden für die vollständige Aufschlüsselung.
Wie nutze ich Kimi K3?
Heute über Moonshots API unter platform.kimi.ai, über OpenRouter als moonshotai/kimi-k3 oder über die Consumer-Kimi-App und Web-Chat. Self-Hosting ist erst möglich, wenn die öffentlichen Gewichte erscheinen.
Ist Kimi K3 besser als Claude? Das hängt davon ab, welches Claude. K3 schlägt Claude Opus 4.8 im Artificial Analysis Intelligence Index und den meisten agentischen Benchmarks zu einem niedrigeren Preis. Gegen das neuere Claude Fable 5 gewinnt Fable 5 insgesamt mehr Benchmarks, aber K3 gewinnt bei langfristigem agentischem Coding und ist dramatisch günstiger. Siehe den vollständigen Vergleich.
Wie groß ist Kimi K3? 2,8 Billionen Gesamtparameter mit Mixture-of-Experts-Design (Stable LatentMoE), das 16 von 896 Experten pro Token aktiviert — die Inferenzkosten sind damit weit niedriger, als die Gesamtparameterzahl vermuten lässt.
Verwandte Leitfäden
Verwandte Leitfäden
Gehen Sie im Gemma-4-Cluster mit dem nächsten Leitfaden weiter, der zu Ihrer aktuellen Entscheidung passt.

Kimi K3 Benchmarks: Wie es wirklich abschneidet
Kimi K3 erreichte #1 in LMArenas Frontend Code Arena und schlug Claude Opus 4.8 im Artificial Analysis Intelligence Index innerhalb eines Tages nach dem Launch. Hier, was die Zahlen wirklich sagen — und wo sie nicht die ganze Geschichte erzählen.

Kimi K3 Preise: API-Kosten, Abonnementpläne und was wirklich kostenlos ist
Kimi K3s API kostet 3 $ pro Million Input-Token und 15 $ pro Million Output — aber der dauerhaft aktive Thinking Mode bedeutet, dass Sie bei jedem einzelnen Aufruf für Reasoning-Token zahlen. Hier, was das wirklich kostet.

Kimi K3 vs Claude: Fable 5 und Opus 4.8 im Vergleich
Kimi K3 schlägt Claude Opus 4.8 bei Preis und den meisten Benchmarks, aber Claude Fable 5 führt noch bei Frontier Engineering. Hier genau, wo jedes Modell gewinnt — aus Artificial Analysis und den eigenen Zahlen der Anbieter.
Sie wissen noch nicht, was Sie als Nächstes lesen sollen?
Gehen Sie zurück zum Leitfaden-Hub, um Modellvergleiche, Setup-Anleitungen und Seiten zur Hardware-Planung zu durchsuchen.
