Gemma-4-Leitfäden
Kimi K3 Benchmarks: Wie es wirklich abschneidet

Kimi K3 Benchmarks: Wie es wirklich abschneidet
Innerhalb weniger Stunden nach Kimi K3s Release am 16. Juli 2026 sprang es von #18 auf #1 in LMArenas Frontend Code Arena und überholte Claude Fable 5. Es erzielte außerdem einen höheren Wert als Claude Opus 4.8 im Artificial Analysis Intelligence Index. Diese beiden Fakten allein erklären den Großteil des Launch-Wochen-Lärms — aber eine einzelne Leaderboard-Position ist ein schlechter Ersatz dafür, wirklich zu verstehen, wo ein Modell stark ist, wo nicht und wie viel der Abstand real ist versus Benchmark-Harness-Rauschen.
Dies ist eine Aufschlüsselung von Kimi K3s Benchmark-Leistung nach Kategorie — aus Moonshots eigenen Materialien und Artificial Analysys unabhängiger Evaluation, mit den Methodik-Hinweisen, die zählen, bevor Sie eine Entscheidung auf Basis davon treffen.

Kurzantwort
- Artificial Analysis Intelligence Index v4.1: Kimi K3 erzielt 57, vor Claude Opus 4.8 (56), hinter Claude Fable 5 (60).
- Frontend-Coding (LMArena Frontend Code Arena): Kimi K3 ist #1, Erster in 6 von 7 Frontend-Domains, nachdem es Claude Fable 5 überholt hat.
- Agentisches Reasoning (GDPval-AA v2): Kimi K3 erzielt ~1.687, vor Claude Opus 4.8 (1.600), hinter Claude Fable 5 Max (~1.815) und GPT-5.6 Sol Max (~1.748).
- Head-to-Head vs. Claude Fable 5: Über die Benchmarks, die beide Anbieter melden, gewinnt Fable 5 grob 8 von 14, K3 gewinnt grob 6 — einschließlich langfristigem agentischem Coding, BrowseComp und Terminal-Bench 2.1.
- Head-to-Head vs. Claude Opus 4.8: Kimi K3 führt bei 7 von 10 verglichenen Benchmarks (einschließlich BrowseComp, FrontierSWE, GDPval-AA und Toolathlon); Opus 4.8 führt noch bei GPQA Diamond, Humanity's Last Exam und OfficeQA Pro.
- Geschwindigkeit: K3 generiert grob 62 Token/s mit ~2 Sekunden Time-to-First-Token — deutlich schneller als Opus 4.8s Max-Effort-Reasoning-Modus.
- Hinweis: Diese Zahlen sind Tage alt, meist Vendor- oder Single-Aggregator-gemeldet und unter spezifischen Evaluationseinstellungen gelaufen (Reasoning Effort auf „max“, Temperatur 1,0, top-p 1,0). Behandeln Sie sie als starkes Frühsignal, nicht als endgültiges Urteil.
Die Schlagzeilen-Zahl: Artificial Analysis Intelligence Index
Artificial Analysis kombiniert neun Evaluationen — einschließlich GDPval-AA v2, Terminal-Bench 2.1, SciCode, Humanity's Last Exam, GPQA Diamond und Long-Context-Reasoning-Tests — zu einem einzigen Intelligence-Index-Wert.
| Modell | AA Intelligence Index v4.1 |
|---|---|
| Claude Fable 5 (Adaptive, Max effort) | 60 |
| Kimi K3 (max reasoning effort) | 57 |
| Claude Opus 4.8 (Adaptive, Max effort) | 56 |
Die Erkenntnis, die wirklich zählt: K3 ist nicht das intelligenteste verfügbare Modell, aber es liegt wenige Punkte hinter der Frontier und kostet einen Bruchteil dessen, was Fable 5 oder Opus 4.8 pro Aufgabe verlangen. Für die meisten Produktions-Use-Cases schlägt „nahe Frontier, viel günstiger“ „knapp vor Frontier, teuer“ — aber nicht immer, deshalb zählt die Kategorie-Aufschlüsselung unten mehr als die einzelne Composite-Zahl.
Agentische und Langzeithorizont-Benchmarks
Hier ist K3 wirklich stark — und hier hat Moonshot klar optimiert.
GDPval-AA v2
Ein privater agentischer Benchmark, der misst, wie gut ein Modell realistische, wirtschaftlich wertvolle Wissensarbeit leistet.
| Modell | GDPval-AA v2 (Elo) |
|---|---|
| Claude Fable 5 Max | ~1.815 |
| GPT-5.6 Sol Max | ~1.748 |
| Kimi K3 | ~1.687 |
| Claude Opus 4.8 | 1.600 |
K3 landet insgesamt auf Platz drei — hinter den beiden teuersten Closed-Source-Frontier-Modellen, aber klar vor Opus 4.8.
AA-Briefcase (agentische Wissensarbeit)
| Modell | AA-Briefcase (Elo) |
|---|---|
| Claude Fable 5 Max | ~1.587 |
| Kimi K3 | ~1.527 |
| GPT-5.6 Sol Max | ~1.495 |
Hier klettert K3 auf Platz zwei, vor GPT-5.6 Sol Max.
BrowseComp (agentische Web-Recherche)
K3 führt Claude Fable 5 bei BrowseComp an — einer der klarsten Siege zu Moonshots Gunsten und bedeutsam, wenn Ihr Workload autonome Recherche oder mehrstufige Web-Navigation umfasst.
Coding-Benchmarks
| Benchmark | Kimi K3 |
|---|---|
| Terminal-Bench 2.1 | 88.3 |
| FrontierSWE | 81.2 |
| Program Bench | 77.8 |
| DeepSWE | 67.5 |
| SWE Marathon | 42.0 |
Ein Hinweis zu SWE Marathon: Ein niedriger absoluter Wert (42,0) bedeutet nicht, dass das Modell schwach ist — es ist einer der härtesten Langzeithorizont-Coding-Benchmarks, bei dem jedes Frontier-Modell in absoluten Zahlen niedrig punktet. Entscheidend ist der Vergleich: K3 führt Claude Fable 5 bei SWE Marathon um grob 7 Punkte an — ein bedeutsamer Abstand auf diesem Schwierigkeitsniveau.
LMArena Frontend Code Arena
Das ist der Benchmark, der am Launch-Tag die meiste Aufmerksamkeit erzeugte — und anders als die Vendor-gemeldeten Zahlen oben ist es ein crowd-gewähltes, unabhängig betriebenes Leaderboard. Kimi K3 ging innerhalb weniger Stunden nach dem Release von #18 auf #1, erzielte 1.679 und landete in 6 von 7 Frontend-Domains auf Platz eins — und überholte Claude Fable 5.
Weil dies community-gewählt statt fester Testsets ist, ist es schwerer durch Trainingsdaten-Overlap zu manipulieren — das macht es zu einem der glaubwürdigeren Signale in diesem gesamten Launch, nicht nur dem lautesten.
Head-to-Head: Kimi K3 vs. Claude Opus 4.8
Über die Benchmarks, auf denen beide üblicherweise evaluiert werden:
Kimi K3 führt bei: BrowseComp, CharXiv-R, DeepSearchQA, FrontierSWE, GDPval-AA, MCP Atlas, Toolathlon (7 Benchmarks)
Claude Opus 4.8 führt bei: GPQA Diamond, Humanity's Last Exam, OfficeQA Pro (3 Benchmarks)
Das Muster ist konsistent: K3 gewinnt bei agentischen, tool-nutzenden und coding-adjacenten Aufgaben; Opus 4.8 gewinnt bei reinem akademischen Reasoning und wissenslastigen Aufgaben. Wenn Ihr Produkt eher wie ein Agent als wie ein Quiz-Taker aussieht, begünstigt dieses Muster K3.
Head-to-Head: Kimi K3 vs. Claude Fable 5
Fable 5 ist das neuere, stärkere Claude-Modell — und das zeigt sich: Über 14 gemeinsame Benchmarks gewinnt Fable 5 etwa 8, einschließlich eines 5,4-Punkte-Vorsprungs bei FrontierSWE und eines Sweeps beider Visual-Reasoning-Suiten. Kimi K3 gewinnt etwa 6, einschließlich SWE Marathon (um ~7 Punkte), BrowseComp und Terminal-Bench 2.1.
Der vollständige Vergleich — einschließlich Preisen und workload-spezifischer Empfehlung — steht in Kimi K3 vs Claude: Fable 5 und Opus 4.8 im Vergleich.
Geschwindigkeit und Latenz
Benchmarks messen Korrektheit; für viele reale Anwendungen zählt Latenz genauso.
| Metrik | Kimi K3 | Claude Opus 4.8 (Max effort) |
|---|---|---|
| Output-Geschwindigkeit | ~62 Token/s | ~56 Token/s |
| Time to first token | ~1,99 s | ~34,49 s |
Die Time-to-First-Token-Lücke ist die folgenreichere Zahl für nutzerorientierte Produkte — Opus 4.8s Max-Reasoning-Effort-Modus verbringt lange Zeit mit „Denken“, bevor das erste Token erscheint, während K3s dauerhaft aktiver Thinking Mode darauf getrimmt ist, viel früher zu streamen. Wenn Sie etwas mit sichtbarem Ladezustand bauen, spüren Nutzer diesen Unterschied — nicht nur in einer Tabelle.
Methodik-Hinweise — lesen Sie dies, bevor Sie etwas entscheiden
Ein paar Dinge, die Sie wissen sollten, bevor Sie das Obige als Evangelium behandeln:
- Reasoning Effort zählt. Kimis gemeldete Ergebnisse nutzen Reasoning Effort „max“, Temperatur 1,0 und top-p 1,0. Eine andere Konfiguration — einschließlich dessen, was Ihr Produktions-Deployment standardmäßig nutzt — kann Werte spürbar verschieben.
- Harness-Wahl zählt. Agentische Benchmarks laufen über einen Harness (Kimi Code, Claude Code, Codex usw.), und der Harness selbst — wie er Retries, Context Management und Tool-Orchestrierung handhabt — kann Werte um mehrere Punkte verschieben, unabhängig vom zugrunde liegenden Modell.
- Das sind tagealte Zahlen. K3 erschien am 16. Juli 2026. Einige kursierende Werte (einschließlich einiger oben) stammen von einem einzelnen Aggregator oder Vendor-Claim statt mehrfacher unabhängiger Replikation. Erwarten Sie Revisionen, wenn mehr der Community eigene Evaluationen fährt — besonders sobald die öffentlichen Gewichte am 27. Juli 2026 erscheinen und unabhängige Gruppen das echte Modell statt der gehosteten API testen können.
- Composite-Indizes verbergen Kategorie-Leistung. Eine einzelne Intelligence-Index-Zahl ist praktisch, glättet aber echte Unterschiede — ein Modell, das bei allem mittelmäßig ist, und eines, das brillant beim Coding aber schwach bei Trivia ist, können denselben Composite-Wert erreichen. Prüfen Sie immer die Kategorie-Aufschlüsselung für Ihren tatsächlichen Use Case.
Was das nach Workload bedeutet
| Workload | Wie K3 in Benchmarks abschneidet | Urteil |
|---|---|---|
| Frontend / UI-Code-Generierung | #1 in LMArena Frontend Code Arena | Starke Wahl |
| Langfristige autonome Coding-Agenten | Führt bei SWE Marathon, Terminal-Bench 2.1 | Starke Wahl |
| Agentische Web-Recherche | Führt Fable 5 bei BrowseComp an | Starke Wahl |
| Frontier Software Engineering (härteste Stufe) | Hinter Fable 5 bei FrontierSWE um 5,4 Pkt. | Fable 5 ebenfalls evaluieren |
| Akademisches Reasoning / Wissenschafts-QA | Hinter Opus 4.8 bei GPQA, HLE | Opus 4.8 / Fable 5 evaluieren |
| Kosten-sensitive Agent-Workloads in Scale | Nahe-Frontier-Wert zu einem Bruchteil des Preises | Starke Wahl |
Fazit
Kimi K3s Benchmark-Story ist wirklich gut, nicht nur laut: ein #1-Ergebnis in einem community-gewählten Coding-Leaderboard, ein Composite-Wert vor Claude Opus 4.8 und klare Siege in den agentischen und Tool-Use-Kategorien, die für alle zählen, die autonome Coding- oder Recherche-Agenten bauen. Es ist nicht das intelligenteste Modell auf dem Markt — Claude Fable 5 führt noch bei Frontier Engineering und akademischem Reasoning — aber es ist nah genug, zu einem niedrigen genug Preis, dass „K3 zuerst testen“ ein vernünftiger Default für die meisten agentischen und Coding-Workloads in diesem Launch-Fenster ist.
Zur Preisseite der Gleichung siehe Kimi K3 Preise. Für den vollständigen Modell-gegen-Modell-Breakdown siehe Kimi K3 vs Claude.
FAQ
Ist Kimi K3 besser als Claude Opus 4.8? Bei den meisten gemeinsamen Benchmarks ja — K3 führt bei 7 von 10 verglichenen Evaluationen, einschließlich BrowseComp, FrontierSWE und GDPval-AA, und erzielt einen höheren Artificial Analysis Intelligence Index (57 vs. 56). Opus 4.8 führt noch bei GPQA Diamond, Humanity's Last Exam und OfficeQA Pro.
Ist Kimi K3 besser als Claude Fable 5? Insgesamt nicht — Fable 5 gewinnt grob 8 von 14 gemeinsamen Benchmarks und erzielt einen höheren Intelligence Index (60 vs. 57). K3 gewinnt bei langfristigem agentischem Coding, BrowseComp und Terminal-Bench 2.1 und kostet pro Aufgabe deutlich weniger.
Wie lautet Kimi K3s Wert im Artificial Analysis Intelligence Index? 57, Stand der v4.1-Methodik des Index — zwischen Claude Opus 4.8 (56) und Claude Fable 5 (60).
Hat Kimi K3 wirklich #1 in einem Coding-Leaderboard erreicht? Ja — LMArenas Frontend Code Arena, ein crowd-gewähltes Leaderboard, stufte K3 innerhalb weniger Stunden nach dem Release auf #1, von #18, überholte Claude Fable 5 und landete in 6 von 7 Frontend-Domains auf Platz eins.
Sind Kimi K3s Benchmark-Zahlen verlässlich? Sie sind ein vernünftiges Frühsignal, aber kein endgültiges Urteil. Die meisten Werte sind Vendor-gemeldet oder stammen von einem einzelnen unabhängigen Aggregator (Artificial Analysis), evaluiert unter spezifischen Einstellungen (max reasoning effort). Erwarten Sie Verfeinerung, wenn mehr Gruppen das Modell unabhängig testen — besonders nach dem Erscheinen der öffentlichen Gewichte.
Verwandte Leitfäden
Verwandte Leitfäden
Gehen Sie im Gemma-4-Cluster mit dem nächsten Leitfaden weiter, der zu Ihrer aktuellen Entscheidung passt.

Kimi K3: Moonshot AIs 2,8T Open-Weight-Modell erklärt
Moonshot AIs Kimi K3 erschien am 16. Juli 2026 als 2,8-Billionen-Parameter Open-Weight-Modell, das Claude Opus 4.8 in mehreren Benchmarks schlägt. Hier erfahren Sie, was es wirklich ist, was noch fehlt und wie Sie es heute testen können.

Kimi K3 Preise: API-Kosten, Abonnementpläne und was wirklich kostenlos ist
Kimi K3s API kostet 3 $ pro Million Input-Token und 15 $ pro Million Output — aber der dauerhaft aktive Thinking Mode bedeutet, dass Sie bei jedem einzelnen Aufruf für Reasoning-Token zahlen. Hier, was das wirklich kostet.

Kimi K3 vs Claude: Fable 5 und Opus 4.8 im Vergleich
Kimi K3 schlägt Claude Opus 4.8 bei Preis und den meisten Benchmarks, aber Claude Fable 5 führt noch bei Frontier Engineering. Hier genau, wo jedes Modell gewinnt — aus Artificial Analysis und den eigenen Zahlen der Anbieter.
Sie wissen noch nicht, was Sie als Nächstes lesen sollen?
Gehen Sie zurück zum Leitfaden-Hub, um Modellvergleiche, Setup-Anleitungen und Seiten zur Hardware-Planung zu durchsuchen.
