Gemma-4-Leitfäden

Kimi K3 Preise: API-Kosten, Abonnementpläne und was wirklich kostenlos ist

9 Min. Lesezeit
kimi k3kimi apiapi pricingllm pricingmoonshot ai
Kimi K3 Preise: API-Kosten, Abonnementpläne und was wirklich kostenlos ist

Kimi K3 Preise: API-Kosten, Abonnementpläne und was wirklich kostenlos ist

Kimi K3s Schlagzeilen-API-Preis — 3 $ pro Million Input-Token, 15 $ pro Million Output — liest sich im Vergleich zu Claude- und GPT-Preisen konkurrenzfähig. Ist er auch. Aber K3 hat eine Eigenschaft, die die Rechnung mehr verändert als der Token-Preis: Der Thinking Mode ist dauerhaft aktiv und kann nicht deaktiviert werden. Jeder Aufruf zahlt für Reasoning-Token, abgerechnet als Output — ob Sie sie wollten oder nicht. Dieser Leitfaden deckt die echte Preisstruktur ab, wie Reasoning-Token-Kosten tatsächlich auf Ihrer Rechnung erscheinen, und die Consumer-Abonnement-Stufen — ein völlig separates Produkt von der API.

Kimi-K3-Preis-Dashboard-Illustration mit Token-Kosten-Stufen, Cache-Hit-Meter und Reasoning-Effort-Umschaltoptionen

Kurzantwort

  • API-Preise: 3 $ / MTok Input, 15 $ / MTok Output, 0,30 $ / MTok gecachter Input (90-%-Rabatt bei Cache Hits).
  • Base URL: https://api.moonshot.ai/v1, OpenAI-kompatibel. Model ID: kimi-k3.
  • Schlüssel unter: platform.kimi.ai oder platform.moonshot.ai (gleiche zugrunde liegende Konsole).
  • Thinking Mode kann nicht ausgeschaltet werden. K3 denkt immer vor der Antwort, und diese Reasoning-Token werden als Output-Token abgerechnet — unabhängige Tests haben über 13.000 Thinking-Token für eine einzelne kurze Aufgabe bei max reasoning effort erfasst.
  • Reasoning Effort hat drei Stufen — Standard, High, Max — und das Wechseln zwischen ihnen mitten in einer Session invalidiert Ihren Context Cache und erzwingt ein teures Re-Prefill.
  • Caching ist automatisch. Keine manuelle Cache-ID- oder TTL-Konfiguration; Moonshot meldet über 90-%-Cache-Hit-Raten bei Coding-Workloads.
  • Auch auf OpenRouter als moonshotai/kimi-k3, gleiche 3 $/15 $-Preise pro Million.
  • Consumer-App-Abonnements (Adagio/Moderato/Allegretto/Allegro/Vivace, 0–199 $/Monat) werden getrennt von der API abgerechnet und schließen keine API-Aufrufe ein.

So erhalten Sie einen Kimi K3 API-Schlüssel

  1. Gehen Sie zu platform.kimi.ai (oder platform.moonshot.ai — beide leiten derzeit zur gleichen Developer-Konsole) und melden Sie sich an oder erstellen Sie ein Konto.
  2. Schließen Sie die erforderliche Verifizierung ab.
  3. Öffnen Sie den API-Keys-Bereich und erstellen Sie einen neuen Schlüssel. Kopieren Sie ihn sofort — er wird nur einmal angezeigt.
  4. Setzen Sie ein Budget-Limit und eine Low-Balance-Warnung, bevor Sie mehr als ein paar Testaufrufe fahren. Mit dauerhaft aktiven Reasoning-Token können Kosten schneller steigen, als Sie allein vom Schlagzeilen-Token-Preis erwarten würden.

Behandeln Sie den Schlüssel als Geheimnis — Umgebungsvariable oder Secret Manager, niemals im Quellcode committen.

Kimi K3 offizielle Preise

Gecachter Input Input Output
Kimi K3 0,30 $ / MTok 3,00 $ / MTok 15,00 $ / MTok

Das ist ein 10-facher Unterschied zwischen gecachtem und ungecachtem Input und ein 5-facher zwischen Input und Output. Beide Multiplikatoren zählen bei K3 mehr als bei den meisten Modellen — aus dem im nächsten Abschnitt genannten Grund.

Warum „dauerhaft aktiver Thinking Mode“ Ihre Rechnung verändert

Die meisten Modelle lassen Sie wählen, ob Sie Token für sichtbares Reasoning ausgeben. Kimi K3 nicht — jede Antwort enthält reasoning_content, das vor der finalen Antwort generiert wird, und Moonshot rechnet diese Reasoning-Token als Output-Token zum vollen Satz von 15 $/MTok ab.

In der Praxis bedeutet das:

  • Eine kurze sachliche Antwort kann weit mehr kosten, als es aussieht. Unabhängige Tests haben über 13.000 Thinking-Token für eine Aufgabe dokumentiert, deren finale Antwort aus wenigen Sätzen bestand. Bei 15 $/MTok sind das grob 0,20 $ allein für Reasoning, bevor die sichtbare Antwort generiert wird.
  • Sie können nicht opt-outen. Anders als Kimi K2.6, das den Thinking Mode für latenz- und kostensensitive Aufrufe vollständig deaktivieren ließ, hat K3 keinen „Instant“-Modus. Wenn Ihr Workload volumenstark und latenz- oder kostensensitiv ist — Autocomplete, einfache Klassifikation, kurze Chat-Antworten — ist K3s Floor pro Aufruf höher, als der Sticker-Preis vermuten lässt.
  • Was Sie steuern können, ist Reasoning Effort, nicht Reasoning selbst. K3 bietet einen reasoning_effort-Parameter mit drei Stufen — Standard, High und Max — der ändert, wie viel das Modell denkt, nicht ob es überhaupt denkt.

Reasoning-Effort-Stufen und die Cache-Falle

Die drei Effort-Stufen (Standard / High / Max) lassen Sie Kosten und Latenz gegen Antwortqualität tauschen. Der Haken: Das Wechseln des Reasoning Effort mitten in einer Session invalidiert Ihren Context Cache. Wenn Sie einen großen gecachten Kontext aufgebaut haben — langes Gespräch, großes Dokument, laufende Tool-Call-Historie eines Agenten — und dann von Max auf High wechseln (oder umgekehrt), geht der gesamte Cache verloren und der nächste Aufruf prefilled ihn zum vollen ungecachten Input-Preis neu.

Die praktische Regel: Wählen Sie eine Reasoning-Effort-Stufe pro Workload und bleiben Sie dabei für die Lebensdauer dieser Session oder Agent-Run. Passen Sie Effort nicht dynamisch mitten im Gespräch an, es sei denn, Sie haben bestätigt, dass die Cache-Invalidierungs-Kosten für diesen Fall lohnen.

Wie Caching bei Kimi K3 wirklich funktioniert

Anders als bei manchen Anbietern verwalten Sie Caching nicht manuell — es gibt keine Cache-ID zum Erstellen oder TTL zum Setzen. Moonshots Plattform (auf ihrer Mooncake disaggregated inference architecture) cached automatisch wiederholte Präfixe und meldet Cache-Hit-Raten über 90 % bei Coding-Workloads.

Um diese Hit-Rate in der Praxis zu erreichen:

  • Setzen Sie stabilen Inhalt — System-Prompts, Tool-Definitionen, lange Referenzdokumente — zuerst in den Prompt.
  • Setzen Sie den Teil, der sich bei jedem Aufruf ändert — die neueste Nutzernachricht, das neueste Tool-Ergebnis — zuletzt.
  • Halten Sie Ihre Reasoning-Effort-Stufe innerhalb einer Session konstant (siehe oben).
  • Vermeiden Sie Umsortieren oder leichtes Umformulieren Ihres System-Prompts zwischen Aufrufen; schon kleine Änderungen können den Präfix-Match brechen und einen Cache Miss erzwingen.

OpenAI-kompatibles Request-Format

Kimi K3s API entspricht der OpenAI Chat Completions Request/Response-Form — jedes OpenAI SDK funktioniert durch Änderung von Base URL und Modellname.

curl

curl https://api.moonshot.ai/v1/chat/completions \
  -H "Authorization: Bearer $MOONSHOT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {"role": "user", "content": "Summarize the tradeoffs of hybrid linear attention in two sentences."}
    ]
  }'

Python (OpenAI SDK)

from openai import OpenAI

client = OpenAI(
    api_key="your-moonshot-api-key",
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "user", "content": "Write a Python function to debounce calls."}
    ],
)
print(response.choices[0].message.content)

Reasoning Effort setzen

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[...],
    extra_body={"reasoning_effort": "standard"},  # "standard" | "high" | "max"
)

Denken Sie daran: Das Ändern dieses Werts zwischen Aufrufen in derselben Session invalidiert Ihren Cache.

Kimi K3 auf OpenRouter nutzen

K3 ist auch auf OpenRouter als moonshotai/kimi-k3 gelistet, zum gleichen 3 $/15 $-Preis pro Million wie die direkte API. Das ist eine vernünftige Option, wenn Sie bereits mehrere Modellanbieter über OpenRouter routen und K3 ohne separates Moonshot-Konto hinzufügen wollen — Sie brauchen ein finanziertes OpenRouter-Konto und einen Schlüssel aus dem OpenRouter-Dashboard.

Ist Kimi K3 kostenlos?

Drei verschiedene Fragen, drei verschiedene Antworten:

Nutzung der Kimi Consumer-App oder Web-Chat. Ja, es gibt eine kostenlose Stufe (Adagio) mit Nutzungslimits. Das ist nicht die API — sie verbraucht keine API-Credits und wird getrennt abgerechnet (oder nicht).

Nutzung der Kimi K3 API. Kein dauerhafter kostenloser Tier für Produktion. Neue Konten können begrenzten Trial-Zugang zum Testen erhalten, aber anhaltende Nutzung erfordert ein finanziertes, bezahltes Konto.

Nutzung von Kimi K3 über OpenRouter oder ähnliche Router. Völlig getrennte Abrechnung mit eigenen Credit-Systemen. Nicht „die Kimi API“, obwohl dasselbe Modell erreicht wird.

Consumer-Abonnement-Stufen

Separates Produkt von der API, deckt Web-App, Mobile-App, Kimi Code CLI, Agent-Credits, Slides und andere Tools:

Stufe Preis/Monat Deckt ab
Adagio Kostenlos Web/Mobile-Chat, begrenzte Nutzung
Moderato 19 $ Höhere Nutzungslimits
Allegretto 39 $ Höhere Limits, mehr Agent-Credits
Allegro 99 $ Starke Nutzung, erweiterte Tools
Vivace 199 $ Höchste Stufe, maximale Agent-Credits

Keine dieser Stufen schließt API-Zugang ein — wenn Sie ein Produkt oder eine Integration bauen, brauchen Sie unabhängig von Ihrer persönlichen Abonnement-Stufe ein separates, bezahltes API-Konto.

Zusätzliche Kosten, auf die Sie achten sollten

  • Reasoning-Token bei jedem Aufruf. Oben behandelt — das ist der größte Überraschungs-Kostenfaktor speziell bei K3.
  • Cache-invalidierende Effort-Wechsel. Das Ändern von reasoning_effort mitten in einer Session verwirkt Ihren Cache und prefilled zum Vollpreis neu.
  • Agent-Loops. Jeder Schritt in einem tool-nutzenden Agenten sendet typischerweise System-Prompt, Tool-Schemas und laufende Historie erneut. Mit Reasoning-Token obendrauf bei jedem Schritt können lange Agent-Runs schnell Kosten ansammeln — begrenzen Sie max steps und setzen Sie Wall-Clock-Timeouts.
  • Tool- und Suchgebühren, wenn Sie Moonshots eingebaute Tools nutzen — prüfen Sie die aktuelle Tools-Preisseite, da diese getrennt von Modell-Token abgerechnet werden und die Ergebnisse in den Input Ihres nächsten Requests zurückfließen.

So kontrollieren Sie Kimi K3 API-Kosten

  • Setzen Sie ein hartes Budget-Limit und eine Low-Balance-Warnung in der Konsole, bevor Sie über Tests hinaus skalieren.
  • Wählen Sie eine Reasoning-Effort-Stufe pro Workload und wechseln Sie nicht mitten in der Session.
  • Strukturieren Sie Prompts cache-first: stabiler Inhalt früh, volatiler Inhalt spät.
  • Übergeben Sie immer max_tokens, besonders in Agent-Loops, wo Reasoning-Token sonst lange laufen können.
  • Begrenzen Sie Agent-Loops mit Schrittzähler und Timeout.
  • Loggen Sie Input-, Output-, gecachte-Input- und Reasoning-Token-Zähler getrennt, damit Sie genau sehen, woher die Rechnung kommt — Reasoning-Token sind leicht zu übersehen, wenn Sie nur sichtbaren Output loggen.

Abschließende Empfehlung

Kimi K3s Token-Preis ist wirklich konkurrenzfähig, und die Caching-Story ist stark, sobald Sie den Reasoning-Effort-Tradeoff verstehen. Aber der dauerhaft aktive Thinking Mode bedeutet, dass die effektiven Kosten eines „einfachen“ Aufrufs höher sind, als der Schlagzeilen-Preis vermuten lässt — und höher als bei Kimi K2.6, das Reasoning vollständig abschalten ließ. Bevor Sie K3 für einen volumenstarken, latenzsensitiven Workload festlegen, fahren Sie einen echten Test-Batch und loggen Sie Reasoning-Token-Verbrauch gezielt — nehmen Sie nicht an, der Sticker-Preis erzählt die ganze Geschichte.

Wie K3s Preise direkt gegen Claude abschneiden, siehe Kimi K3 vs Claude. Für den vollständigen Modellüberblick starten Sie bei Kimi K3 erklärt.

FAQ

Wie viel kostet Kimi K3? 3 $ pro Million Input-Token, 15 $ pro Million Output-Token und 0,30 $ pro Million bei gecachten Input Hits — grob 90-%-Rabatt bei Cache Hits.

Kann ich den Thinking Mode bei Kimi K3 deaktivieren, um Geld zu sparen? Nein. Anders als Kimi K2.6 läuft Kimi K3 immer im Thinking Mode. Sie können nur die Reasoning-Effort-Stufe anpassen (Standard, High, Max), nicht Reasoning vollständig abschalten.

Warum ist meine Kimi K3 Rechnung höher als erwartet? Die häufigste Ursache sind Reasoning-Token — K3 generiert bei jedem Aufruf reasoning_content, abgerechnet als Output-Token zu 15 $/MTok. Einer kurzen sichtbaren Antwort können Tausende Reasoning-Token vorausgehen. Loggen Sie Reasoning-Token-Zähler getrennt, um die echte Aufschlüsselung zu sehen.

Spart das Wechseln des Reasoning Effort Geld? Es kann das Reasoning-Token-Volumen pro Aufruf reduzieren, aber das Wechseln der Effort-Stufen mitten in einer Session invalidiert Ihren Context Cache und erzwingt ein Re-Prefill zum Vollpreis. Wählen Sie eine Stufe pro Session statt dynamischer Anpassung.

Ist Kimi K3 kostenlos nutzbar? Die Consumer-Chat-App hat eine kostenlose Stufe (Adagio). Die API hat keinen dauerhaften kostenlosen Produktions-Tier — neue Konten können begrenzten Trial-Zugang erhalten, aber anhaltende Nutzung ist kostenpflichtig.

Wie erhalte ich einen Kimi K3 API-Schlüssel? Melden Sie sich unter platform.kimi.ai oder platform.moonshot.ai an, öffnen Sie den API-Keys-Bereich und erstellen Sie einen neuen Schlüssel. Setzen Sie sofort ein Budget-Limit angesichts der dauerhaft aktiven Reasoning-Token-Kosten.

Ist Kimi K3 günstiger als Claude? Pro Token ja — K3s 3 $/15 $-Preise unterbieten Claude Opus 4.8s 5 $/25 $. Aber Opus 4.8 lässt Reasoning Effort granularer steuern, daher hängt ein direkter Vergleich von Ihrem tatsächlichen Token-Mix ab. Siehe den vollständigen Preisvergleich.

Verwandte Leitfäden

Verwandte Leitfäden

Gehen Sie im Gemma-4-Cluster mit dem nächsten Leitfaden weiter, der zu Ihrer aktuellen Entscheidung passt.

Kimi K3 Benchmarks: Wie es wirklich abschneidet

Kimi K3 Benchmarks: Wie es wirklich abschneidet

Kimi K3 erreichte #1 in LMArenas Frontend Code Arena und schlug Claude Opus 4.8 im Artificial Analysis Intelligence Index innerhalb eines Tages nach dem Launch. Hier, was die Zahlen wirklich sagen — und wo sie nicht die ganze Geschichte erzählen.

Sie wissen noch nicht, was Sie als Nächstes lesen sollen?

Gehen Sie zurück zum Leitfaden-Hub, um Modellvergleiche, Setup-Anleitungen und Seiten zur Hardware-Planung zu durchsuchen.