Gemma 4 ガイド

Kimi K3 価格:API コスト、サブスクリプションプラン、実際に無料なもの

約 9 分
kimi k3kimi apiapi pricingllm pricingmoonshot ai
Kimi K3 価格:API コスト、サブスクリプションプラン、実際に無料なもの

Kimi K3 価格:API コスト、サブスクリプションプラン、実際に無料なもの

Kimi K3 の headline API 価格 — 入力 100 万トークンあたり $3、出力 $15 — は Claude や GPT tier 価格と比べ competitive に読める。実際にそうです。ただし K3 には token 価格以上に計算を変える 1 つの性質があります:thinking mode は常時オンで無効化できない。 すべての呼び出しで reasoning token 分を払い、output として請求される。欲しかったかどうかに関係なく。本稿では real pricing 構造、reasoning token コストが請求にどう現れるか、API とは完全に別プロダクトの一般向けサブスク tier をカバーします。

token コスト tier、cache-hit メーター、reasoning-effort toggle オプションを示す Kimi K3 価格ダッシュボードイラスト

先に結論

  • API 価格: 入力 $3 / MTok、出力 $15 / MTok、cached input $0.30 / MTok(cache hit で 90% 割引)。
  • Base URL: https://api.moonshot.ai/v1、OpenAI 互換。Model ID: kimi-k3
  • キー取得: platform.kimi.ai または platform.moonshot.ai(同一 underlying console)。
  • Thinking mode はオフにできない。 K3 は常に回答前に reason し、reasoning token は output token として請求 — 独立テストでは max reasoning effort で短い 1 タスクに 13,000 超の thinking token を記録。
  • Reasoning effort は 3 tier — Standard、High、Max — セッション途中で切り替えると context cache が無効化され、高コストな re-prefill が発生。
  • Caching は自動。 手動 cache ID や TTL 設定不要。Moonshot は coding workload で 90% 超の cache hit rate を報告。
  • OpenRouter でも moonshotai/kimi-k3、同じ $3/$15 per-million 価格。
  • 一般向けアプリサブスク(Adagio/Moderato/Allegretto/Allegro/Vivace、$0–$199/月)は API とは別請求。API 呼び出しは含まれない。

Kimi K3 API キーの取得方法

  1. platform.kimi.ai(または platform.moonshot.ai — どちらも現在は同一 developer console にルーティング)にアクセスし、サインインまたはアカウント作成。
  2. 必要な verification を完了。
  3. API keys セクションを開き新しいキーを作成。すぐにコピー — 1 回しか表示されない。
  4. handful の test call を超えて何か走らせる前に budget cap と low-balance alert を設定。常時オン reasoning token があるため、headline per-token 価格だけ見た期待よりコストは速く上がりうる。

キーは secret として扱う — 環境変数または secret manager、ソースに commit しない。

Kimi K3 公式価格

Cached input Input Output
Kimi K3 $0.30 / MTok $3.00 / MTok $15.00 / MTok

cached と uncached input の差は 10 倍、input と output の差は 5 倍。次に述べる理由で、両 multiplier は多くのモデルより K3 で重要。

「常時オン thinking」が請求を変える理由

多くのモデルは visible reasoning に token を使うか選べる。Kimi K3 は選べない — すべての response に final answer の前に生成される reasoning_content が含まれ、Moonshot は reasoning token を output token として full $15/MTok レートで請求。

実務では:

  • 短い factual answer でも見た目以上に高くなりうる。 独立テストでは final answer が数文のタスクに 13,000 超の thinking token を記録。$15/MTok なら reasoning だけでおおよそ $0.20、visible answer 生成前。
  • opt out 不可。 Kimi K2.6 とは違い thinking mode を latency / cost sensitive な呼び出しで完全 off にできない。K3 に instant mode はない。high-volume で latency または cost sensitive — autocomplete、単純 classification、短い chat reply — なら、K3 の per-call floor は sticker price より高い。
  • 制御できるのは reasoning effort であり reasoning そのものではない。 K3 は reasoning_effort パラメータで 3 tier — StandardHighMax — を公開。reason するかどうかではなく、どれだけ reason するかを変える。

Reasoning effort tier と cache trap

3 effort tier(Standard / High / Max)は cost と latency を answer quality と trade できる。catch:セッション途中で reasoning effort を切り替えると context cache が無効化される。 大きな cached context — 長い会話、大きな document、agent の running tool-call history — を積み上げた後、Max から High(または逆)に切り替えると、その cache 全体が forfeited され、次の呼び出しが full uncached-input 価格で re-prefill される。

実務ルール:workload ごとに 1 つの reasoning effort tier を選び、その session または agent run の life 中 stick する。 cache-invalidation cost がその case で worth か確認しない限り、会話途中で effort を dynamic に adjust しない。

Kimi K3 で caching が実際にどう動くか

一部プロバイダと違い caching は手動管理不要 — cache ID 作成や TTL 設定なし。Moonshot プラットフォーム(Mooncake disaggregated inference architecture 上)が repeated prefix を自動 cache し、coding workload で 90% 超の cache hit rate を報告。

実務でその hit rate を得るには:

  • 安定コンテンツ — system prompt、tool 定義、長い reference document — を prompt の 先頭に。
  • 毎回変わる部分 — ユーザーの最新メッセージ、最新 tool result — を 末尾に。
  • session 内で reasoning effort tier を一定に(上記参照)。
  • 呼び出し間で system prompt を reorder したり軽く reword しない。小さな変更でも prefix match を壊し cache miss を強制しうる。

OpenAI 互換リクエスト形式

Kimi K3 API は OpenAI Chat Completions の request/response shape に合わせているので、base URL と model 名を変えれば OpenAI SDK が使える。

curl

curl https://api.moonshot.ai/v1/chat/completions \
  -H "Authorization: Bearer $MOONSHOT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {"role": "user", "content": "Summarize the tradeoffs of hybrid linear attention in two sentences."}
    ]
  }'

Python(OpenAI SDK)

from openai import OpenAI

client = OpenAI(
    api_key="your-moonshot-api-key",
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "user", "content": "Write a Python function to debounce calls."}
    ],
)
print(response.choices[0].message.content)

reasoning effort の設定

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[...],
    extra_body={"reasoning_effort": "standard"},  # "standard" | "high" | "max"
)

覚えておくこと:同一 session 内の呼び出し間でこの値を変えると cache が無効化される。

OpenRouter で Kimi K3 を使う

K3 は OpenRouter でも moonshotai/kimi-k3 として listed。direct API と同じ $3/$15 per-million 価格。複数 model provider を OpenRouter 経由でルーティング済みで、別 Moonshot アカウントなしで K3 を追加したいなら reasonable オプション — funded OpenRouter アカウントと OpenRouter dashboard からの key が必要。

Kimi K3 は無料か?

3 つの別質問、3 つの別答え:

Kimi 一般向けアプリまたは Web チャットを使う。 Yes、usage limit 付き無料 tier(Adagio)あり。API ではない — API credit を消費せず、別請求(または非請求)。

Kimi K3 API を使う。 本番向け ongoing 無料 tier なし。新規アカウントは test 用 limited trial がある場合あり。 sustained usage は funded 有料アカウントが必要。

OpenRouter 等 router 経由で Kimi K3。 完全別請求。独自 credit システム。「Kimi API」ではないが同じ model に到達。

一般向けサブスクリプション tier

API とは別プロダクト。Web アプリ、モバイルアプリ、Kimi Code CLI、agent credits、Slides、その他ツールをカバー:

Tier Price/month Covers
Adagio Free Web/mobile chat、limited usage
Moderato $19 Higher usage caps
Allegretto $39 Higher usage caps、more agent credits
Allegro $99 Heavy usage、expanded tools
Vivace $199 Highest tier、maximum agent credits

いずれの tier も API access を含まない — プロダクトや integration を作るなら、個人のサブスク tier に関係なく別途 paid API アカウントが必要。

注意すべき追加コスト

  • すべての呼び出しでの reasoning token。 上記 — K3 固有の最大 surprise-cost 要因。
  • Cache を無効化する effort 切り替え。 セッション途中で reasoning_effort を変えると cache を forfeit し full price re-prefill。
  • Agent loop。 tool-using agent の各 step は通常 system prompt、tool schema、running history を re-send。各 step に reasoning token が上乗せされると、長い agent run は cost が速く accumulate — max step cap と wall-clock timeout を設定。
  • Tool と search 料金 — Moonshot 組み込み tool を使う場合。model token とは別請求で、結果は次 request の input に加算。現在の tools pricing page を確認。

Kimi K3 API コストのコントロール方法

  • test を超えて scale する前に console で hard budget cap と low-balance alert を設定。
  • workload ごとに 1 つの reasoning effort tier を選び、session 途中で切り替えない。
  • prompt を cache-first で構造化:安定コンテンツを先、volatile コンテンツを後。
  • 常に max_tokens を pass。agent loop では reasoning token が otherwise 長く走りうる。
  • step counter と timeout で agent loop を bound
  • input、output、cached-input、reasoning token count を別々に log し、請求の出所を正確に把握 — visible output だけ log すると reasoning token は見落としやすい。

最終 recommendation

Kimi K3 の per-token 価格は genuinely competitive。caching story も reasoning-effort tradeoff を理解すれば strong。ただし常時オン thinking mode は「単純」呼び出しの effective cost を headline 価格が示すより高く、Kimi K2.6(reasoning を完全 off 可能)より高い。high-volume、latency-sensitive workload に K3 を commit する前に、real test batch を走らせ reasoning token 消費を specifically log — sticker price が全体像とは限らない。

Claude との直接価格比較は Kimi K3 vs Claude。モデル概要は Kimi K3 解説 から。

FAQ

Kimi K3 の価格は?
入力 100 万トークンあたり $3、出力 $15、cached input hit は $0.30 — cache hit でおおよそ 90% 割引。

Kimi K3 で thinking mode を off にして節約できる?
No。Kimi K2.6 とは違い Kimi K3 は常に thinking mode。reasoning effort tier(Standard、High、Max)の adjust のみ可能。reasoning 自体は off にできない。

Kimi K3 の請求が想定より高い理由は?
最も common な原因は reasoning token — K3 はすべての呼び出しで reasoning_content を生成し、$15/MTok の output として請求。短い visible answer の前に数千 reasoning token がありうる。real breakdown を見るには reasoning token count を別 log。

reasoning effort を切り替えると節約になる?
呼び出しあたり reasoning token volume は減らせるが、session 途中で effort tier を切り替えると context cache が無効化され full-price re-prefill。dynamic adjust より session ごとに 1 tier を選ぶ。

Kimi K3 は無料で使える?
一般向け chat アプリに無料 tier(Adagio)。API に ongoing 本番無料 tier はない — 新規アカウントは limited trial がある場合あり。 sustained usage は有料。

Kimi K3 API キーの取得方法は?
platform.kimi.ai または platform.moonshot.ai でサインイン、API keys セクションで新 key 作成。常時オン reasoning token cost を踏まえ、すぐ budget cap を設定。

Kimi K3 は Claude より安い?
Per-token basis では yes — K3 の $3/$15 は Claude Opus 4.8 の $5/$25 を undercut。ただし Opus 4.8 は reasoning effort をより granular に制御できるので、direct comparison は実際の token mix 次第。完全価格比較 を参照。

関連ガイド

関連記事

Gemma 4 の記事群をそのまま辿り、今の判断にいちばん近い次の記事へ進んでください。

Kimi K3 ベンチマーク:実際の位置づけ

Kimi K3 ベンチマーク:実際の位置づけ

Kimi K3 はリリースから 1 日以内に LMArena Frontend Code Arena で 1 位となり、Artificial Analysis Intelligence Index で Claude Opus 4.8 を上回りました。数字が実際に何を示し、どこが物語の全体像を語らないかを整理します。

次に何を読めばいいか迷っていますか?

ガイド一覧に戻って、モデル比較、ローカル導入、ハードウェア計画の3方向から続けて見ていけます。