Gemma 4 ガイド
Kimi K3 ベンチマーク:実際の位置づけ

Kimi K3 ベンチマーク:実際の位置づけ
Kimi K3 の 2026 年 7 月 16 日リリースから数時間で、LMArena Frontend Code Arena では #18 から #1 に急上昇し Claude Fable 5 を抜きました。Artificial Analysis Intelligence Index でも Claude Opus 4.8 より高いスコアを記録。この 2 点だけでローンチ週の騒ぎの大部分は説明できます — ただし leaderboard の 1 位は、モデルがどこが強くどこが弱いか、ギャップのどれだけが本物で harness ノイズかを理解する代用品にはなりません。
本稿はカテゴリ別の Kimi K3 ベンチマーク性能の breakdown です。Moonshot 自社資料と Artificial Analysis の独立評価をソースとし、いずれかを根拠に判断する前に知っておくべき methodology の caveat も含みます。

先に結論
- Artificial Analysis Intelligence Index v4.1: Kimi K3 は 57 点。Claude Opus 4.8(56)を上回り、Claude Fable 5(60)には及ばない。
- Frontend coding(LMArena Frontend Code Arena): Kimi K3 は #1。7 つの frontend ドメイン中 6 つで 1 位。Claude Fable 5 を抜いた。
- Agentic reasoning(GDPval-AA v2): Kimi K3 は ~1,687。Claude Opus 4.8(1,600)を上回るが、Claude Fable 5 Max(~1,815)と GPT-5.6 Sol Max(~1,748)には及ばない。
- Claude Fable 5 との head-to-head: 両社が報告するベンチマーク全体で Fable 5 がおおよそ 14 中 8、K3 がおおよそ 6 — 長期 horizon agentic coding、BrowseComp、Terminal-Bench 2.1 を含む。
- Claude Opus 4.8 との head-to-head: 比較された 10 ベンチマーク中 K3 が 7 つでリード(BrowseComp、FrontierSWE、GDPval-AA、Toolathlon 含む)。Opus 4.8 は GPQA Diamond、Humanity's Last Exam、OfficeQA Pro でリード。
- 速度: K3 はおおよそ 62 tokens/sec、time-to-first-token ~2 秒。Opus 4.8 の max-effort reasoning mode より notably 速い。
- Caveat: これらの数字は登場から数日、ほとんど vendor または単一 aggregator 報告。特定の評価設定(reasoning effort "max"、temperature 1.0、top-p 1.0)下での結果。確定 verdict ではなく強い early signal として扱ってください。
ヘッドライン数字:Artificial Analysis Intelligence Index
Artificial Analysis は GDPval-AA v2、Terminal-Bench 2.1、SciCode、Humanity's Last Exam、GPQA Diamond、long-context reasoning テストなど 9 評価を単一の Intelligence Index スコアに統合します。
| Model | AA Intelligence Index v4.1 |
|---|---|
| Claude Fable 5 (Adaptive, Max effort) | 60 |
| Kimi K3 (max reasoning effort) | 57 |
| Claude Opus 4.8 (Adaptive, Max effort) | 56 |
実際に重要な takeaway:K3 は市場で最も賢いモデルではないが、Fable 5 や Opus 4.8 が 1 task あたり請求する数分の一のコストで frontier から数点以内。多くの本番 use case では「frontier に近く、はるかに安い」が「frontier をわずかに上回るが高い」を勝る — ただし常にではない。だから下のカテゴリ breakdown が単一 composite 数字より重要です。
Agentic と long-horizon ベンチマーク
K3 が本当に強い領域。Moonshot が明らかに最適化したところ。
GDPval-AA v2
現実的で経済的価値のある knowledge work の性能を測る private agentic ベンチマーク。
| Model | GDPval-AA v2 (Elo) |
|---|---|
| Claude Fable 5 Max | ~1,815 |
| GPT-5.6 Sol Max | ~1,748 |
| Kimi K3 | ~1,687 |
| Claude Opus 4.8 | 1,600 |
K3 は全体 3 位 — 2 つの最も高価な closed-source frontier モデルに次ぐが、Opus 4.8 を明確に上回る。
AA-Briefcase(agentic knowledge work)
| Model | AA-Briefcase (Elo) |
|---|---|
| Claude Fable 5 Max | ~1,587 |
| Kimi K3 | ~1,527 |
| GPT-5.6 Sol Max | ~1,495 |
ここでは K3 が 2 位に上がり、GPT-5.6 Sol Max を上回る。
BrowseComp(agentic web research)
K3 は BrowseComp で Claude Fable 5 をリード — Moonshot にとって最も明確な勝利の 1 つ。自律 research や multi-step web navigation が workload に含まれるなら意味のある勝利。
Coding ベンチマーク
| Benchmark | Kimi K3 |
|---|---|
| Terminal-Bench 2.1 | 88.3 |
| FrontierSWE | 81.2 |
| Program Bench | 77.8 |
| DeepSWE | 67.5 |
| SWE Marathon | 42.0 |
SWE Marathon について:絶対スコアが低い(42.0)から弱いわけではない — 利用可能な最も難しい long-horizon coding ベンチマークの 1 つで、frontier モデルも絶対値では低く出る。重要なのは比較:K3 は SWE Marathon で Claude Fable 5 をおおよそ 7 点リード。この難易度では意味のある margin。
LMArena Frontend Code Arena
ローンチ日に最も注目を集めたベンチマーク。上記 vendor-reported 数字と違い、crowd-voted、独立運営の leaderboard。Kimi K3 はリリースから数時間で #18 から #1 に。1,679 点、7 つの frontend ドメイン中 6 つで 1 位。Claude Fable 5 を抜いた。
固定 test set ではなく community-voted なので、training-set overlap で game しにくい — このローンチ全体で最も credible なシグナルの 1 つ。単に loudest なだけではない。
Head-to-head:Kimi K3 vs Claude Opus 4.8
両方が commonly 評価されるベンチマーク全体:
Kimi K3 がリード: BrowseComp、CharXiv-R、DeepSearchQA、FrontierSWE、GDPval-AA、MCP Atlas、Toolathlon(7 ベンチマーク)
Claude Opus 4.8 がリード: GPQA Diamond、Humanity's Last Exam、OfficeQA Pro(3 ベンチマーク)
パターンは一貫:K3 は agentic、tool-using、coding-adjacent タスクで勝つ。Opus 4.8 は pure academic reasoning と knowledge-heavy タスクで勝つ。 プロダクトが quiz-taker より agent に近いなら、そのパターンは K3 に有利。
Head-to-head:Kimi K3 vs Claude Fable 5
Fable 5 は新しく強い Claude モデルで、それが表れる:14 共有ベンチマーク中 Fable 5 がおおよそ 8 勝。FrontierSWE で 5.4 点勝利、両 visual-reasoning suite を sweep。Kimi K3 がおおよそ 6 勝。SWE Marathon(~7 点差)、BrowseComp、Terminal-Bench 2.1 を含む。
価格と workload 別 recommendation を含む完全比較は Kimi K3 vs Claude:Fable 5 と Opus 4.8 を比較 を参照。
速度とレイテンシ
ベンチマークは正しさを測る。多くの実アプリではレイテンシも同じくらい重要。
| Metric | Kimi K3 | Claude Opus 4.8 (Max effort) |
|---|---|---|
| Output speed | ~62 tokens/sec | ~56 tokens/sec |
| Time to first token | ~1.99s | ~34.49s |
Time-to-first-token の gap は user-facing プロダクトでより consequential — Opus 4.8 の max-reasoning-effort mode は最初の token の前に長く「考える」。K3 の常時オン thinking mode ははるかに早く streaming を開始するよう tune されている。visible loading state があるものを作るなら、この差は spreadsheet だけでなくユーザーが感じる。
Methodology の caveat — 何かを決める前に読んでください
上記を gospel として扱う前に知っておくこと:
- Reasoning effort が重要。 Kimi の報告結果は reasoning effort "max"、temperature 1.0、top-p 1.0。本番デプロイの default など別設定はスコアを meaningfully 動かす。
- Harness 選択が重要。 Agentic ベンチマークは harness(Kimi Code、Claude Code、Codex 等)経由で走り、harness 自体 — retry、context management、tool orchestration — が underlying model とは独立に数点動かす。
- 登場から数日の数字。 K3 は 2026 年 7 月 16 日ローンチ。流通中の figure の一部(上記のいくつか含む)は単一 aggregator または vendor claim 由来。コミュニティが独自評価を回すにつれ revise される見込み。特に 2026 年 7 月 27 日に公開ウェイトが出て independent グループが hosted API ではなく actual model を test できるようになってから。
- Composite index はカテゴリ性能を隠す。 単一 Intelligence Index は便利だが real difference を flatten — すべて mediocre なモデルと coding は brilliant だが trivia は弱いモデルが同じ composite に land しうる。実際の use case では必ずカテゴリ breakdown を確認。
Workload 別の意味
| Workload | K3 ベンチマーク | Verdict |
|---|---|---|
| Frontend / UI code generation | LMArena Frontend Code Arena #1 | Strong pick |
| Long-horizon autonomous coding agents | SWE Marathon、Terminal-Bench 2.1 でリード | Strong pick |
| Agentic web research | BrowseComp で Fable 5 をリード | Strong pick |
| Frontier software engineering(最難 tier) | FrontierSWE で Fable 5 に 5.4 pt 差 | Fable 5 も評価 |
| Academic reasoning / science QA | GPQA、HLE で Opus 4.8 に trailing | Opus 4.8 / Fable 5 を評価 |
| 大規模の cost-sensitive agent workload | 数分の一の価格で near-frontier スコア | Strong pick |
まとめ
Kimi K3 のベンチマーク story は loud だけでなく genuinely good:#1 community-voted coding leaderboard、Claude Opus 4.8 を上回る composite score、自律 coding や research agent を作る人にとって最も重要な agentic / tool-use カテゴリでの明確な勝利。市場で最も賢いモデルではない — Claude Fable 5 は frontier engineering と academic reasoning でまだリード — ただし十分近く、十分安いので、このローンチ window では大多数の agentic / coding workload に「まず K3 を test」が reasonable default。
価格側は Kimi K3 価格 を参照。モデル vs モデルの完全 breakdown は Kimi K3 vs Claude を参照。
FAQ
Kimi K3 は Claude Opus 4.8 より優れていますか?
大多数の共有ベンチマークでは yes — K3 は 10 比較評価中 7 つでリード(BrowseComp、FrontierSWE、GDPval-AA 含む)。Artificial Analysis Intelligence Index も高い(57 vs 56)。Opus 4.8 は GPQA Diamond、Humanity's Last Exam、OfficeQA Pro でリード。
Kimi K3 は Claude Fable 5 より優れていますか?
Overall では no — Fable 5 は 14 共有ベンチマーク中おおよそ 8 勝、Intelligence Index も高い(60 vs 57)。K3 は long-horizon agentic coding、BrowseComp、Terminal-Bench 2.1 で勝ち、1 task あたり substantially 安い。
Kimi K3 の Artificial Analysis Intelligence Index スコアは?
57。index v4.1 methodology 時点。Claude Opus 4.8(56)と Claude Fable 5(60)の間。
Kimi K3 は本当に coding leaderboard で 1 位になった?
Yes — LMArena Frontend Code Arena(crowd-voted leaderboard)がリリースから数時間で K3 を #1 に。#18 から、Claude Fable 5 を抜き、7 frontend ドメイン中 6 つで 1 位。
Kimi K3 のベンチマーク数字は信頼できる?
Reasonable early signal だが final verdict ではない。figure の大多数は vendor-reported か単一 independent aggregator(Artificial Analysis)由来。特定設定(max reasoning effort)下での評価。公開ウェイト出荷後、より多くのグループが独立 test するにつれ refine される見込み。
関連ガイド
関連記事
Gemma 4 の記事群をそのまま辿り、今の判断にいちばん近い次の記事へ進んでください。

Kimi K3:Moonshot AI の 2.8T open-weight モデルを解説
Moonshot AI の Kimi K3 は 2026 年 7 月 16 日に登場した 2.8 兆パラメータの open-weight モデルで、複数のベンチマークで Claude Opus 4.8 を上回りました。実際に何者か、まだ何が欠けているか、今日からどう試すかを整理します。

Kimi K3 価格:API コスト、サブスクリプションプラン、実際に無料なもの
Kimi K3 の API は入力 100 万トークンあたり $3、出力 $15 — ただし常時オン thinking mode のため、すべての呼び出しで reasoning token 分を払うことになる。実際のコスト構造を解説します。

Kimi K3 vs Claude:Fable 5 と Opus 4.8 を比較
Kimi K3 は価格と大多数のベンチマークで Claude Opus 4.8 を上回るが、Claude Fable 5 は frontier engineering でまだリード。各モデルがどこで勝つか、Artificial Analysis と各 vendor の数字から整理します。
次に何を読めばいいか迷っていますか?
ガイド一覧に戻って、モデル比較、ローカル導入、ハードウェア計画の3方向から続けて見ていけます。
