Gemma 4 ガイド

Kimi K3 ベンチマーク:実際の位置づけ

約 9 分
kimi k3benchmarksllm evaluationcoding llmmoonshot ai
Kimi K3 ベンチマーク:実際の位置づけ

Kimi K3 ベンチマーク:実際の位置づけ

Kimi K3 の 2026 年 7 月 16 日リリースから数時間で、LMArena Frontend Code Arena では #18 から #1 に急上昇し Claude Fable 5 を抜きました。Artificial Analysis Intelligence Index でも Claude Opus 4.8 より高いスコアを記録。この 2 点だけでローンチ週の騒ぎの大部分は説明できます — ただし leaderboard の 1 位は、モデルがどこが強くどこが弱いか、ギャップのどれだけが本物で harness ノイズかを理解する代用品にはなりません。

本稿はカテゴリ別の Kimi K3 ベンチマーク性能の breakdown です。Moonshot 自社資料と Artificial Analysis の独立評価をソースとし、いずれかを根拠に判断する前に知っておくべき methodology の caveat も含みます。

Intelligence Index バー、coding leaderboard、速度 / レイテンシ比較チャートを示す Kimi K3 ベンチマークダッシュボードイラスト

先に結論

  • Artificial Analysis Intelligence Index v4.1: Kimi K3 は 57 点。Claude Opus 4.8(56)を上回り、Claude Fable 5(60)には及ばない。
  • Frontend coding(LMArena Frontend Code Arena): Kimi K3 は #1。7 つの frontend ドメイン中 6 つで 1 位。Claude Fable 5 を抜いた。
  • Agentic reasoning(GDPval-AA v2): Kimi K3 は ~1,687。Claude Opus 4.8(1,600)を上回るが、Claude Fable 5 Max(~1,815)と GPT-5.6 Sol Max(~1,748)には及ばない。
  • Claude Fable 5 との head-to-head: 両社が報告するベンチマーク全体で Fable 5 がおおよそ 14 中 8、K3 がおおよそ 6 — 長期 horizon agentic coding、BrowseComp、Terminal-Bench 2.1 を含む。
  • Claude Opus 4.8 との head-to-head: 比較された 10 ベンチマーク中 K3 が 7 つでリード(BrowseComp、FrontierSWE、GDPval-AA、Toolathlon 含む)。Opus 4.8 は GPQA Diamond、Humanity's Last Exam、OfficeQA Pro でリード。
  • 速度: K3 はおおよそ 62 tokens/sec、time-to-first-token ~2 秒。Opus 4.8 の max-effort reasoning mode より notably 速い。
  • Caveat: これらの数字は登場から数日、ほとんど vendor または単一 aggregator 報告。特定の評価設定(reasoning effort "max"、temperature 1.0、top-p 1.0)下での結果。確定 verdict ではなく強い early signal として扱ってください。

ヘッドライン数字:Artificial Analysis Intelligence Index

Artificial Analysis は GDPval-AA v2、Terminal-Bench 2.1、SciCode、Humanity's Last Exam、GPQA Diamond、long-context reasoning テストなど 9 評価を単一の Intelligence Index スコアに統合します。

Model AA Intelligence Index v4.1
Claude Fable 5 (Adaptive, Max effort) 60
Kimi K3 (max reasoning effort) 57
Claude Opus 4.8 (Adaptive, Max effort) 56

実際に重要な takeaway:K3 は市場で最も賢いモデルではないが、Fable 5 や Opus 4.8 が 1 task あたり請求する数分の一のコストで frontier から数点以内。多くの本番 use case では「frontier に近く、はるかに安い」が「frontier をわずかに上回るが高い」を勝る — ただし常にではない。だから下のカテゴリ breakdown が単一 composite 数字より重要です。

Agentic と long-horizon ベンチマーク

K3 が本当に強い領域。Moonshot が明らかに最適化したところ。

GDPval-AA v2

現実的で経済的価値のある knowledge work の性能を測る private agentic ベンチマーク。

Model GDPval-AA v2 (Elo)
Claude Fable 5 Max ~1,815
GPT-5.6 Sol Max ~1,748
Kimi K3 ~1,687
Claude Opus 4.8 1,600

K3 は全体 3 位 — 2 つの最も高価な closed-source frontier モデルに次ぐが、Opus 4.8 を明確に上回る。

AA-Briefcase(agentic knowledge work)

Model AA-Briefcase (Elo)
Claude Fable 5 Max ~1,587
Kimi K3 ~1,527
GPT-5.6 Sol Max ~1,495

ここでは K3 が 2 位に上がり、GPT-5.6 Sol Max を上回る。

BrowseComp(agentic web research)

K3 は BrowseComp で Claude Fable 5 をリード — Moonshot にとって最も明確な勝利の 1 つ。自律 research や multi-step web navigation が workload に含まれるなら意味のある勝利。

Coding ベンチマーク

Benchmark Kimi K3
Terminal-Bench 2.1 88.3
FrontierSWE 81.2
Program Bench 77.8
DeepSWE 67.5
SWE Marathon 42.0

SWE Marathon について:絶対スコアが低い(42.0)から弱いわけではない — 利用可能な最も難しい long-horizon coding ベンチマークの 1 つで、frontier モデルも絶対値では低く出る。重要なのは比較:K3 は SWE Marathon で Claude Fable 5 をおおよそ 7 点リード。この難易度では意味のある margin。

LMArena Frontend Code Arena

ローンチ日に最も注目を集めたベンチマーク。上記 vendor-reported 数字と違い、crowd-voted、独立運営の leaderboard。Kimi K3 はリリースから数時間で #18 から #1 に。1,679 点、7 つの frontend ドメイン中 6 つで 1 位。Claude Fable 5 を抜いた。

固定 test set ではなく community-voted なので、training-set overlap で game しにくい — このローンチ全体で最も credible なシグナルの 1 つ。単に loudest なだけではない。

Head-to-head:Kimi K3 vs Claude Opus 4.8

両方が commonly 評価されるベンチマーク全体:

Kimi K3 がリード: BrowseComp、CharXiv-R、DeepSearchQA、FrontierSWE、GDPval-AA、MCP Atlas、Toolathlon(7 ベンチマーク)

Claude Opus 4.8 がリード: GPQA Diamond、Humanity's Last Exam、OfficeQA Pro(3 ベンチマーク)

パターンは一貫:K3 は agentic、tool-using、coding-adjacent タスクで勝つ。Opus 4.8 は pure academic reasoning と knowledge-heavy タスクで勝つ。 プロダクトが quiz-taker より agent に近いなら、そのパターンは K3 に有利。

Head-to-head:Kimi K3 vs Claude Fable 5

Fable 5 は新しく強い Claude モデルで、それが表れる:14 共有ベンチマーク中 Fable 5 がおおよそ 8 勝。FrontierSWE で 5.4 点勝利、両 visual-reasoning suite を sweep。Kimi K3 がおおよそ 6 勝。SWE Marathon(~7 点差)、BrowseComp、Terminal-Bench 2.1 を含む。

価格と workload 別 recommendation を含む完全比較は Kimi K3 vs Claude:Fable 5 と Opus 4.8 を比較 を参照。

速度とレイテンシ

ベンチマークは正しさを測る。多くの実アプリではレイテンシも同じくらい重要。

Metric Kimi K3 Claude Opus 4.8 (Max effort)
Output speed ~62 tokens/sec ~56 tokens/sec
Time to first token ~1.99s ~34.49s

Time-to-first-token の gap は user-facing プロダクトでより consequential — Opus 4.8 の max-reasoning-effort mode は最初の token の前に長く「考える」。K3 の常時オン thinking mode ははるかに早く streaming を開始するよう tune されている。visible loading state があるものを作るなら、この差は spreadsheet だけでなくユーザーが感じる。

Methodology の caveat — 何かを決める前に読んでください

上記を gospel として扱う前に知っておくこと:

  • Reasoning effort が重要。 Kimi の報告結果は reasoning effort "max"、temperature 1.0、top-p 1.0。本番デプロイの default など別設定はスコアを meaningfully 動かす。
  • Harness 選択が重要。 Agentic ベンチマークは harness(Kimi Code、Claude Code、Codex 等)経由で走り、harness 自体 — retry、context management、tool orchestration — が underlying model とは独立に数点動かす。
  • 登場から数日の数字。 K3 は 2026 年 7 月 16 日ローンチ。流通中の figure の一部(上記のいくつか含む)は単一 aggregator または vendor claim 由来。コミュニティが独自評価を回すにつれ revise される見込み。特に 2026 年 7 月 27 日に公開ウェイトが出て independent グループが hosted API ではなく actual model を test できるようになってから。
  • Composite index はカテゴリ性能を隠す。 単一 Intelligence Index は便利だが real difference を flatten — すべて mediocre なモデルと coding は brilliant だが trivia は弱いモデルが同じ composite に land しうる。実際の use case では必ずカテゴリ breakdown を確認。

Workload 別の意味

Workload K3 ベンチマーク Verdict
Frontend / UI code generation LMArena Frontend Code Arena #1 Strong pick
Long-horizon autonomous coding agents SWE Marathon、Terminal-Bench 2.1 でリード Strong pick
Agentic web research BrowseComp で Fable 5 をリード Strong pick
Frontier software engineering(最難 tier) FrontierSWE で Fable 5 に 5.4 pt 差 Fable 5 も評価
Academic reasoning / science QA GPQA、HLE で Opus 4.8 に trailing Opus 4.8 / Fable 5 を評価
大規模の cost-sensitive agent workload 数分の一の価格で near-frontier スコア Strong pick

まとめ

Kimi K3 のベンチマーク story は loud だけでなく genuinely good:#1 community-voted coding leaderboard、Claude Opus 4.8 を上回る composite score、自律 coding や research agent を作る人にとって最も重要な agentic / tool-use カテゴリでの明確な勝利。市場で最も賢いモデルではない — Claude Fable 5 は frontier engineering と academic reasoning でまだリード — ただし十分近く、十分安いので、このローンチ window では大多数の agentic / coding workload に「まず K3 を test」が reasonable default。

価格側は Kimi K3 価格 を参照。モデル vs モデルの完全 breakdown は Kimi K3 vs Claude を参照。

FAQ

Kimi K3 は Claude Opus 4.8 より優れていますか?
大多数の共有ベンチマークでは yes — K3 は 10 比較評価中 7 つでリード(BrowseComp、FrontierSWE、GDPval-AA 含む)。Artificial Analysis Intelligence Index も高い(57 vs 56)。Opus 4.8 は GPQA Diamond、Humanity's Last Exam、OfficeQA Pro でリード。

Kimi K3 は Claude Fable 5 より優れていますか?
Overall では no — Fable 5 は 14 共有ベンチマーク中おおよそ 8 勝、Intelligence Index も高い(60 vs 57)。K3 は long-horizon agentic coding、BrowseComp、Terminal-Bench 2.1 で勝ち、1 task あたり substantially 安い。

Kimi K3 の Artificial Analysis Intelligence Index スコアは?
57。index v4.1 methodology 時点。Claude Opus 4.8(56)と Claude Fable 5(60)の間。

Kimi K3 は本当に coding leaderboard で 1 位になった?
Yes — LMArena Frontend Code Arena(crowd-voted leaderboard)がリリースから数時間で K3 を #1 に。#18 から、Claude Fable 5 を抜き、7 frontend ドメイン中 6 つで 1 位。

Kimi K3 のベンチマーク数字は信頼できる?
Reasonable early signal だが final verdict ではない。figure の大多数は vendor-reported か単一 independent aggregator(Artificial Analysis)由来。特定設定(max reasoning effort)下での評価。公開ウェイト出荷後、より多くのグループが独立 test するにつれ refine される見込み。

関連ガイド

関連記事

Gemma 4 の記事群をそのまま辿り、今の判断にいちばん近い次の記事へ進んでください。

次に何を読めばいいか迷っていますか?

ガイド一覧に戻って、モデル比較、ローカル導入、ハードウェア計画の3方向から続けて見ていけます。