Gemma 4 指南

Kimi K3 Benchmark:实际表现如何

约 9 分钟
kimi k3benchmarksllm evaluationcoding llmmoonshot ai
Kimi K3 Benchmark:实际表现如何

Kimi K3 Benchmark:实际表现如何

Kimi K3 于 2026 年 7 月 16 日发布,数小时内就从 #18 跳到 LMArena Frontend Code Arena 的 #1,超越 Claude Fable 5。它还在 Artificial Analysis Intelligence Index 上取得高于 Claude Opus 4.8 的分数。仅这两个事实就解释了发布周的大部分噪音——但单一 leaderboard 位置无法替代真正理解模型强在哪里、弱在哪里,以及差距有多少是真实的、有多少是 benchmark harness 噪音。

本文按类别拆解 Kimi K3 的 benchmark 表现,来源包括 Moonshot 自有材料和 Artificial Analysis 的独立评估,并在你基于任何数字做决策之前,说明重要的方法论 caveat。

Kimi K3 benchmark 仪表盘插图,展示 intelligence index 柱状图、coding leaderboard 和速度/延迟对比图

快速结论

  • Artificial Analysis Intelligence Index v4.1: Kimi K3 得分 57,高于 Claude Opus 4.8(56),低于 Claude Fable 5(60)。
  • 前端 coding(LMArena Frontend Code Arena): Kimi K3 为 #1,在 7 个前端 domain 中 6 个排名第一,已超越 Claude Fable 5。
  • Agentic 推理(GDPval-AA v2): Kimi K3 得分 ~1,687,高于 Claude Opus 4.8(1,600),但低于 Claude Fable 5 Max(~1,815)和 GPT-5.6 Sol Max(~1,748)。
  • Head-to-head vs Claude Fable 5: 在双方 vendor 报告的 benchmark 中,Fable 5 约赢 14 项中的 8 项,K3 约赢 6 项——包括长时程 agentic coding、BrowseComp 和 Terminal-Bench 2.1。
  • Head-to-head vs Claude Opus 4.8: Kimi K3 在 10 项对比 benchmark 中领先 7 项(含 BrowseComp、FrontierSWE、GDPval-AA 和 Toolathlon);Opus 4.8 仍在 GPQA Diamond、Humanity's Last Exam 和 OfficeQA Pro 上领先。
  • 速度: K3 生成约 62 tokens/sec~2 秒 time-to-first-token,明显快于 Opus 4.8 的 max-effort 推理模式。
  • Caveat: 这些数字才几天,多数为 vendor 或单一 aggregator 报告,且在特定评估设置下运行(reasoning effort 设为「max」,temperature 1.0,top-p 1.0)。请将其视为强 early signal,而非 settled verdict。

核心数字:Artificial Analysis Intelligence Index

Artificial Analysis 将九项评估——包括 GDPval-AA v2、Terminal-Bench 2.1、SciCode、Humanity's Last Exam、GPQA Diamond 和长上下文推理测试——合并为单一 Intelligence Index 分数。

Model AA Intelligence Index v4.1
Claude Fable 5 (Adaptive, Max effort) 60
Kimi K3 (max reasoning effort) 57
Claude Opus 4.8 (Adaptive, Max effort) 56

真正重要的结论:K3 不是市场上最聪明的模型,但它在 frontier 几分之内,而 cost-per-task 仅为 Fable 5 或 Opus 4.8 的一小部分。对大多数生产用例,「接近 frontier、便宜很多」胜过「略超 frontier、昂贵」——但并非总是如此,这就是为什么下面的类别拆解比单一 composite 数字更重要。

Agentic 与长时程 benchmark

这是 K3 真正强的领域,也是 Moonshot 明显优化过的方向。

GDPval-AA v2

衡量模型在 realistic、经济价值知识工作上表现的 private agentic benchmark。

Model GDPval-AA v2 (Elo)
Claude Fable 5 Max ~1,815
GPT-5.6 Sol Max ~1,748
Kimi K3 ~1,687
Claude Opus 4.8 1,600

K3 总体排名第三——落后于两个最昂贵的闭源 frontier 模型,但明显领先 Opus 4.8。

AA-Briefcase(agentic 知识工作)

Model AA-Briefcase (Elo)
Claude Fable 5 Max ~1,587
Kimi K3 ~1,527
GPT-5.6 Sol Max ~1,495

此处 K3 升至 第二名,超过 GPT-5.6 Sol Max。

BrowseComp(agentic 网页研究)

K3 在 BrowseComp 上领先 Claude Fable 5——Moonshot 最清晰的 win 之一,如果你的 workload 涉及自主研究或多步网页导航,这很有意义。

Coding benchmark

Benchmark Kimi K3
Terminal-Bench 2.1 88.3
FrontierSWE 81.2
Program Bench 77.8
DeepSWE 67.5
SWE Marathon 42.0

关于 SWE Marathon 的说明:低绝对分(42.0)不代表模型弱——它是最难的长时程 coding benchmark 之一,每个 frontier 模型的绝对分都很低。重要的是对比:K3 在 SWE Marathon 上领先 Claude Fable 5 约 7 分,在这个难度级别是有意义的 margin。

LMArena Frontend Code Arena

这是发布日 attention 最多的 benchmark,与上述 vendor-reported 数字不同,它是 crowd-voted、独立运行的 leaderboard。Kimi K3 发布数小时内从 #18 到 #1,得分 1,679,在 7 个前端 domain 中 6 个排名第一,超越 Claude Fable 5。

由于是 community-voted 而非固定 test set,更难通过 training-set overlap 来 game——这使它成为整个发布中最 credible 的信号之一,而不只是最 loud 的。

Head-to-head:Kimi K3 vs Claude Opus 4.8

在双方 commonly 评估的 benchmark 中:

Kimi K3 领先: BrowseComp、CharXiv-R、DeepSearchQA、FrontierSWE、GDPval-AA、MCP Atlas、Toolathlon(7 项 benchmark)

Claude Opus 4.8 领先: GPQA Diamond、Humanity's Last Exam、OfficeQA Pro(3 项 benchmark)

模式一致:K3 在 agentic、tool-using 和 coding-adjacent 任务上赢;Opus 4.8 在 纯学术推理和 knowledge-heavy 任务上赢。如果你的产品更像 agent 而非 quiz-taker,这个模式 favor K3。

Head-to-head:Kimi K3 vs Claude Fable 5

Fable 5 是较新、更强的 Claude 模型,表现可见:在 14 项 shared benchmark 中,Fable 5 约赢 8 项,包括 FrontierSWE 上 5.4 分的 win 和两个 visual-reasoning suite 的 sweep。Kimi K3 约赢 6 项,包括 SWE Marathon(约 7 分)、BrowseComp 和 Terminal-Bench 2.1。

完整对比(含定价和按 workload 的建议)见 Kimi K3 vs Claude:Fable 5 与 Opus 4.8 对比

速度与延迟

Benchmark 衡量正确性;对许多真实应用,延迟同样重要。

Metric Kimi K3 Claude Opus 4.8 (Max effort)
Output speed ~62 tokens/sec ~56 tokens/sec
Time to first token ~1.99s ~34.49s

首 token 延迟差距对用户可见的产品更关键——Opus 4.8 的 max-reasoning-effort 模式在首个 token 出现前会花很长时间「思考」,而 K3 的 always-on thinking mode 调优为更快开始流式输出。如果你在构建任何有可见加载状态的产品,这个差异用户能直接感受到,而不只是表格里的数字。

方法论 caveat——做决定前请先读

在将上述任何内容视为 gospel 之前,有几件事值得了解:

  • Reasoning effort 很重要。 Kimi 报告的结果使用 reasoning effort 设为「max」、temperature 1.0 和 top-p 1.0。不同配置——包括你生产部署的默认设置——可能 meaningfully 移动分数。
  • Harness 选择很重要。 Agentic benchmark 通过 harness(Kimi Code、Claude Code、Codex 等)运行,harness 本身——如何处理 retry、context management 和 tool orchestration——独立于底层模型就能 shift 几分。
  • 这些数字才几天。 K3 于 2026 年 7 月 16 日发布。部分 circulating 数字(包括上面几项)来自单一 aggregator 或 vendor claim,而非多次独立 replication。随着社区运行更多独立评估,预计部分数字会被 revise,尤其 2026 年 7 月 27 日公开权重发布后,独立团体可以测试实际模型而非托管 API。
  • Composite index 隐藏类别表现。 单一 Intelligence Index 数字方便,但 flatten 真实差异——一个 everything mediocre 的模型和一个 coding brilliant 但 trivia weak 的模型可能落在同一 composite 分数。请始终为你的实际用例查看类别 breakdown。

按 workload 的含义

Workload K3 benchmark 表现 Verdict
前端 / UI 代码生成 LMArena Frontend Code Arena #1 强选
长时程自主 coding agent 领先 SWE Marathon、Terminal-Bench 2.1 强选
Agentic 网页研究 BrowseComp 领先 Fable 5 强选
Frontier 软件工程(最难 tier) FrontierSWE 落后 Fable 5 5.4 分 也评估 Fable 5
学术推理 / 科学 QA GPQA、HLE 落后 Opus 4.8 评估 Opus 4.8 / Fable 5
规模化 cost-sensitive agent workload 接近 frontier 分数,价格 fraction 强选

结论

Kimi K3 的 benchmark 故事 genuinely 好,不只是 loud:#1 community-voted coding leaderboard 结果、composite 分数领先 Claude Opus 4.8,以及在 agentic 和 tool-use 类别上的 clear win——对任何构建自主 coding 或 research agent 的人最重要。它不是市场上最 smart 的模型——Claude Fable 5 仍在 frontier engineering 和学术推理上领先——但足够接近、价格足够低,「先测 K3」对大多数 agentic 和 coding workload 是 reasonable default(截至本发布窗口)。

定价方面见 Kimi K3 定价。完整 model-vs-model 拆解见 Kimi K3 vs Claude

FAQ

Kimi K3 比 Claude Opus 4.8 更好吗? 在大多数 shared benchmark 上,是的——K3 在 10 项对比评估中领先 7 项,包括 BrowseComp、FrontierSWE 和 GDPval-AA,Artificial Analysis Intelligence Index 也更高(57 vs 56)。Opus 4.8 仍在 GPQA Diamond、Humanity's Last Exam 和 OfficeQA Pro 上领先。

Kimi K3 比 Claude Fable 5 更好吗? 整体不是——Fable 5 在约 14 项 shared benchmark 中赢约 8 项,Intelligence Index 更高(60 vs 57)。K3 在长时程 agentic coding、BrowseComp 和 Terminal-Bench 2.1 上赢,且 cost-per-task substantially 更低。

Kimi K3 在 Artificial Analysis Intelligence Index 上的分数是多少? 57,截至 index v4.1 方法论,位于 Claude Opus 4.8(56)和 Claude Fable 5(60)之间。

Kimi K3 真的在 coding leaderboard 上拿到 #1 了吗? 是的——LMArena 的 Frontend Code Arena,crowd-voted leaderboard,发布数小时内将 K3 排 #1,从 #18 上升,超越 Claude Fable 5,在 7 个前端 domain 中 6 个第一。

Kimi K3 的 benchmark 数字可靠吗? 它们是 reasonable 的 early signal,但不是 final verdict。多数数字为 vendor-reported 或来自单一独立 aggregator(Artificial Analysis),在特定设置下评估(max reasoning effort)。公开权重发布后,随着更多团体独立测试,预计会 refine。

相关指南

相关阅读

继续沿着 Gemma 4 内容集群往下读,选一个离你当前决策最近的下一篇。

还没决定下一篇看什么?

回到指南页,按模型对比、本地部署和硬件规划三个方向继续浏览。