Gemma 4 指南
Kimi K3 Benchmark:实际表现如何

Kimi K3 Benchmark:实际表现如何
Kimi K3 于 2026 年 7 月 16 日发布,数小时内就从 #18 跳到 LMArena Frontend Code Arena 的 #1,超越 Claude Fable 5。它还在 Artificial Analysis Intelligence Index 上取得高于 Claude Opus 4.8 的分数。仅这两个事实就解释了发布周的大部分噪音——但单一 leaderboard 位置无法替代真正理解模型强在哪里、弱在哪里,以及差距有多少是真实的、有多少是 benchmark harness 噪音。
本文按类别拆解 Kimi K3 的 benchmark 表现,来源包括 Moonshot 自有材料和 Artificial Analysis 的独立评估,并在你基于任何数字做决策之前,说明重要的方法论 caveat。

快速结论
- Artificial Analysis Intelligence Index v4.1: Kimi K3 得分 57,高于 Claude Opus 4.8(56),低于 Claude Fable 5(60)。
- 前端 coding(LMArena Frontend Code Arena): Kimi K3 为 #1,在 7 个前端 domain 中 6 个排名第一,已超越 Claude Fable 5。
- Agentic 推理(GDPval-AA v2): Kimi K3 得分 ~1,687,高于 Claude Opus 4.8(1,600),但低于 Claude Fable 5 Max(~1,815)和 GPT-5.6 Sol Max(~1,748)。
- Head-to-head vs Claude Fable 5: 在双方 vendor 报告的 benchmark 中,Fable 5 约赢 14 项中的 8 项,K3 约赢 6 项——包括长时程 agentic coding、BrowseComp 和 Terminal-Bench 2.1。
- Head-to-head vs Claude Opus 4.8: Kimi K3 在 10 项对比 benchmark 中领先 7 项(含 BrowseComp、FrontierSWE、GDPval-AA 和 Toolathlon);Opus 4.8 仍在 GPQA Diamond、Humanity's Last Exam 和 OfficeQA Pro 上领先。
- 速度: K3 生成约 62 tokens/sec,~2 秒 time-to-first-token,明显快于 Opus 4.8 的 max-effort 推理模式。
- Caveat: 这些数字才几天,多数为 vendor 或单一 aggregator 报告,且在特定评估设置下运行(reasoning effort 设为「max」,temperature 1.0,top-p 1.0)。请将其视为强 early signal,而非 settled verdict。
核心数字:Artificial Analysis Intelligence Index
Artificial Analysis 将九项评估——包括 GDPval-AA v2、Terminal-Bench 2.1、SciCode、Humanity's Last Exam、GPQA Diamond 和长上下文推理测试——合并为单一 Intelligence Index 分数。
| Model | AA Intelligence Index v4.1 |
|---|---|
| Claude Fable 5 (Adaptive, Max effort) | 60 |
| Kimi K3 (max reasoning effort) | 57 |
| Claude Opus 4.8 (Adaptive, Max effort) | 56 |
真正重要的结论:K3 不是市场上最聪明的模型,但它在 frontier 几分之内,而 cost-per-task 仅为 Fable 5 或 Opus 4.8 的一小部分。对大多数生产用例,「接近 frontier、便宜很多」胜过「略超 frontier、昂贵」——但并非总是如此,这就是为什么下面的类别拆解比单一 composite 数字更重要。
Agentic 与长时程 benchmark
这是 K3 真正强的领域,也是 Moonshot 明显优化过的方向。
GDPval-AA v2
衡量模型在 realistic、经济价值知识工作上表现的 private agentic benchmark。
| Model | GDPval-AA v2 (Elo) |
|---|---|
| Claude Fable 5 Max | ~1,815 |
| GPT-5.6 Sol Max | ~1,748 |
| Kimi K3 | ~1,687 |
| Claude Opus 4.8 | 1,600 |
K3 总体排名第三——落后于两个最昂贵的闭源 frontier 模型,但明显领先 Opus 4.8。
AA-Briefcase(agentic 知识工作)
| Model | AA-Briefcase (Elo) |
|---|---|
| Claude Fable 5 Max | ~1,587 |
| Kimi K3 | ~1,527 |
| GPT-5.6 Sol Max | ~1,495 |
此处 K3 升至 第二名,超过 GPT-5.6 Sol Max。
BrowseComp(agentic 网页研究)
K3 在 BrowseComp 上领先 Claude Fable 5——Moonshot 最清晰的 win 之一,如果你的 workload 涉及自主研究或多步网页导航,这很有意义。
Coding benchmark
| Benchmark | Kimi K3 |
|---|---|
| Terminal-Bench 2.1 | 88.3 |
| FrontierSWE | 81.2 |
| Program Bench | 77.8 |
| DeepSWE | 67.5 |
| SWE Marathon | 42.0 |
关于 SWE Marathon 的说明:低绝对分(42.0)不代表模型弱——它是最难的长时程 coding benchmark 之一,每个 frontier 模型的绝对分都很低。重要的是对比:K3 在 SWE Marathon 上领先 Claude Fable 5 约 7 分,在这个难度级别是有意义的 margin。
LMArena Frontend Code Arena
这是发布日 attention 最多的 benchmark,与上述 vendor-reported 数字不同,它是 crowd-voted、独立运行的 leaderboard。Kimi K3 发布数小时内从 #18 到 #1,得分 1,679,在 7 个前端 domain 中 6 个排名第一,超越 Claude Fable 5。
由于是 community-voted 而非固定 test set,更难通过 training-set overlap 来 game——这使它成为整个发布中最 credible 的信号之一,而不只是最 loud 的。
Head-to-head:Kimi K3 vs Claude Opus 4.8
在双方 commonly 评估的 benchmark 中:
Kimi K3 领先: BrowseComp、CharXiv-R、DeepSearchQA、FrontierSWE、GDPval-AA、MCP Atlas、Toolathlon(7 项 benchmark)
Claude Opus 4.8 领先: GPQA Diamond、Humanity's Last Exam、OfficeQA Pro(3 项 benchmark)
模式一致:K3 在 agentic、tool-using 和 coding-adjacent 任务上赢;Opus 4.8 在 纯学术推理和 knowledge-heavy 任务上赢。如果你的产品更像 agent 而非 quiz-taker,这个模式 favor K3。
Head-to-head:Kimi K3 vs Claude Fable 5
Fable 5 是较新、更强的 Claude 模型,表现可见:在 14 项 shared benchmark 中,Fable 5 约赢 8 项,包括 FrontierSWE 上 5.4 分的 win 和两个 visual-reasoning suite 的 sweep。Kimi K3 约赢 6 项,包括 SWE Marathon(约 7 分)、BrowseComp 和 Terminal-Bench 2.1。
完整对比(含定价和按 workload 的建议)见 Kimi K3 vs Claude:Fable 5 与 Opus 4.8 对比。
速度与延迟
Benchmark 衡量正确性;对许多真实应用,延迟同样重要。
| Metric | Kimi K3 | Claude Opus 4.8 (Max effort) |
|---|---|---|
| Output speed | ~62 tokens/sec | ~56 tokens/sec |
| Time to first token | ~1.99s | ~34.49s |
首 token 延迟差距对用户可见的产品更关键——Opus 4.8 的 max-reasoning-effort 模式在首个 token 出现前会花很长时间「思考」,而 K3 的 always-on thinking mode 调优为更快开始流式输出。如果你在构建任何有可见加载状态的产品,这个差异用户能直接感受到,而不只是表格里的数字。
方法论 caveat——做决定前请先读
在将上述任何内容视为 gospel 之前,有几件事值得了解:
- Reasoning effort 很重要。 Kimi 报告的结果使用 reasoning effort 设为「max」、temperature 1.0 和 top-p 1.0。不同配置——包括你生产部署的默认设置——可能 meaningfully 移动分数。
- Harness 选择很重要。 Agentic benchmark 通过 harness(Kimi Code、Claude Code、Codex 等)运行,harness 本身——如何处理 retry、context management 和 tool orchestration——独立于底层模型就能 shift 几分。
- 这些数字才几天。 K3 于 2026 年 7 月 16 日发布。部分 circulating 数字(包括上面几项)来自单一 aggregator 或 vendor claim,而非多次独立 replication。随着社区运行更多独立评估,预计部分数字会被 revise,尤其 2026 年 7 月 27 日公开权重发布后,独立团体可以测试实际模型而非托管 API。
- Composite index 隐藏类别表现。 单一 Intelligence Index 数字方便,但 flatten 真实差异——一个 everything mediocre 的模型和一个 coding brilliant 但 trivia weak 的模型可能落在同一 composite 分数。请始终为你的实际用例查看类别 breakdown。
按 workload 的含义
| Workload | K3 benchmark 表现 | Verdict |
|---|---|---|
| 前端 / UI 代码生成 | LMArena Frontend Code Arena #1 | 强选 |
| 长时程自主 coding agent | 领先 SWE Marathon、Terminal-Bench 2.1 | 强选 |
| Agentic 网页研究 | BrowseComp 领先 Fable 5 | 强选 |
| Frontier 软件工程(最难 tier) | FrontierSWE 落后 Fable 5 5.4 分 | 也评估 Fable 5 |
| 学术推理 / 科学 QA | GPQA、HLE 落后 Opus 4.8 | 评估 Opus 4.8 / Fable 5 |
| 规模化 cost-sensitive agent workload | 接近 frontier 分数,价格 fraction | 强选 |
结论
Kimi K3 的 benchmark 故事 genuinely 好,不只是 loud:#1 community-voted coding leaderboard 结果、composite 分数领先 Claude Opus 4.8,以及在 agentic 和 tool-use 类别上的 clear win——对任何构建自主 coding 或 research agent 的人最重要。它不是市场上最 smart 的模型——Claude Fable 5 仍在 frontier engineering 和学术推理上领先——但足够接近、价格足够低,「先测 K3」对大多数 agentic 和 coding workload 是 reasonable default(截至本发布窗口)。
定价方面见 Kimi K3 定价。完整 model-vs-model 拆解见 Kimi K3 vs Claude。
FAQ
Kimi K3 比 Claude Opus 4.8 更好吗? 在大多数 shared benchmark 上,是的——K3 在 10 项对比评估中领先 7 项,包括 BrowseComp、FrontierSWE 和 GDPval-AA,Artificial Analysis Intelligence Index 也更高(57 vs 56)。Opus 4.8 仍在 GPQA Diamond、Humanity's Last Exam 和 OfficeQA Pro 上领先。
Kimi K3 比 Claude Fable 5 更好吗? 整体不是——Fable 5 在约 14 项 shared benchmark 中赢约 8 项,Intelligence Index 更高(60 vs 57)。K3 在长时程 agentic coding、BrowseComp 和 Terminal-Bench 2.1 上赢,且 cost-per-task substantially 更低。
Kimi K3 在 Artificial Analysis Intelligence Index 上的分数是多少? 57,截至 index v4.1 方法论,位于 Claude Opus 4.8(56)和 Claude Fable 5(60)之间。
Kimi K3 真的在 coding leaderboard 上拿到 #1 了吗? 是的——LMArena 的 Frontend Code Arena,crowd-voted leaderboard,发布数小时内将 K3 排 #1,从 #18 上升,超越 Claude Fable 5,在 7 个前端 domain 中 6 个第一。
Kimi K3 的 benchmark 数字可靠吗? 它们是 reasonable 的 early signal,但不是 final verdict。多数数字为 vendor-reported 或来自单一独立 aggregator(Artificial Analysis),在特定设置下评估(max reasoning effort)。公开权重发布后,随着更多团体独立测试,预计会 refine。
相关指南
相关阅读
继续沿着 Gemma 4 内容集群往下读,选一个离你当前决策最近的下一篇。

Kimi K3 详解:Moonshot AI 的 2.8T Open-Weight 模型
Moonshot AI 的 Kimi K3 于 2026 年 7 月 16 日发布,是一个 2.8 万亿参数的 open-weight 模型,在多项 benchmark 上超过 Claude Opus 4.8。本文说明它到底是什么、还缺什么,以及今天如何试用。

Kimi K3 定价:API 费用、订阅方案与真正免费的部分
Kimi K3 的 API 为每百万 input tokens $3、每百万 output $15——但 always-on thinking mode 意味着每次调用都要为 reasoning tokens 付费。以下是实际成本。

Kimi K3 vs Claude:Fable 5 与 Opus 4.8 对比
Kimi K3 在价格和多数 benchmark 上超过 Claude Opus 4.8,但 Claude Fable 5 仍在 frontier engineering 上领先。以下是各模型赢在哪里,数据来自 Artificial Analysis 和各 vendor 自有数字。
还没决定下一篇看什么?
回到指南页,按模型对比、本地部署和硬件规划三个方向继续浏览。
