Gemma 4 指南

Kimi K3 详解:Moonshot AI 的 2.8T Open-Weight 模型

约 9 分钟
kimi k3moonshot aiopen source llmllm comparisonagentic ai
Kimi K3 详解:Moonshot AI 的 2.8T Open-Weight 模型

Kimi K3 详解:Moonshot AI 的 2.8T Open-Weight 模型

Moonshot AI 于 2026 年 7 月 16 日发布 Kimi K3,发布不到一天,它就登顶 LMArena 的 Frontend Code Arena,超越 Claude Fable 5,并在 Artificial Analysis Intelligence Index 上取得高于 Claude Opus 4.8 的分数。2.8 万亿参数的规模,让它被描述为迄今发布的最大 open-weight 模型——而这家公司三年前还是一家北京创业公司,中国以外几乎无人知晓。

本指南涵盖 Kimi K3 到底是什么、哪些已确认、哪些仍在等待(公开权重尚不可下载),以及真正评估时该看哪些数字。

Kimi K3 概览插图,展示中心模型中枢连接 benchmark 图表、API 控制台,以及与 Claude 的对比面板

快速结论

  • 发布时间: 2026 年 7 月 16 日,由 Moonshot AI(CEO 杨植麟创立)发布。
  • 规模: 2.8 万亿总参数——迄今发布的最大 open-weight 模型。
  • 架构: 基于 Moonshot 的 Stable LatentMoE 框架的 Mixture-of-Experts(896 个 expert 中每个 token 激活 16 个),建立在两项自研创新之上:Kimi Delta Attention(混合线性 attention 机制)和 Attention Residuals(标准 residual connection 的即插即用替代方案)。
  • 上下文窗口: 1,048,576 tokens(约 100 万),原生视觉理解,以及始终开启的「thinking mode」。
  • Open weights: 宣布以 Modified MIT 风格许可发布 open-weight,但发布时可下载的权重尚未上线——Moonshot 承诺在 2026 年 7 月 27 日 前公开。在此之前,「开源」描述的是计划,而非你现在能下载的东西。
  • 今日访问方式: Moonshot 自有 API(platform.kimi.ai)、OpenRouter(moonshotai/kimi-k3),以及面向消费者的 Kimi App/Web Chat。Hugging Face 自托管尚不可用。
  • 与 Claude 对比: 在 Artificial Analysis Intelligence Index 及多项 agentic/coding benchmark 上超过 Claude Opus 4.8;在多数 benchmark 上落后于较新的 Claude Fable 5,但在长时程 agentic coding 上胜出,价格仅为后者的一小部分。

Kimi K3 到底是什么

Kimi K3 是 Moonshot AI 最新的旗舰模型,定位为 open-weight 前沿系统,在 agentic coding、工具调用和通用推理上与最大的闭源实验室正面竞争——同时发布(或目前承诺发布)权重。

关键定位:这不是一次增量小版本更新。Moonshot 直接跳到 2.8T 参数模型,规模是其前代 Kimi K2.6(约 1T 参数)的两倍多,并搭配新架构,而非仅在旧方案上堆规模。市场反应立竿见影——媒体报道将此次发布与 AI 芯片股的 broader 抛售联系起来,逻辑是:一个如此强大、如此便宜、且公开可用的模型,会改变行业其余部分需要购买多少算力的计算方式。

架构与规格

两项技术承担了底层大部分工作,且 Moonshot 团队在它们进入正式模型之前,都已作为开放研究发布:

  • Kimi Delta Attention——混合线性 attention 机制,旨在保持长上下文推理速度,避免标准 attention 常见的二次方爆炸。
  • Attention Residuals——传统 residual connection 的即插即用替代方案,Moonshot 称随着模型规模扩大,它能带来更一致的收益。
  • Stable LatentMoE——mixture-of-experts 层背后的路由框架。在 896 个 expert 中,每个 token 激活 16 个,这就是为什么 2.8T 参数模型在计算上仍可承受,而不需要在每次 forward pass 中消耗 2.8T 参数级别的算力。

除架构外,K3 还具备:

  • 1,048,576 token 上下文窗口(约 100 万 tokens),覆盖输入和输出。
  • 原生视觉理解——图像输入是内置的,而非后装。
  • 始终开启的推理模式(「thinking mode」),而非需要记得手动切换的开关。

Moonshot 表示,完整技术报告(含训练与评估细节)将随公开权重发布一并推出。在那之前,请将本文摘要以外的架构细节视为暂定信息。

Kimi K3 是开源的吗?

这是关于 K3 被搜索最多的问题,诚实的答案有两部分:

计划是 open-weight。 Moonshot 声明 K3 将以 Modified MIT 风格许可发布,沿用与 Kimi K2.6 相同的思路(对绝大多数用户宽松,仅在极大规模部署时触发 attribution 条款)。

权重尚不可下载。 发布时,Kimi K3 仅可通过 Moonshot 托管 API、OpenRouter 和消费者 App 访问——这些渠道都不提供或不需要底层模型文件。Moonshot 承诺在 2026 年 7 月 27 日 前发布实际权重及技术报告。在该日期之前,「Kimi K3 是开源的」描述的是意图和许可,而非你今天可以 git clone 或用 vLLM 运行的东西。

如果你特别需要自托管、本地部署推理,目前的实际做法是收藏本文,7 月 27 日后再来查看——并单独预算硬件投入,因为 2.8T 参数模型(即使是稀疏 MoE)将比 K2.6 需要多得多内存。

Kimi K3 表现如何

完整拆解:Kimi K3 Benchmark:实际表现如何

简短版:在 Artificial Analysis Intelligence Index 上,K3 得分 57,高于 Claude Opus 4.8 的 56,但低于 Claude Fable 5 的 60。在 agentic benchmark 上——GDPval-AA、BrowseComp、长时程 coding——K3 确实能与市场上最昂贵的闭源模型竞争,有时还领先。发布数小时内,它还在 LMArena 的 Frontend Code Arena 拿下 #1,超过 Claude Fable 5。

较弱之处:推理密集的学术 benchmark,如 GPQA Diamond 和 Humanity's Last Exam,Claude Opus 4.8 仍略占上风。

Kimi K3 多少钱

完整拆解:Kimi K3 定价:API 费用与订阅方案

简短版:API 为 每百万 input tokens $3每百万 output tokens $15,cached input 降至 每百万 $0.30——90% 折扣,对 agentic 和 RAG 类 workload 意义重大。input 和 output 均比 Claude Opus 4.8 便宜约 1.7 倍。消费者 App 有五个订阅档位,从免费(Adagio)到 $199/月(Vivace),但这些覆盖 chat App 和工具,不含 API 用量。

与 Claude 及其他模型的对比

完整拆解:Kimi K3 vs Claude:Fable 5 与 Opus 4.8 对比

简短版:对比 Claude Opus 4.8,K3 在 benchmark 和价格上都赢——如果 Opus 4.8 是你的基准,这是一次相当干净的升级。对比较新的 Claude Fable 5,局面更接近:Fable 5 在整体 benchmark 上赢更多(head-to-head 对比中约 14 项里赢 8 项),尤其在 frontier engineering 和 vision 任务上,但 K3 在长时程 agentic coding 和 terminal 驱动工作上胜出,价格仅为 Fable 5 的一小部分。

K3 还与 GLM 5.2 及更早的 Kimi K2.6 在同一窗口期作为 competing open-weight 选项出现——如果你专门评估 open 模型,我们的 GLM 5.2 评测Kimi K2.6 vs GLM-5.1 对比 是有用的 companion 阅读,而 K3 vs GLM-5.2 的直接拆解正在筹备中。

今天如何访问 Kimi K3

四种入口,目前都不需要(尚未发布的)权重:

  • Moonshot 自有 API,地址 platform.kimi.ai——注册、创建 key,按 token 计费。设置步骤见 定价指南
  • OpenRouter,模型 ID 为 moonshotai/kimi-k3——如果你已通过 OpenRouter 路由多个 provider,想将 K3 作为即插即用选项,这很实用。
  • 消费者 Kimi App 和 Web Chat——有免费档(Adagio),付费档最高 $199/月,用于 heavier 用量、agent credits 和工具。这与 API 计费分开。
  • Kimi Code,Moonshot 的终端 coding agent,面向希望将 K3 接入 CLI coding workflow 的订阅用户。

尚不可用:Hugging Face 权重,因此任何形式的真正自托管。

Kimi K3 vs Kimi K2.6:实际变了什么

如果你在 2026 早些时候评估或部署过 Kimi K2.6,K3 不是小版本 bump:

Kimi K2.6 Kimi K3
总参数 ~1T 2.8T
上下文窗口 256K ~1M
架构 标准 MoE attention Kimi Delta Attention + Attention Residuals + Stable LatentMoE
视觉输入 图像 + 实验性视频 原生图像理解
推理模式 切换(Thinking / Instant) 始终开启 thinking mode
Open weights Hugging Face 可用 待定,预计 2026 年 7 月 27 日

如果你已集成 K2.6 且不需要更大上下文或最新 benchmark 位置,K2.6 仍是合理选择。任何新评估,从 K3 开始。

谁应该用 Kimi K3

  • 构建 agentic coding 工具的团队——长时程 agent 和 terminal benchmark 是 K3 相对价格最强的领域。
  • 任何目前为 Claude Opus 4.8 付费、且 cost-per-task 重要的用户——K3 在大多数团队关心的 benchmark 上超过它,成本显著更低。
  • 前端 heavy 的 workflow——LMArena Frontend Code Arena #1 结果是真实、可验证的信号,不只是自报数字。
  • 长上下文和 RAG 流水线,可从约 100 万上下文窗口和 90% off 的 cached-input 定价中受益。

谁应该等待

  • 任何今天就需要自托管、本地部署推理的人。 权重还没出。2026 年 7 月 27 日后再来查看。
  • workload 严重依赖学术推理 benchmark 的团队(竞赛数学、GPQA 式科学)——Claude Opus 4.8 和 Fable 5 在那里仍有优势。
  • 任何需要完全成熟、独立验证的 benchmark 图景的人。 K3 才发布几天;部分 circulating 数字仍是 vendor-reported 或来自单一 aggregator,随着社区运行更多独立评估,很可能会被 refine。

FAQ

Kimi K3 是什么? Kimi K3 是 Moonshot AI 的旗舰大语言模型,2026 年 7 月 16 日发布。它是 2.8 万亿参数的 mixture-of-experts 模型,拥有约 100 万 token 上下文窗口、原生视觉理解和始终开启的推理模式,定位为 Claude 和 GPT 的 open-weight 竞争者。

Kimi K3 是开源的吗? 设计上将以 Modified MIT 风格许可发布 open-weight,但发布时可下载的实际权重不可用。Moonshot 承诺在 2026 年 7 月 27 日前发布,并附带完整技术报告。

Kimi K3 免费吗? 消费者 chat App 有免费档(Adagio)。API 是付费的,$3/M input、$15/M output tokens,没有免费生产档。完整拆解见 定价指南

如何使用 Kimi K3? 今天可通过 Moonshot API(platform.kimi.ai)、OpenRouter(moonshotai/kimi-k3),或消费者 Kimi App 和 Web Chat。公开权重发布前无法自托管。

Kimi K3 比 Claude 更好吗? 取决于哪个 Claude。K3 在 Artificial Analysis Intelligence Index 和大多数 agentic benchmark 上超过 Claude Opus 4.8,价格更低。对比较新的 Claude Fable 5,Fable 5 在整体 benchmark 上赢更多,但 K3 在长时程 agentic coding 上胜出,且 dramatically 更便宜。见 完整对比

Kimi K3 有多大? 2.8 万亿总参数,采用 mixture-of-experts 设计(Stable LatentMoE),每个 token 激活 896 个 expert 中的 16 个——因此推理成本远低于总参数数量所暗示的水平。

相关指南

相关阅读

继续沿着 Gemma 4 内容集群往下读,选一个离你当前决策最近的下一篇。

Kimi K3 Benchmark:实际表现如何

Kimi K3 Benchmark:实际表现如何

Kimi K3 发布不到一天就登顶 LMArena 的 Frontend Code Arena,并在 Artificial Analysis Intelligence Index 上超过 Claude Opus 4.8。以下是数字实际说明了什么——以及它们没讲全的地方。

还没决定下一篇看什么?

回到指南页,按模型对比、本地部署和硬件规划三个方向继续浏览。