Guias do Gemma 4

Kimi K3: O Modelo Open-Weight de 2,8T da Moonshot AI Explicado

9 min de leitura
kimi k3moonshot aiopen source llmllm comparisonagentic ai
Kimi K3: O Modelo Open-Weight de 2,8T da Moonshot AI Explicado

Kimi K3: o modelo open-weight de 2,8T da Moonshot AI, explicado

A Moonshot AI lançou o Kimi K3 em 16 de julho de 2026, e em menos de um dia ele subiu ao topo do Frontend Code Arena da LMArena, ultrapassando o Claude Fable 5, e registrou uma pontuação no Artificial Analysis Intelligence Index acima do Claude Opus 4.8. Com 2,8 trilhões de parâmetros, está sendo descrito como o maior modelo open-weight lançado até hoje — de uma empresa que, três anos antes, ainda era uma startup de Pequim praticamente desconhecida fora da China.

Este guia cobre o que o Kimi K3 realmente é, o que está confirmado versus o que ainda está pendente (os pesos públicos ainda não podem ser baixados) e onde encontrar os números que importam para uma avaliação real.

Ilustração de visão geral do Kimi K3 mostrando um hub central do modelo conectado a gráficos de benchmark, um console de API e painéis de comparação com o Claude

Resposta rápida

  • Lançamento: 16 de julho de 2026, pela Moonshot AI (fundada pelo CEO Yang Zhilin).
  • Tamanho: 2,8 trilhões de parâmetros totais — o maior modelo open-weight lançado até agora.
  • Arquitetura: Mixture-of-Experts usando o framework Stable LatentMoE da Moonshot (16 de 896 experts ativos por token), construído sobre duas inovações internas: Kimi Delta Attention (mecanismo híbrido de atenção linear) e Attention Residuals (substituto drop-in para conexões residuais padrão).
  • Janela de contexto: 1.048.576 tokens (~1M), com compreensão visual nativa e um "modo thinking" sempre ativo.
  • Pesos abertos: Anunciados como open-weight sob licença estilo Modified MIT, mas os pesos para download não estavam disponíveis no lançamento — a Moonshot se comprometeu a publicá-los até 27 de julho de 2026. Até lá, "open source" descreve o plano, não algo que você possa baixar.
  • Acesso hoje: API própria da Moonshot (platform.kimi.ai), OpenRouter (moonshotai/kimi-k3) e o app/web chat consumer do Kimi. Self-hosting no Hugging Face ainda não está disponível.
  • Posição vs. Claude: Supera o Claude Opus 4.8 no Artificial Analysis Intelligence Index e em vários benchmarks agentic/coding; fica atrás do Claude Fable 5 mais recente na maioria dos benchmarks, mas vence em coding agentic de longo horizonte e custa uma fração do preço.

O que o Kimi K3 realmente é

O Kimi K3 é o modelo flagship mais recente da Moonshot AI, posicionado como um sistema frontier open-weight que compete de igual para igual com os maiores labs closed-source em coding agentic, uso de ferramentas e raciocínio geral — enquanto publica (ou, por enquanto, promete publicar) os pesos.

O enquadramento que importa: não é um release incremental de versão. A Moonshot pulou direto para um modelo de 2,8T parâmetros, mais que o dobro do predecessor Kimi K2.6 (~1T parâmetros), e o combinou com nova arquitetura em vez de apenas mais escala na receita antiga. A reação do mercado foi imediata — cobertura ligou o lançamento a uma venda mais ampla de ações de chips de IA, na lógica de que um modelo tão capaz, tão barato e abertamente disponível muda o cálculo de quanto compute o resto da indústria precisa comprar.

Arquitetura e especificações

Duas técnicas fazem a maior parte do trabalho por baixo do capô, e ambas foram publicadas anteriormente como pesquisa aberta pela equipe Moonshot antes de aparecerem em um modelo entregue:

  • Kimi Delta Attention — mecanismo híbrido de atenção linear projetado para manter a inferência de contexto longo rápida sem o blowup quadrático usual da atenção padrão.
  • Attention Residuals — substituto drop-in para conexões residuais convencionais que a Moonshot diz entregar ganhos mais consistentes conforme o modelo escala.
  • Stable LatentMoE — o framework de roteamento por trás da camada mixture-of-experts. De 896 experts totais, 16 estão ativos por token, o que é como um modelo de 2,8T parâmetros permanece computacionalmente tratável em vez de exigir compute equivalente a 2,8T parâmetros a cada forward pass.

Junto com a arquitetura, o K3 vem com:

  • Uma janela de contexto de 1.048.576 tokens (~1M tokens) cobrindo entrada e saída.
  • Compreensão visual nativa — entrada de imagem é built-in, não acoplada depois.
  • Um modo de raciocínio sempre ativo ("thinking mode") em vez de um toggle que você precisa lembrar de acionar.

A Moonshot disse que um relatório técnico completo com detalhes de treinamento e avaliação acompanhará o lançamento dos pesos públicos. Até lá, trate especificidades arquiteturais além do resumido aqui como provisórias.

O Kimi K3 é open source?

Esta é a pergunta mais buscada sobre o K3, e a resposta honesta tem duas partes:

O plano é open-weight. A Moonshot declarou que o K3 será lançado sob licença estilo Modified MIT, seguindo a mesma abordagem do Kimi K2.6 (permissiva para a esmagadora maioria dos usuários, com cláusula de atribuição que só entra em vigor em escala de deploy muito grande).

Os pesos ainda não podem ser baixados. No lançamento, o Kimi K3 só é acessível pela API hospedada da Moonshot, OpenRouter e o app consumer — nenhum dos quais exige ou fornece o arquivo do modelo subjacente. A Moonshot se comprometeu a publicar os pesos reais, junto com o relatório técnico, até 27 de julho de 2026. Até essa data, "Kimi K3 é open source" é uma declaração sobre intenção e licenciamento, não algo que você possa git clone ou rodar com vLLM hoje.

Se você precisa especificamente de inferência self-hosted on-prem, o movimento prático agora é marcar isso e voltar depois de 27 de julho — e orçar a conversa de hardware separadamente, já que um modelo de 2,8T parâmetros (mesmo um MoE esparso) precisará de substancialmente mais memória do que o K2.6.

Como o Kimi K3 performa

Análise completa: Benchmarks do Kimi K3: como ele realmente se compara

A versão curta: no Artificial Analysis Intelligence Index, o K3 pontua 57, à frente dos 56 do Claude Opus 4.8, mas atrás dos 60 do Claude Fable 5. Em benchmarks agentic especificamente — GDPval-AA, BrowseComp, coding de longo horizonte — o K3 é genuinamente competitivo com, e às vezes à frente de, os modelos closed-source mais caros do mercado. Também tomou o #1 no Frontend Code Arena da LMArena em horas após o lançamento, passando o Claude Fable 5.

Onde é mais fraco: benchmarks acadêmicos pesados em raciocínio como GPQA Diamond e Humanity's Last Exam, onde o Claude Opus 4.8 ainda o supera.

Quanto custa o Kimi K3

Análise completa: Preços do Kimi K3: custos de API e planos de assinatura

A versão curta: a API custa $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída, com entrada em cache caindo para $0,30 por milhão — desconto de 90% que importa muito para workloads agentic e estilo RAG. Isso fica abaixo do Claude Opus 4.8 em aproximadamente 1,7x tanto em entrada quanto em saída. O app consumer tem cinco tiers de assinatura do gratuito (Adagio) até $199/mês (Vivace), embora cubram o app de chat e ferramentas, não uso de API.

Como se compara ao Claude e outros modelos

Análise completa: Kimi K3 vs Claude: Fable 5 e Opus 4.8 comparados

A versão curta: contra o Claude Opus 4.8, o K3 vence em benchmarks e preço — é um upgrade bastante limpo se o Opus 4.8 era sua baseline. Contra o Claude Fable 5 mais recente, o quadro é mais próximo: o Fable 5 vence mais benchmarks no geral (cerca de 8 de 14 em comparações head-to-head), especialmente em engenharia frontier e tarefas de visão, mas o K3 vence em coding agentic de longo horizonte e trabalho orientado a terminal, e faz isso por uma fração do custo do Fable 5.

O K3 também chegou na mesma janela que o GLM 5.2 e o Kimi K2.6 anterior como opções open-weight concorrentes — se você está avaliando modelos abertos especificamente, nosso review do GLM 5.2 e a comparação Kimi K2.6 vs GLM-5.1 são leituras complementares úteis enquanto um breakdown direto K3 vs GLM-5.2 está em preparação.

Como acessar o Kimi K3 hoje

Quatro formas de entrar, nenhuma das quais exige atualmente os pesos (não lançados):

  • API própria da Moonshot em platform.kimi.ai — cadastre-se, crie uma key e você é cobrado por token. Veja o guia de preços para passos de setup.
  • OpenRouter, listado como moonshotai/kimi-k3 — útil se você já roteia múltiplos provedores pelo OpenRouter e quer o K3 como opção drop-in.
  • App consumer Kimi e web chat — tier gratuito disponível (Adagio), com tiers pagos até $199/mês para uso mais pesado, créditos de agente e ferramentas. Isso é billing separado da API.
  • Kimi Code, o agente de coding em terminal da Moonshot, para assinantes que querem o K3 integrado a um workflow de coding via CLI.

O que ainda não está disponível: pesos no Hugging Face e, portanto, qualquer forma de self-hosting real.

Kimi K3 vs Kimi K2.6: o que realmente mudou

Se você avaliou ou implantou o Kimi K2.6 no início de 2026, o K3 não é um bump de versão menor:

Kimi K2.6 Kimi K3
Parâmetros totais ~1T 2,8T
Janela de contexto 256K ~1M
Arquitetura Atenção MoE padrão Kimi Delta Attention + Attention Residuals + Stable LatentMoE
Entrada visual Imagem + vídeo experimental Compreensão nativa de imagem
Modo de raciocínio Toggle (Thinking / Instant) Modo thinking sempre ativo
Pesos abertos Disponíveis no Hugging Face Pendentes, esperados para 27 de julho de 2026

O K2.6 continua sendo uma escolha razoável se você já o integrou e não precisa do contexto maior ou da posição mais recente em benchmarks. Para qualquer nova avaliação, comece com o K3.

Quem deve usar o Kimi K3

  • Times construindo ferramentas de coding agentic — os benchmarks de agente de longo horizonte e terminal são onde o K3 é mais forte em relação ao preço.
  • Qualquer pessoa pagando atualmente pelo Claude Opus 4.8 onde custo por tarefa importa — o K3 o supera em benchmarks que a maioria dos times se importa e custa significativamente menos.
  • Workflows pesados em frontend — o resultado #1 no LMArena Frontend Code Arena é um sinal genuíno e verificável, não apenas um número auto-relatado.
  • Pipelines de contexto longo e RAG que podem se beneficiar da janela de contexto ~1M e do preço de entrada em cache com 90% de desconto.

Quem deve esperar

  • Qualquer pessoa que precisa de inferência self-hosted on-prem hoje. Os pesos não saíram. Volte depois de 27 de julho de 2026.
  • Times cujo workload pende fortemente para benchmarks acadêmicos de raciocínio (matemática de competição, ciência estilo GPQA) — o Claude Opus 4.8 e o Fable 5 ainda têm vantagem lá.
  • Qualquer pessoa que precisa de um quadro de benchmarks totalmente maduro e verificado independentemente. O K3 tem dias de idade; alguns números circulando ainda são auto-relatados pelo vendor ou de um único agregador, e provavelmente serão refinados conforme mais da comunidade roda suas próprias avaliações.

FAQ

O que é o Kimi K3? O Kimi K3 é o modelo de linguagem grande flagship da Moonshot AI, lançado em 16 de julho de 2026. É um modelo mixture-of-experts de 2,8 trilhões de parâmetros com janela de contexto ~1M tokens, compreensão visual nativa e modo de raciocínio sempre ativo, posicionado como concorrente open-weight ao Claude e GPT.

O Kimi K3 é open source? Foi projetado para ser open-weight sob licença estilo Modified MIT, mas os pesos reais para download não estavam disponíveis no lançamento. A Moonshot se comprometeu a publicá-los, junto com um relatório técnico completo, até 27 de julho de 2026.

O Kimi K3 é gratuito? O app de chat consumer tem um tier gratuito (Adagio). A API é paga, a $3/M de entrada e $15/M de saída, sem tier gratuito de produção. Veja o guia de preços para o breakdown completo.

Como uso o Kimi K3? Hoje, pela API da Moonshot em platform.kimi.ai, pelo OpenRouter como moonshotai/kimi-k3, ou pelo app consumer Kimi e web chat. Self-hosting não é possível até os pesos públicos serem lançados.

O Kimi K3 é melhor que o Claude? Depende de qual Claude. O K3 supera o Claude Opus 4.8 no Artificial Analysis Intelligence Index e na maioria dos benchmarks agentic, a um preço menor. Contra o Claude Fable 5 mais recente, o Fable 5 vence mais benchmarks no geral, mas o K3 vence em coding agentic de longo horizonte e é dramaticamente mais barato. Veja a comparação completa.

Quão grande é o Kimi K3? 2,8 trilhões de parâmetros totais, usando design mixture-of-experts (Stable LatentMoE) que ativa 16 de 896 experts por token — então o custo de inferência é muito menor do que a contagem total de parâmetros sugere.

Guias relacionados

Guias relacionados

Continue no cluster do Gemma 4 com o proximo guia que combina com a decisao que voce esta tomando agora.

Kimi K3 vs Claude: Fable 5 e Opus 4.8 Comparados

Kimi K3 vs Claude: Fable 5 e Opus 4.8 Comparados

O Kimi K3 supera o Claude Opus 4.8 em preço e na maioria dos benchmarks, mas o Claude Fable 5 ainda lidera em engenharia frontier. Veja exatamente onde cada modelo vence, com fontes da Artificial Analysis e números de cada vendor.

Ainda decidindo o que ler depois?

Volte para o hub de guias para navegar por comparacoes de modelos, tutoriais de configuracao e paginas de planejamento de hardware.