Guias do Gemma 4
Kimi K3: O Modelo Open-Weight de 2,8T da Moonshot AI Explicado

Kimi K3: o modelo open-weight de 2,8T da Moonshot AI, explicado
A Moonshot AI lançou o Kimi K3 em 16 de julho de 2026, e em menos de um dia ele subiu ao topo do Frontend Code Arena da LMArena, ultrapassando o Claude Fable 5, e registrou uma pontuação no Artificial Analysis Intelligence Index acima do Claude Opus 4.8. Com 2,8 trilhões de parâmetros, está sendo descrito como o maior modelo open-weight lançado até hoje — de uma empresa que, três anos antes, ainda era uma startup de Pequim praticamente desconhecida fora da China.
Este guia cobre o que o Kimi K3 realmente é, o que está confirmado versus o que ainda está pendente (os pesos públicos ainda não podem ser baixados) e onde encontrar os números que importam para uma avaliação real.

Resposta rápida
- Lançamento: 16 de julho de 2026, pela Moonshot AI (fundada pelo CEO Yang Zhilin).
- Tamanho: 2,8 trilhões de parâmetros totais — o maior modelo open-weight lançado até agora.
- Arquitetura: Mixture-of-Experts usando o framework Stable LatentMoE da Moonshot (16 de 896 experts ativos por token), construído sobre duas inovações internas: Kimi Delta Attention (mecanismo híbrido de atenção linear) e Attention Residuals (substituto drop-in para conexões residuais padrão).
- Janela de contexto: 1.048.576 tokens (~1M), com compreensão visual nativa e um "modo thinking" sempre ativo.
- Pesos abertos: Anunciados como open-weight sob licença estilo Modified MIT, mas os pesos para download não estavam disponíveis no lançamento — a Moonshot se comprometeu a publicá-los até 27 de julho de 2026. Até lá, "open source" descreve o plano, não algo que você possa baixar.
- Acesso hoje: API própria da Moonshot (
platform.kimi.ai), OpenRouter (moonshotai/kimi-k3) e o app/web chat consumer do Kimi. Self-hosting no Hugging Face ainda não está disponível. - Posição vs. Claude: Supera o Claude Opus 4.8 no Artificial Analysis Intelligence Index e em vários benchmarks agentic/coding; fica atrás do Claude Fable 5 mais recente na maioria dos benchmarks, mas vence em coding agentic de longo horizonte e custa uma fração do preço.
O que o Kimi K3 realmente é
O Kimi K3 é o modelo flagship mais recente da Moonshot AI, posicionado como um sistema frontier open-weight que compete de igual para igual com os maiores labs closed-source em coding agentic, uso de ferramentas e raciocínio geral — enquanto publica (ou, por enquanto, promete publicar) os pesos.
O enquadramento que importa: não é um release incremental de versão. A Moonshot pulou direto para um modelo de 2,8T parâmetros, mais que o dobro do predecessor Kimi K2.6 (~1T parâmetros), e o combinou com nova arquitetura em vez de apenas mais escala na receita antiga. A reação do mercado foi imediata — cobertura ligou o lançamento a uma venda mais ampla de ações de chips de IA, na lógica de que um modelo tão capaz, tão barato e abertamente disponível muda o cálculo de quanto compute o resto da indústria precisa comprar.
Arquitetura e especificações
Duas técnicas fazem a maior parte do trabalho por baixo do capô, e ambas foram publicadas anteriormente como pesquisa aberta pela equipe Moonshot antes de aparecerem em um modelo entregue:
- Kimi Delta Attention — mecanismo híbrido de atenção linear projetado para manter a inferência de contexto longo rápida sem o blowup quadrático usual da atenção padrão.
- Attention Residuals — substituto drop-in para conexões residuais convencionais que a Moonshot diz entregar ganhos mais consistentes conforme o modelo escala.
- Stable LatentMoE — o framework de roteamento por trás da camada mixture-of-experts. De 896 experts totais, 16 estão ativos por token, o que é como um modelo de 2,8T parâmetros permanece computacionalmente tratável em vez de exigir compute equivalente a 2,8T parâmetros a cada forward pass.
Junto com a arquitetura, o K3 vem com:
- Uma janela de contexto de 1.048.576 tokens (~1M tokens) cobrindo entrada e saída.
- Compreensão visual nativa — entrada de imagem é built-in, não acoplada depois.
- Um modo de raciocínio sempre ativo ("thinking mode") em vez de um toggle que você precisa lembrar de acionar.
A Moonshot disse que um relatório técnico completo com detalhes de treinamento e avaliação acompanhará o lançamento dos pesos públicos. Até lá, trate especificidades arquiteturais além do resumido aqui como provisórias.
O Kimi K3 é open source?
Esta é a pergunta mais buscada sobre o K3, e a resposta honesta tem duas partes:
O plano é open-weight. A Moonshot declarou que o K3 será lançado sob licença estilo Modified MIT, seguindo a mesma abordagem do Kimi K2.6 (permissiva para a esmagadora maioria dos usuários, com cláusula de atribuição que só entra em vigor em escala de deploy muito grande).
Os pesos ainda não podem ser baixados. No lançamento, o Kimi K3 só é acessível pela API hospedada da Moonshot, OpenRouter e o app consumer — nenhum dos quais exige ou fornece o arquivo do modelo subjacente. A Moonshot se comprometeu a publicar os pesos reais, junto com o relatório técnico, até 27 de julho de 2026. Até essa data, "Kimi K3 é open source" é uma declaração sobre intenção e licenciamento, não algo que você possa git clone ou rodar com vLLM hoje.
Se você precisa especificamente de inferência self-hosted on-prem, o movimento prático agora é marcar isso e voltar depois de 27 de julho — e orçar a conversa de hardware separadamente, já que um modelo de 2,8T parâmetros (mesmo um MoE esparso) precisará de substancialmente mais memória do que o K2.6.
Como o Kimi K3 performa
Análise completa: Benchmarks do Kimi K3: como ele realmente se compara
A versão curta: no Artificial Analysis Intelligence Index, o K3 pontua 57, à frente dos 56 do Claude Opus 4.8, mas atrás dos 60 do Claude Fable 5. Em benchmarks agentic especificamente — GDPval-AA, BrowseComp, coding de longo horizonte — o K3 é genuinamente competitivo com, e às vezes à frente de, os modelos closed-source mais caros do mercado. Também tomou o #1 no Frontend Code Arena da LMArena em horas após o lançamento, passando o Claude Fable 5.
Onde é mais fraco: benchmarks acadêmicos pesados em raciocínio como GPQA Diamond e Humanity's Last Exam, onde o Claude Opus 4.8 ainda o supera.
Quanto custa o Kimi K3
Análise completa: Preços do Kimi K3: custos de API e planos de assinatura
A versão curta: a API custa $3 por milhão de tokens de entrada e $15 por milhão de tokens de saída, com entrada em cache caindo para $0,30 por milhão — desconto de 90% que importa muito para workloads agentic e estilo RAG. Isso fica abaixo do Claude Opus 4.8 em aproximadamente 1,7x tanto em entrada quanto em saída. O app consumer tem cinco tiers de assinatura do gratuito (Adagio) até $199/mês (Vivace), embora cubram o app de chat e ferramentas, não uso de API.
Como se compara ao Claude e outros modelos
Análise completa: Kimi K3 vs Claude: Fable 5 e Opus 4.8 comparados
A versão curta: contra o Claude Opus 4.8, o K3 vence em benchmarks e preço — é um upgrade bastante limpo se o Opus 4.8 era sua baseline. Contra o Claude Fable 5 mais recente, o quadro é mais próximo: o Fable 5 vence mais benchmarks no geral (cerca de 8 de 14 em comparações head-to-head), especialmente em engenharia frontier e tarefas de visão, mas o K3 vence em coding agentic de longo horizonte e trabalho orientado a terminal, e faz isso por uma fração do custo do Fable 5.
O K3 também chegou na mesma janela que o GLM 5.2 e o Kimi K2.6 anterior como opções open-weight concorrentes — se você está avaliando modelos abertos especificamente, nosso review do GLM 5.2 e a comparação Kimi K2.6 vs GLM-5.1 são leituras complementares úteis enquanto um breakdown direto K3 vs GLM-5.2 está em preparação.
Como acessar o Kimi K3 hoje
Quatro formas de entrar, nenhuma das quais exige atualmente os pesos (não lançados):
- API própria da Moonshot em
platform.kimi.ai— cadastre-se, crie uma key e você é cobrado por token. Veja o guia de preços para passos de setup. - OpenRouter, listado como
moonshotai/kimi-k3— útil se você já roteia múltiplos provedores pelo OpenRouter e quer o K3 como opção drop-in. - App consumer Kimi e web chat — tier gratuito disponível (Adagio), com tiers pagos até $199/mês para uso mais pesado, créditos de agente e ferramentas. Isso é billing separado da API.
- Kimi Code, o agente de coding em terminal da Moonshot, para assinantes que querem o K3 integrado a um workflow de coding via CLI.
O que ainda não está disponível: pesos no Hugging Face e, portanto, qualquer forma de self-hosting real.
Kimi K3 vs Kimi K2.6: o que realmente mudou
Se você avaliou ou implantou o Kimi K2.6 no início de 2026, o K3 não é um bump de versão menor:
| Kimi K2.6 | Kimi K3 | |
|---|---|---|
| Parâmetros totais | ~1T | 2,8T |
| Janela de contexto | 256K | ~1M |
| Arquitetura | Atenção MoE padrão | Kimi Delta Attention + Attention Residuals + Stable LatentMoE |
| Entrada visual | Imagem + vídeo experimental | Compreensão nativa de imagem |
| Modo de raciocínio | Toggle (Thinking / Instant) | Modo thinking sempre ativo |
| Pesos abertos | Disponíveis no Hugging Face | Pendentes, esperados para 27 de julho de 2026 |
O K2.6 continua sendo uma escolha razoável se você já o integrou e não precisa do contexto maior ou da posição mais recente em benchmarks. Para qualquer nova avaliação, comece com o K3.
Quem deve usar o Kimi K3
- Times construindo ferramentas de coding agentic — os benchmarks de agente de longo horizonte e terminal são onde o K3 é mais forte em relação ao preço.
- Qualquer pessoa pagando atualmente pelo Claude Opus 4.8 onde custo por tarefa importa — o K3 o supera em benchmarks que a maioria dos times se importa e custa significativamente menos.
- Workflows pesados em frontend — o resultado #1 no LMArena Frontend Code Arena é um sinal genuíno e verificável, não apenas um número auto-relatado.
- Pipelines de contexto longo e RAG que podem se beneficiar da janela de contexto ~1M e do preço de entrada em cache com 90% de desconto.
Quem deve esperar
- Qualquer pessoa que precisa de inferência self-hosted on-prem hoje. Os pesos não saíram. Volte depois de 27 de julho de 2026.
- Times cujo workload pende fortemente para benchmarks acadêmicos de raciocínio (matemática de competição, ciência estilo GPQA) — o Claude Opus 4.8 e o Fable 5 ainda têm vantagem lá.
- Qualquer pessoa que precisa de um quadro de benchmarks totalmente maduro e verificado independentemente. O K3 tem dias de idade; alguns números circulando ainda são auto-relatados pelo vendor ou de um único agregador, e provavelmente serão refinados conforme mais da comunidade roda suas próprias avaliações.
FAQ
O que é o Kimi K3? O Kimi K3 é o modelo de linguagem grande flagship da Moonshot AI, lançado em 16 de julho de 2026. É um modelo mixture-of-experts de 2,8 trilhões de parâmetros com janela de contexto ~1M tokens, compreensão visual nativa e modo de raciocínio sempre ativo, posicionado como concorrente open-weight ao Claude e GPT.
O Kimi K3 é open source? Foi projetado para ser open-weight sob licença estilo Modified MIT, mas os pesos reais para download não estavam disponíveis no lançamento. A Moonshot se comprometeu a publicá-los, junto com um relatório técnico completo, até 27 de julho de 2026.
O Kimi K3 é gratuito? O app de chat consumer tem um tier gratuito (Adagio). A API é paga, a $3/M de entrada e $15/M de saída, sem tier gratuito de produção. Veja o guia de preços para o breakdown completo.
Como uso o Kimi K3?
Hoje, pela API da Moonshot em platform.kimi.ai, pelo OpenRouter como moonshotai/kimi-k3, ou pelo app consumer Kimi e web chat. Self-hosting não é possível até os pesos públicos serem lançados.
O Kimi K3 é melhor que o Claude? Depende de qual Claude. O K3 supera o Claude Opus 4.8 no Artificial Analysis Intelligence Index e na maioria dos benchmarks agentic, a um preço menor. Contra o Claude Fable 5 mais recente, o Fable 5 vence mais benchmarks no geral, mas o K3 vence em coding agentic de longo horizonte e é dramaticamente mais barato. Veja a comparação completa.
Quão grande é o Kimi K3? 2,8 trilhões de parâmetros totais, usando design mixture-of-experts (Stable LatentMoE) que ativa 16 de 896 experts por token — então o custo de inferência é muito menor do que a contagem total de parâmetros sugere.
Guias relacionados
Guias relacionados
Continue no cluster do Gemma 4 com o proximo guia que combina com a decisao que voce esta tomando agora.

Benchmarks do Kimi K3: Como Ele Realmente Se Compara
O Kimi K3 chegou ao #1 no Frontend Code Arena da LMArena e superou o Claude Opus 4.8 no Artificial Analysis Intelligence Index em menos de um dia após o lançamento. Veja o que os números realmente dizem — e onde não contam a história toda.

Preços do Kimi K3: Custos de API, Planos de Assinatura e o Que É Realmente Grátis
A API do Kimi K3 custa $3 por milhão de tokens de entrada e $15 por milhão de saída — mas o modo thinking sempre ativo significa que você paga por tokens de raciocínio em cada chamada. Veja quanto isso realmente custa.

Kimi K3 vs Claude: Fable 5 e Opus 4.8 Comparados
O Kimi K3 supera o Claude Opus 4.8 em preço e na maioria dos benchmarks, mas o Claude Fable 5 ainda lidera em engenharia frontier. Veja exatamente onde cada modelo vence, com fontes da Artificial Analysis e números de cada vendor.
Ainda decidindo o que ler depois?
Volte para o hub de guias para navegar por comparacoes de modelos, tutoriais de configuracao e paginas de planejamento de hardware.
