Guias do Gemma 4
Preços do Kimi K3: Custos de API, Planos de Assinatura e o Que É Realmente Grátis

Preços do Kimi K3: custos de API, planos de assinatura e o que é realmente grátis
O preço de destaque da API do Kimi K3 — $3 por milhão de tokens de entrada, $15 por milhão de saída — parece competitivo frente a preços de Claude e tier GPT. E é. Mas o K3 tem uma propriedade que muda a matemática mais do que o preço por token: o modo thinking está sempre ativo e não pode ser desativado. Cada chamada paga por tokens de raciocínio, cobrados como saída, queira você ou não. Este guia cobre a estrutura real de preços, como o custo de tokens de raciocínio aparece de fato na sua conta, e os tiers de assinatura consumer, que são um produto completamente separado da API.

Resposta rápida
- Preços da API: $3 / MTok entrada, $15 / MTok saída, $0,30 / MTok entrada em cache (desconto de 90% em cache hits).
- Base URL:
https://api.moonshot.ai/v1, compatível com OpenAI. Model ID:kimi-k3. - Obtenha uma key em:
platform.kimi.aiouplatform.moonshot.ai(mesmo console subjacente). - Modo thinking não pode ser desligado. K3 sempre raciocina antes de responder, e esses tokens de raciocínio são cobrados como tokens de saída — testes independentes registraram mais de 13.000 tokens de thinking para uma única tarefa curta em max reasoning effort.
- Reasoning effort tem três tiers — Standard, High, Max — e alternar entre eles no meio da sessão invalida seu context cache, forçando um re-prefill caro.
- Caching é automático. Sem cache ID manual ou configuração de TTL; Moonshot reporta taxas de cache hit acima de 90% em workloads de coding.
- Também no OpenRouter como
moonshotai/kimi-k3, mesmo preço $3/$15 por milhão. - Assinaturas do app consumer (Adagio/Moderato/Allegretto/Allegro/Vivace, $0–$199/mês) são cobradas separadamente da API e não incluem chamadas de API.
- Novos cadastros de assinatura estão pausados atualmente. A Moonshot pausou novos cadastros Kimi Membership em 19 de julho de 2026 após demanda exceder capacidade de GPU — assinantes existentes e (até onde reportado) a API não são afetados. Detalhes: por que o Kimi K3 esgotou.
Como obter uma API key do Kimi K3
- Acesse
platform.kimi.ai(ouplatform.moonshot.ai— ambos atualmente roteiam para o mesmo console de desenvolvedor) e faça login ou crie uma conta. - Complete qualquer verificação necessária.
- Abra a seção de API keys e crie uma nova key. Copie imediatamente — ela é exibida uma vez.
- Defina um budget cap e alerta de saldo baixo antes de rodar qualquer coisa além de algumas chamadas de teste. Com tokens de raciocínio sempre ativos, os custos podem subir mais rápido do que você esperaria só pelo preço por token de destaque.
Trate a key como segredo — variável de ambiente ou secret manager, nunca commitada no código.
Preços oficiais do Kimi K3
| Entrada em cache | Entrada | Saída | |
|---|---|---|---|
| Kimi K3 | $0.30 / MTok | $3.00 / MTok | $15.00 / MTok |
Isso é diferença de 10x entre entrada em cache e não cacheada, e 5x entre entrada e saída. Ambos os multiplicadores importam mais para o K3 do que para a maioria dos modelos, pelo motivo coberto a seguir.
Por que "thinking sempre ativo" muda sua conta
A maioria dos modelos deixa você escolher se gasta tokens em raciocínio visível. O Kimi K3 não — toda resposta inclui reasoning_content gerado antes da resposta final, e a Moonshot cobra esses tokens de raciocínio como tokens de saída, na taxa completa de $15/MTok.
Na prática, isso significa:
- Uma resposta factual curta pode custar muito mais do que parece. Testes independentes documentaram mais de 13.000 tokens de thinking consumidos para uma tarefa cuja resposta final tinha algumas frases. A $15/MTok, isso é cerca de $0,20 só em raciocínio, antes da resposta visível ser gerada.
- Você não pode optar por sair. Diferente do Kimi K2.6, que permitia desativar o modo thinking completamente para chamadas sensíveis a latência e custo, o K3 não tem modo "instant". Se seu workload é de alto volume e sensível a latência ou custo — autocomplete, classificação simples, respostas curtas de chat — o piso por chamada do K3 é maior do que parece pelo preço de vitrine.
- O que você pode controlar é reasoning effort, não o raciocínio em si. K3 expõe parâmetro
reasoning_effortcom três tiers — Standard, High e Max — que muda quanto o modelo raciocina, não se raciocina.
Tiers de reasoning effort e a armadilha do cache
Os três tiers de effort (Standard / High / Max) permitem trocar custo e latência por qualidade da resposta. A pegadinha: alternar reasoning effort no meio da sessão invalida seu context cache. Se você construiu um contexto grande em cache — conversa longa, documento grande, histórico de tool calls de um agente — e depois muda de Max para High (ou vice-versa) no meio, todo esse cache é perdido e a próxima chamada re-preenche a preço completo de entrada não cacheada.
A regra prática: escolha um tier de reasoning effort por workload e mantenha-o durante toda a sessão ou execução do agente. Não ajuste effort dinamicamente no meio da conversa a menos que tenha confirmado que o custo de invalidação de cache vale a pena para aquele caso específico.
Como o caching funciona de fato no Kimi K3
Diferente de alguns provedores, você não gerencia caching manualmente — não há cache ID para criar ou TTL para definir. A plataforma da Moonshot (construída sobre sua arquitetura de inferência desagregada Mooncake) cacheia automaticamente prefixos repetidos e reporta taxas de cache hit acima de 90% em workloads de coding.
Para obter essa taxa de hit na prática:
- Coloque conteúdo estável — system prompts, definições de ferramentas, documentos de referência longos — primeiro no prompt.
- Coloque a parte que muda a cada chamada — última mensagem do usuário, resultado mais recente de ferramenta — por último.
- Mantenha seu tier de reasoning effort constante dentro da sessão (veja acima).
- Evite reordenar ou reescrever levemente seu system prompt entre chamadas; até mudanças pequenas podem quebrar o match de prefixo e forçar cache miss.
Formato de request compatível com OpenAI
A API do Kimi K3 segue o formato request/response do OpenAI Chat Completions, então qualquer SDK OpenAI funciona mudando a base URL e o nome do modelo.
curl
curl https://api.moonshot.ai/v1/chat/completions \
-H "Authorization: Bearer $MOONSHOT_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [
{"role": "user", "content": "Summarize the tradeoffs of hybrid linear attention in two sentences."}
]
}'
Python (OpenAI SDK)
from openai import OpenAI
client = OpenAI(
api_key="your-moonshot-api-key",
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "Write a Python function to debounce calls."}
],
)
print(response.choices[0].message.content)
Definindo reasoning effort
response = client.chat.completions.create(
model="kimi-k3",
messages=[...],
extra_body={"reasoning_effort": "standard"}, # "standard" | "high" | "max"
)
Lembre-se: mudar esse valor entre chamadas na mesma sessão invalida seu cache.
Usando Kimi K3 no OpenRouter
O K3 também está listado no OpenRouter como moonshotai/kimi-k3, no mesmo preço $3/$15 por milhão da API direta. É uma opção razoável se você já roteia múltiplos provedores de modelo pelo OpenRouter e quer adicionar K3 sem conta Moonshot separada — você precisará de conta OpenRouter financiada e key do dashboard OpenRouter.
O Kimi K3 é gratuito?
Três perguntas diferentes, três respostas diferentes:
Usando o app consumer Kimi ou web chat. Sim, há tier gratuito (Adagio) com limites de uso. Isso não é a API — não gasta créditos de API e é cobrado (ou não cobrado) separadamente.
Usando a API Kimi K3. Não há tier gratuito contínuo para produção. Contas novas podem ter acesso trial limitado para testes, mas uso sustentado exige conta paga e financiada.
Usando Kimi K3 pelo OpenRouter ou routers similares. Billing totalmente separado, com seus próprios sistemas de crédito. Não é "a API Kimi" embora alcance o mesmo modelo.
Custo e planos de assinatura do Kimi K3
Produto separado da API, cobrindo web app, mobile app, Kimi Code CLI, créditos de agente, Slides e outras ferramentas:
| Tier | Preço/mês | Cobre |
|---|---|---|
| Adagio | Grátis | Chat web/mobile, uso limitado |
| Moderato | $19 | Limites de uso mais altos |
| Allegretto | $39 | Limites de uso mais altos, mais créditos de agente |
| Allegro | $99 | Uso pesado, ferramentas expandidas |
| Vivace | $199 | Tier mais alto, máximo de créditos de agente |
Nenhum desses tiers inclui acesso à API — se você está construindo produto ou integração, precisa de conta de API paga separada independentemente do tier de assinatura pessoal.
Novos cadastros de assinatura estão pausados desde 19 de julho de 2026. A Moonshot parou temporariamente de aceitar novos assinantes Kimi Membership após demanda empurrar perto dos limites de capacidade de GPU dentro de 48 horas do lançamento do K3. Assinantes existentes mantêm acesso completo, e a Moonshot está reabrindo novos cadastros em lotes. A Moonshot também está dividindo o produto em duas assinaturas separadas — Kimi Membership (web/app/office) e Kimi Code Membership (focado em programação) — para alocar compute com mais precisão. Breakdown completo: por que o Kimi K3 esgotou. Se você precisa de acesso hoje, a API acima não foi reportada como afetada pela pausa.
Custos extras para observar
- Tokens de raciocínio em toda chamada. Coberto acima — este é o maior fator de custo-surpresa específico do K3.
- Mudanças de effort que invalidam cache. Alterar
reasoning_effortno meio da sessão perde seu cache e re-preenche a preço completo. - Loops de agente. Cada passo em um agente com ferramentas tipicamente reenvia system prompt, schemas de ferramentas e histórico em execução. Com tokens de raciocínio adicionados em cima disso a cada passo, execuções longas de agente podem acumular custo rapidamente — limite max steps e defina timeouts de wall-clock.
- Taxas de ferramentas e busca, se usar ferramentas built-in da Moonshot — confira a página atual de preços de ferramentas, pois são cobradas separadamente dos tokens do modelo e os resultados voltam para a entrada da próxima request.
Como controlar o custo da API Kimi K3
- Defina budget cap rígido e alerta de saldo baixo no console antes de escalar além de testes.
- Escolha um tier de reasoning effort por workload e evite alternar no meio da sessão.
- Estruture prompts cache-first: conteúdo estável cedo, conteúdo volátil por último.
- Sempre passe
max_tokens, especialmente em loops de agente onde tokens de raciocínio podem correr longos. - Limite loops de agente com contador de passos e timeout.
- Registre contagens de entrada, saída, entrada em cache e tokens de raciocínio separadamente para ver exatamente de onde vem a conta — tokens de raciocínio são fáceis de perder se você só loga saída visível.
Recomendação final
O preço por token do Kimi K3 é genuinamente competitivo, e a história de caching é forte quando você entende o tradeoff de reasoning effort. Mas o modo thinking sempre ativo significa que o custo efetivo de uma chamada "simples" é maior do que o preço de destaque sugere, e maior do que era no Kimi K2.6, que permitia desativar raciocínio completamente. Antes de comprometer com K3 para workload de alto volume e sensível a latência, rode um batch de teste real e logue consumo de tokens de raciocínio especificamente — não assuma que o preço de vitrine conta a história toda.
Para como os preços do K3 se comparam diretamente ao Claude, veja Kimi K3 vs Claude. Para a visão geral completa do modelo, comece em Kimi K3 explicado.
FAQ
Quanto custa o Kimi K3? $3 por milhão de tokens de entrada, $15 por milhão de tokens de saída, e $0,30 por milhão para cache hits de entrada — aproximadamente 90% de desconto em cache hits.
Posso desativar o modo thinking no Kimi K3 para economizar? Não. Diferente do Kimi K2.6, o Kimi K3 sempre roda em modo thinking. Você só pode ajustar o tier de reasoning effort (Standard, High, Max), não desligar raciocínio completamente.
Por que minha conta Kimi K3 ficou mais alta do que esperado?
A causa mais comum são tokens de raciocínio — K3 gera reasoning_content em toda chamada, cobrados como tokens de saída a $15/MTok. Uma resposta visível curta pode ser precedida por milhares de tokens de raciocínio. Logue contagens de tokens de raciocínio separadamente para ver o breakdown real.
Alternar reasoning effort economiza dinheiro? Pode reduzir volume de tokens de raciocínio por chamada, mas alternar tiers de effort no meio da sessão invalida seu context cache, forçando re-prefill a preço completo. Escolha um tier por sessão em vez de ajustar dinamicamente.
O Kimi K3 é gratuito para usar? O app de chat consumer tem tier gratuito (Adagio). A API não tem tier gratuito contínuo de produção — contas novas podem ter acesso trial limitado, mas uso sustentado é pago.
Como obtenho uma API key do Kimi K3?
Faça login em platform.kimi.ai ou platform.moonshot.ai, abra a seção de API keys e crie uma nova key. Defina budget cap imediatamente, dado o custo de tokens de raciocínio sempre ativo.
O Kimi K3 é mais barato que o Claude? Em base por token, sim — preço $3/$15 do K3 fica abaixo do $5/$25 do Claude Opus 4.8. Mas Opus 4.8 permite controlar reasoning effort com mais granularidade, então comparação direta depende do seu mix real de tokens. Veja a comparação completa de preços.
Qual é o custo da assinatura Kimi K3? A assinatura consumer (separada do billing de API) vai do gratuito (Adagio) até $199/mês (Vivace), com tiers de $19/$39/$99 no meio. Desde 19 de julho de 2026, novos cadastros de assinatura estão temporariamente pausados devido a crunch de capacidade de GPU — veja por que o Kimi K3 esgotou para status atual e alternativas.
Ainda posso obter assinatura Kimi K3 agora? Novos cadastros para tiers consumer pagos estão pausados desde 19 de julho de 2026, embora assinantes existentes não sejam afetados e a Moonshot esteja reabrindo vagas em lotes. A API pay-per-token não foi reportada como afetada, então é o caminho mais confiável se você precisa de acesso hoje.
Guias relacionados
- Kimi K3: o modelo open-weight de 2,8T da Moonshot AI explicado
- Benchmarks do Kimi K3: como ele realmente se compara
- Por que o Kimi K3 esgotou? A pausa de capacidade de GPU explicada
- Kimi K3 vs Qwen 3.8: o que está confirmado e o que não está
- Kimi K3 vs Claude: Fable 5 e Opus 4.8 comparados
- API key e preços do Kimi K2.6
Guias relacionados
Continue no cluster do Gemma 4 com o proximo guia que combina com a decisao que voce esta tomando agora.

Chave de API e Preços do Kimi K2.6: Custos Oficiais, Limites de Taxa e Taxas de Busca na Web
Os preços oficiais por token do Kimi K2.6, o que significam cached input e uncached input, como os níveis de rate limit funcionam na prática e quais custos extras — como busca na web — as pessoas esquecem ao fazer orçamento.

Por Que o Kimi K3 Esgotou? A Pausa de Capacidade de GPU Explicada
Kimi K3 não foi descontinuado nem "esgotou" de fato — a Moonshot pausou novos cadastros de assinatura após a demanda atingir a capacidade de GPU em 48 horas após o lançamento. Veja o que isso significa se você está tentando obter acesso agora.

Kimi K3 vs Qwen 3.8: O Que Está Confirmado e o Que Não Está (Julho de 2026)
A Alibaba apresentou o Qwen 3.8 três dias após o lançamento do Kimi K3, chamando-o de "segundo apenas ao Fable 5". Problema: o Qwen 3.8 ainda não tem um único benchmark publicado. Veja o que está realmente confirmado dos dois lados antes de escolher.
Ainda decidindo o que ler depois?
Volte para o hub de guias para navegar por comparacoes de modelos, tutoriais de configuracao e paginas de planejamento de hardware.
