Guias do Gemma 4
Preços do Kimi K3: Custos de API, Planos de Assinatura e o Que É Realmente Grátis

Preços do Kimi K3: custos de API, planos de assinatura e o que é realmente grátis
O preço de destaque da API do Kimi K3 — $3 por milhão de tokens de entrada, $15 por milhão de saída — parece competitivo frente a preços de Claude e tier GPT. E é. Mas o K3 tem uma propriedade que muda a matemática mais do que o preço por token: o modo thinking está sempre ativo e não pode ser desativado. Cada chamada paga por tokens de raciocínio, cobrados como saída, queira você ou não. Este guia cobre a estrutura real de preços, como o custo de tokens de raciocínio aparece de fato na sua conta, e os tiers de assinatura consumer, que são um produto completamente separado da API.

Resposta rápida
- Preços da API: $3 / MTok entrada, $15 / MTok saída, $0,30 / MTok entrada em cache (desconto de 90% em cache hits).
- Base URL:
https://api.moonshot.ai/v1, compatível com OpenAI. Model ID:kimi-k3. - Obtenha uma key em:
platform.kimi.aiouplatform.moonshot.ai(mesmo console subjacente). - Modo thinking não pode ser desligado. K3 sempre raciocina antes de responder, e esses tokens de raciocínio são cobrados como tokens de saída — testes independentes registraram mais de 13.000 tokens de thinking para uma única tarefa curta em max reasoning effort.
- Reasoning effort tem três tiers — Standard, High, Max — e alternar entre eles no meio da sessão invalida seu context cache, forçando um re-prefill caro.
- Caching é automático. Sem cache ID manual ou configuração de TTL; Moonshot reporta taxas de cache hit acima de 90% em workloads de coding.
- Também no OpenRouter como
moonshotai/kimi-k3, mesmo preço $3/$15 por milhão. - Assinaturas do app consumer (Adagio/Moderato/Allegretto/Allegro/Vivace, $0–$199/mês) são cobradas separadamente da API e não incluem chamadas de API.
Como obter uma API key do Kimi K3
- Acesse
platform.kimi.ai(ouplatform.moonshot.ai— ambos atualmente roteiam para o mesmo console de desenvolvedor) e faça login ou crie uma conta. - Complete qualquer verificação necessária.
- Abra a seção de API keys e crie uma nova key. Copie imediatamente — ela é exibida uma vez.
- Defina um budget cap e alerta de saldo baixo antes de rodar qualquer coisa além de algumas chamadas de teste. Com tokens de raciocínio sempre ativos, os custos podem subir mais rápido do que você esperaria só pelo preço por token de destaque.
Trate a key como segredo — variável de ambiente ou secret manager, nunca commitada no código.
Preços oficiais do Kimi K3
| Entrada em cache | Entrada | Saída | |
|---|---|---|---|
| Kimi K3 | $0.30 / MTok | $3.00 / MTok | $15.00 / MTok |
Isso é diferença de 10x entre entrada em cache e não cacheada, e 5x entre entrada e saída. Ambos os multiplicadores importam mais para o K3 do que para a maioria dos modelos, pelo motivo coberto a seguir.
Por que "thinking sempre ativo" muda sua conta
A maioria dos modelos deixa você escolher se gasta tokens em raciocínio visível. O Kimi K3 não — toda resposta inclui reasoning_content gerado antes da resposta final, e a Moonshot cobra esses tokens de raciocínio como tokens de saída, na taxa completa de $15/MTok.
Na prática, isso significa:
- Uma resposta factual curta pode custar muito mais do que parece. Testes independentes documentaram mais de 13.000 tokens de thinking consumidos para uma tarefa cuja resposta final tinha algumas frases. A $15/MTok, isso é cerca de $0,20 só em raciocínio, antes da resposta visível ser gerada.
- Você não pode optar por sair. Diferente do Kimi K2.6, que permitia desativar o modo thinking completamente para chamadas sensíveis a latência e custo, o K3 não tem modo "instant". Se seu workload é de alto volume e sensível a latência ou custo — autocomplete, classificação simples, respostas curtas de chat — o piso por chamada do K3 é maior do que parece pelo preço de vitrine.
- O que você pode controlar é reasoning effort, não o raciocínio em si. K3 expõe parâmetro
reasoning_effortcom três tiers — Standard, High e Max — que muda quanto o modelo raciocina, não se raciocina.
Tiers de reasoning effort e a armadilha do cache
Os três tiers de effort (Standard / High / Max) permitem trocar custo e latência por qualidade da resposta. A pegadinha: alternar reasoning effort no meio da sessão invalida seu context cache. Se você construiu um contexto grande em cache — conversa longa, documento grande, histórico de tool calls de um agente — e depois muda de Max para High (ou vice-versa) no meio, todo esse cache é perdido e a próxima chamada re-preenche a preço completo de entrada não cacheada.
A regra prática: escolha um tier de reasoning effort por workload e mantenha-o durante toda a sessão ou execução do agente. Não ajuste effort dinamicamente no meio da conversa a menos que tenha confirmado que o custo de invalidação de cache vale a pena para aquele caso específico.
Como o caching funciona de fato no Kimi K3
Diferente de alguns provedores, você não gerencia caching manualmente — não há cache ID para criar ou TTL para definir. A plataforma da Moonshot (construída sobre sua arquitetura de inferência desagregada Mooncake) cacheia automaticamente prefixos repetidos e reporta taxas de cache hit acima de 90% em workloads de coding.
Para obter essa taxa de hit na prática:
- Coloque conteúdo estável — system prompts, definições de ferramentas, documentos de referência longos — primeiro no prompt.
- Coloque a parte que muda a cada chamada — última mensagem do usuário, resultado mais recente de ferramenta — por último.
- Mantenha seu tier de reasoning effort constante dentro da sessão (veja acima).
- Evite reordenar ou reescrever levemente seu system prompt entre chamadas; até mudanças pequenas podem quebrar o match de prefixo e forçar cache miss.
Formato de request compatível com OpenAI
A API do Kimi K3 segue o formato request/response do OpenAI Chat Completions, então qualquer SDK OpenAI funciona mudando a base URL e o nome do modelo.
curl
curl https://api.moonshot.ai/v1/chat/completions \
-H "Authorization: Bearer $MOONSHOT_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [
{"role": "user", "content": "Summarize the tradeoffs of hybrid linear attention in two sentences."}
]
}'
Python (OpenAI SDK)
from openai import OpenAI
client = OpenAI(
api_key="your-moonshot-api-key",
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "Write a Python function to debounce calls."}
],
)
print(response.choices[0].message.content)
Definindo reasoning effort
response = client.chat.completions.create(
model="kimi-k3",
messages=[...],
extra_body={"reasoning_effort": "standard"}, # "standard" | "high" | "max"
)
Lembre-se: mudar esse valor entre chamadas na mesma sessão invalida seu cache.
Usando Kimi K3 no OpenRouter
O K3 também está listado no OpenRouter como moonshotai/kimi-k3, no mesmo preço $3/$15 por milhão da API direta. É uma opção razoável se você já roteia múltiplos provedores de modelo pelo OpenRouter e quer adicionar K3 sem conta Moonshot separada — você precisará de conta OpenRouter financiada e key do dashboard OpenRouter.
O Kimi K3 é gratuito?
Três perguntas diferentes, três respostas diferentes:
Usando o app consumer Kimi ou web chat. Sim, há tier gratuito (Adagio) com limites de uso. Isso não é a API — não gasta créditos de API e é cobrado (ou não cobrado) separadamente.
Usando a API Kimi K3. Não há tier gratuito contínuo para produção. Contas novas podem ter acesso trial limitado para testes, mas uso sustentado exige conta paga e financiada.
Usando Kimi K3 pelo OpenRouter ou routers similares. Billing totalmente separado, com seus próprios sistemas de crédito. Não é "a API Kimi" embora alcance o mesmo modelo.
Tiers de assinatura consumer
Produto separado da API, cobrindo web app, mobile app, Kimi Code CLI, créditos de agente, Slides e outras ferramentas:
| Tier | Preço/mês | Cobre |
|---|---|---|
| Adagio | Grátis | Chat web/mobile, uso limitado |
| Moderato | $19 | Limites de uso mais altos |
| Allegretto | $39 | Limites de uso mais altos, mais créditos de agente |
| Allegro | $99 | Uso pesado, ferramentas expandidas |
| Vivace | $199 | Tier mais alto, máximo de créditos de agente |
Nenhum desses tiers inclui acesso à API — se você está construindo produto ou integração, precisa de conta de API paga separada independentemente do tier de assinatura pessoal.
Custos extras para observar
- Tokens de raciocínio em toda chamada. Coberto acima — este é o maior fator de custo-surpresa específico do K3.
- Mudanças de effort que invalidam cache. Alterar
reasoning_effortno meio da sessão perde seu cache e re-preenche a preço completo. - Loops de agente. Cada passo em um agente com ferramentas tipicamente reenvia system prompt, schemas de ferramentas e histórico em execução. Com tokens de raciocínio adicionados em cima disso a cada passo, execuções longas de agente podem acumular custo rapidamente — limite max steps e defina timeouts de wall-clock.
- Taxas de ferramentas e busca, se usar ferramentas built-in da Moonshot — confira a página atual de preços de ferramentas, pois são cobradas separadamente dos tokens do modelo e os resultados voltam para a entrada da próxima request.
Como controlar o custo da API Kimi K3
- Defina budget cap rígido e alerta de saldo baixo no console antes de escalar além de testes.
- Escolha um tier de reasoning effort por workload e evite alternar no meio da sessão.
- Estruture prompts cache-first: conteúdo estável cedo, conteúdo volátil por último.
- Sempre passe
max_tokens, especialmente em loops de agente onde tokens de raciocínio podem correr longos. - Limite loops de agente com contador de passos e timeout.
- Registre contagens de entrada, saída, entrada em cache e tokens de raciocínio separadamente para ver exatamente de onde vem a conta — tokens de raciocínio são fáceis de perder se você só loga saída visível.
Recomendação final
O preço por token do Kimi K3 é genuinamente competitivo, e a história de caching é forte quando você entende o tradeoff de reasoning effort. Mas o modo thinking sempre ativo significa que o custo efetivo de uma chamada "simples" é maior do que o preço de destaque sugere, e maior do que era no Kimi K2.6, que permitia desativar raciocínio completamente. Antes de comprometer com K3 para workload de alto volume e sensível a latência, rode um batch de teste real e logue consumo de tokens de raciocínio especificamente — não assuma que o preço de vitrine conta a história toda.
Para como os preços do K3 se comparam diretamente ao Claude, veja Kimi K3 vs Claude. Para a visão geral completa do modelo, comece em Kimi K3 explicado.
FAQ
Quanto custa o Kimi K3? $3 por milhão de tokens de entrada, $15 por milhão de tokens de saída, e $0,30 por milhão para cache hits de entrada — aproximadamente 90% de desconto em cache hits.
Posso desativar o modo thinking no Kimi K3 para economizar? Não. Diferente do Kimi K2.6, o Kimi K3 sempre roda em modo thinking. Você só pode ajustar o tier de reasoning effort (Standard, High, Max), não desligar raciocínio completamente.
Por que minha conta Kimi K3 ficou mais alta do que esperado?
A causa mais comum são tokens de raciocínio — K3 gera reasoning_content em toda chamada, cobrados como tokens de saída a $15/MTok. Uma resposta visível curta pode ser precedida por milhares de tokens de raciocínio. Logue contagens de tokens de raciocínio separadamente para ver o breakdown real.
Alternar reasoning effort economiza dinheiro? Pode reduzir volume de tokens de raciocínio por chamada, mas alternar tiers de effort no meio da sessão invalida seu context cache, forçando re-prefill a preço completo. Escolha um tier por sessão em vez de ajustar dinamicamente.
O Kimi K3 é gratuito para usar? O app de chat consumer tem tier gratuito (Adagio). A API não tem tier gratuito contínuo de produção — contas novas podem ter acesso trial limitado, mas uso sustentado é pago.
Como obtenho uma API key do Kimi K3?
Faça login em platform.kimi.ai ou platform.moonshot.ai, abra a seção de API keys e crie uma nova key. Defina budget cap imediatamente, dado o custo de tokens de raciocínio sempre ativo.
O Kimi K3 é mais barato que o Claude? Em base por token, sim — preço $3/$15 do K3 fica abaixo do $5/$25 do Claude Opus 4.8. Mas Opus 4.8 permite controlar reasoning effort com mais granularidade, então comparação direta depende do seu mix real de tokens. Veja a comparação completa de preços.
Guias relacionados
Guias relacionados
Continue no cluster do Gemma 4 com o proximo guia que combina com a decisao que voce esta tomando agora.

Chave de API e Preços do Kimi K2.6: Custos Oficiais, Limites de Taxa e Taxas de Busca na Web
Os preços oficiais por token do Kimi K2.6, o que significam cached input e uncached input, como os níveis de rate limit funcionam na prática e quais custos extras — como busca na web — as pessoas esquecem ao fazer orçamento.

Kimi K3: O Modelo Open-Weight de 2,8T da Moonshot AI Explicado
O Kimi K3 da Moonshot AI foi lançado em 16 de julho de 2026 como um modelo open-weight de 2,8 trilhões de parâmetros que supera o Claude Opus 4.8 em vários benchmarks. Aqui está o que ele realmente é, o que ainda falta e como testá-lo hoje.

Benchmarks do Kimi K3: Como Ele Realmente Se Compara
O Kimi K3 chegou ao #1 no Frontend Code Arena da LMArena e superou o Claude Opus 4.8 no Artificial Analysis Intelligence Index em menos de um dia após o lançamento. Veja o que os números realmente dizem — e onde não contam a história toda.
Ainda decidindo o que ler depois?
Volte para o hub de guias para navegar por comparacoes de modelos, tutoriais de configuracao e paginas de planejamento de hardware.
