Guias do Gemma 4

Chave de API e Preços do Kimi K2.6: Custos Oficiais, Limites de Taxa e Taxas de Busca na Web

Atualizado em 14 de jun. de 20268 min de leitura
kimi k2.6kimi apiapi pricingllm pricingmoonshot ai
Chave de API e Preços do Kimi K2.6: Custos Oficiais, Limites de Taxa e Taxas de Busca na Web

Atualização de 14 de junho de 2026: A Kimi agora lista o K2.7 Code como modelo de coding mais recente. Preços globais: K2.6 $0.16 cache hit / $0.95 input / $4.00 output por MTok; K2.7 Code $0.19 / $0.95 / $4.00. Confira cobrança local, rate limits e preços de ferramentas no console ao vivo.

Chave de API e Preços do Kimi K2.6: Custos Oficiais, Limites de Taxa e Taxas de Busca na Web

Se você está prestes a criar uma chave de API do Kimi para usar o K2.6, o preço por token é só parte da história. Cache, níveis de limite de taxa, taxas de busca na web e retries de estilo agent moldam silenciosamente sua conta mensal. Este guia percorre cada um desses pontos usando os números atualmente publicados nas próprias páginas da plataforma Moonshot.

Ilustração de painel de preços da API do Kimi K2.6 com níveis de preço por token, medidores de rate limit e visuais de console de desenvolvedor no estilo Moonshot

Resposta rápida

  • O Kimi K2.6 usa a API compatível com OpenAI da Moonshot em https://api.moonshot.ai/v1 — qualquer SDK da OpenAI funciona como cliente drop-in.
  • Preços oficiais do K2.6 na página da plataforma Moonshot:
    • Entrada em cache: $0.16 / 1M tokens
    • Entrada sem cache: $0.95 / 1M tokens
    • Saída: $4.00 / 1M tokens
    • Janela de contexto: 262.144 tokens
  • Você obtém uma chave de API criando uma conta em platform.moonshot.ai e gerando a chave no console.
  • A busca na web integrada custa preço atual das ferramentas por chamada, além dos tokens consumidos pelos resultados de busca no próximo request para /chat/completions.
  • O nível gratuito (Tier 0) permite limite atual no console, 1 requisição concorrente e tem um teto diário de tokens. Para uso mais pesado, é preciso fazer recarga e subir de nível.

O restante do artigo detalha esses números e os pontos de atenção em torno deles.

Como criar uma chave de API do Kimi

O fluxo é o mesmo da maioria dos provedores de LLM:

  1. Acesse platform.moonshot.ai e faça login ou crie sua conta.
  2. Verifique sua conta, se for solicitado.
  3. Abra a seção de chaves de API no console e clique em Create API key.
  4. Copie a chave imediatamente — ela é mostrada só uma vez.
  5. Opcional, mas recomendado: defina um limite de orçamento e um alerta de saldo baixo antes de rodar qualquer carga.

Trate essa chave como uma senha: armazene em variável de ambiente ou secret manager, não em arquivos de código-fonte. Se ela vazar, faça a rotação pela mesma página do console.

Algo importante para contas novas: a Moonshot usa limites em camadas que escalam com o valor total recarregado ao longo do tempo. Uma conta recém-criada começa no Tier 0, com limites bem apertados — suficiente para alguns testes, mas insuficiente para um agente de código sempre ativo. Veja a seção de rate limits abaixo antes de começar qualquer benchmark.

Preços oficiais do Kimi K2.6

Os números publicados atualmente na página global de preços da Kimi são:

Modelo Cache hit Input Output Observações
Kimi K2.6 $0.16 / MTok $0.95 / MTok $4.00 / MTok Preço geral de K2.6 mostrado pela Kimi
Kimi K2.7 Code $0.19 / MTok $0.95 / MTok $4.00 / MTok Opção mais nova voltada a coding

Dois pontos importam. Primeiro, a plataforma global da Kimi agora mostra esses preços em USD por milhão de tokens (MTok); se sua conta usa console China/RMB, verifique a página local de billing antes de citar custos. Segundo, input com cache hit é bem mais barato que input normal. Essa linha domina a economia de workflows com contexto longo e agentes.

O que significam "cached input" e "uncached input"

A Moonshot, como a maioria dos provedores de ponta, implementa context caching: quando partes do seu prompt já foram vistas recentemente, o servidor pula o recálculo desse prefixo e cobra uma taxa muito menor por esses tokens.

Na prática:

  • Cache hit (cached input) — um prefixo já enviado anteriormente (prompt de sistema, turnos anteriores, contexto de documento grande) coincide com o que está em cache no servidor. Você paga a tarifa de cache.
  • Cache miss (uncached input) — conteúdo novo, ordem diferente ou um prefixo que já saiu do cache. Você paga a tarifa cheia.

Por que isso importa em fluxos reais:

  • RAG de contexto longo — se você coloca 100K tokens de base de conhecimento no system prompt e os reutiliza ao longo das requisições, o cache transforma uma conta pesada em algo muito mais barato.
  • Loops de agentes — cada passo de um agente com ferramentas normalmente reenvia o prompt de sistema, os schemas de ferramentas e a conversa em andamento. Sem cache, cada passo paga a tarifa cheia. Com cache, só o novo resultado da ferramenta e a nova resposta do assistente saem no preço mais alto.
  • Prompts idênticos para usuários diferentes — se dois usuários passam pelo mesmo system prompt, o segundo se beneficia do cache.

A implicação prática é: estruture seus prompts para que as partes estáveis e reutilizáveis (instruções, documentos longos, definições de ferramentas) venham primeiro, e o conteúdo específico e variável do usuário venha por último. Isso maximiza a taxa de acerto de cache e pode cortar seus custos de entrada em cinco vezes ou mais.

Formato de requisição compatível com OpenAI

A API da Moonshot é compatível com OpenAI, o que significa que qualquer SDK da OpenAI funciona com uma nova base URL e uma nova chave de API.

curl

curl https://api.moonshot.ai/v1/chat/completions \
  -H "Authorization: Bearer $MOONSHOT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k2.6",
    "messages": [
      {"role": "user", "content": "Explain caching in one paragraph."}
    ]
  }'

Python (SDK da OpenAI)

from openai import OpenAI

client = OpenAI(
    api_key="your-moonshot-api-key",
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k2.6",
    messages=[
        {"role": "user", "content": "Write a Python function to debounce calls."}
    ],
)
print(response.choices[0].message.content)

Modo Thinking vs. Instant

O K2.6 usa Thinking por padrão. Para forçar o modo Instant e desativar tokens de raciocínio:

response = client.chat.completions.create(
    model="kimi-k2.6",
    messages=[...],
    extra_body={"thinking": {"type": "disabled"}},
)

No modo Thinking, você paga pelos tokens de raciocínio como saída. Se não precisar disso, desabilitar é uma forma simples de economizar.

Entrada multimodal

O K2.6 é nativamente multimodal — aceita texto, imagem e vídeo. Imagens são simples via o bloco image_url padrão da OpenAI. Entrada de vídeo é suportada na API oficial, mas a Moonshot a marca como experimental em deploys de terceiros. Se seu produto depende disso, teste a cadeia completa de ponta a ponta.

Rate limits e níveis de conta

A Moonshot aplica rate limits por conta em níveis. A progressão depende do status da conta, histórico de recarga e política atual da plataforma, então os números exatos podem mudar.

Confira a página de limites no console da plataforma antes de dimensionar um workload. Algumas regras práticas:

  • Níveis gratuitos ou de entrada servem para validação. Você consegue montar a integração, rodar algumas chamadas de teste e confirmar que o SDK da OpenAI funciona.
  • Limites de entrada não bastam para agentes de código. Qualquer loop real de agente precisa de RPM, concorrência e throughput de tokens suficientes para evitar backoff constante.
  • Libere throughput cedo. Para workloads reais, costuma ser melhor usar o nível que seu benchmark exige do que otimizar em torno dos menores limites.

Custos extras que as pessoas esquecem

A tabela por token não conta tudo. Há três categorias de custo que aparecem silenciosamente em produção.

Busca na web integrada. A Moonshot oferece uma ferramenta $web_search que o modelo pode chamar durante a geração. Cada chamada custa preço atual das ferramentas. Isso parece pouco, mas o conteúdo do resultado de busca entra como entrada adicional no próximo /chat/completions, e esses tokens são cobrados pela tarifa normal de input. Um agente muito falante que pesquisa dez vezes por turno do usuário paga dez taxas de busca e mais dez blocos de tokens de entrada.

Tokens de raciocínio. No modo Thinking, o modelo gera tokens internos de raciocínio que contam como saída. Em perguntas simples isso é ok. Em agentes que chamam ferramentas em loop, o raciocínio acumulado ao longo de 50 chamadas pode facilmente virar a maior linha da fatura. Se a tarefa não exigir isso, desligue.

Retries de agentes e loops de longa duração. Os próprios materiais da Moonshot destacam o K2.6 executando mais de 4.000 chamadas de ferramenta em 12 horas. Isso é impressionante — e também uma conta muito real. Demos de agentes de longa duração são úteis, mas também são o jeito mais rápido de queimar um orçamento grande sem perceber. Sempre limite o número máximo de passos e o máximo de tokens em workflows de agente.

Padrões de cache miss. Reordenar prompts, mudar muito a system message ou atender muitos usuários com contextos únicos reduz a taxa de acerto do cache. Se sua linha de custo de input estiver maior do que o esperado, o cache costuma ser a explicação.

O Kimi K2.6 é gratuito?

Existem três perguntas diferentes sobre “gratuito”, e elas têm respostas diferentes:

Usar o Kimi no navegador em kimi.com. Os produtos de consumo da Moonshot normalmente têm um nível gratuito com cotas diárias. Isso não é a API — conversas ali não consomem créditos de API.

Usar a API do Kimi K2.6 sem pagar. O Tier 0 gratuito permite fazer um pequeno número de chamadas sem recarga. É suficiente para testes de integração, não para carga sustentada. Acima do Tier 0, o uso da API é pago.

Usar o Kimi K2.6 via Ollama Cloud, OpenRouter ou similares. Esses são sistemas de cobrança separados, com seus próprios créditos gratuitos e preços. Não são “a API do Kimi”, embora possam rotear para o mesmo modelo.

Em resumo: há uma forma gratuita de experimentar, mas não há forma gratuita de rodar um workload de produção no K2.6 pela API oficial.

Como controlar o custo da API do Kimi

Checklist curta antes de escalar:

  • Defina um teto rígido de orçamento no console.
  • Ative alertas de saldo baixo para descobrir gastos inesperados cedo.
  • Sempre passe max_tokens na saída, especialmente em loops de agentes.
  • Coloque o contexto estável primeiro e o conteúdo variável do usuário por último.
  • Desative o modo Thinking em tarefas que não precisam dele.
  • Proteja o $web_search atrás de intenção explícita.
  • Limite loops de agentes com contador de passos e timeout de parede.
  • Registre tokens de input, output e cached input por requisição para enxergar de onde o custo realmente vem.

Recomendação final

Se você está avaliando Kimi para um agente de código ou workflow de contexto longo, a estrutura de custo é viável, mas não fica barata automaticamente. Os preços principais por token são competitivos e cache hit ajuda bastante — desde que você estruture prompts para acertar o cache. Para novos agentes de coding, compare K2.6 com K2.7 Code em vez de assumir que o modelo mais antigo ainda é a melhor escolha.

Para a maioria dos times, o ponto de partida certo é: criar a integração, medir sua taxa real de cache hit e distribuição de tokens em produção, verificar os rate limits atuais da conta e só então decidir se K2.6, K2.7 Code ou outro modelo tem o melhor custo por tarefa.

FAQ

Como obter uma chave de API da Kimi? Entre em platform.moonshot.ai, abra a seção de API keys e crie uma nova chave. Copie imediatamente; ela aparece só uma vez. Defina também um limite de orçamento.

Quanto custa o Kimi K2.6? Na página global de preços, o K2.6 aparece com cache hit $0.16 / MTok, input $0.95 / MTok e output $4.00 / MTok. O K2.7 Code aparece com cache hit $0.19 / MTok, input $0.95 / MTok e output $4.00 / MTok. Confira o console local se sua conta for cobrada em RMB.

O Kimi K2.6 é gratuito? O produto de consumo em kimi.com pode ter um free tier próprio, separado da cobrança da API. Contas de API também podem ter acesso inicial ou promocional, mas workloads de produção devem ser tratados como uso pago.

A API Kimi suporta SDKs da OpenAI? Sim. A API Kimi é compatível com OpenAI. Aponte qualquer SDK da OpenAI para https://api.moonshot.ai/v1 com sua chave Moonshot e use model como kimi-k2.6.

Quais são os rate limits da API do Kimi? Os limites são em níveis e podem variar por status da conta, histórico de recarga e política atual da plataforma. Para sizing de produção, use a página de limites do console ao vivo em vez de copiar uma tabela antiga de RPM.

Quanto custa a busca na web do Kimi? Confira a página atual de preços de ferramentas. Web search e ferramentas semelhantes podem ser cobradas separadamente dos tokens do modelo, e o conteúdo retornado também pode aumentar a conta de input tokens no request seguinte.

Posso usar Kimi K2.6 com tools e function calling? Sim. K2.6 suporta tool use e function calling no mesmo estilo da OpenAI. Uma restrição da documentação da Moonshot: com Thinking mode ativo, tool_choice deve ficar em auto ou none, e você precisa preservar reasoning_content nas mensagens do assistant entre turns com tools.

Guias relacionados

Continue no cluster do Gemma 4 com o proximo guia que combina com a decisao que voce esta tomando agora.

Ainda decidindo o que ler depois?

Volte para o hub de guias para navegar por comparacoes de modelos, tutoriais de configuracao e paginas de planejamento de hardware.