Guias do Gemma 4
Benchmarks do Kimi K3: Como Ele Realmente Se Compara

Benchmarks do Kimi K3: como ele realmente se compara
Em horas após o lançamento do Kimi K3 em 16 de julho de 2026, ele saltou do #18 para o #1 no Frontend Code Arena da LMArena, ultrapassando o Claude Fable 5. Também registrou pontuação maior que o Claude Opus 4.8 no Artificial Analysis Intelligence Index. Esses dois fatos sozinhos explicam a maior parte do barulho da semana de lançamento — mas uma única posição em leaderboard é um substituto ruim para realmente entender onde um modelo é forte, onde não é, e quanto dessa diferença é real versus ruído de harness de benchmark.
Este é um breakdown do desempenho em benchmarks do Kimi K3 por categoria, com fontes nos materiais da Moonshot e na avaliação independente da Artificial Analysis, com as ressalvas metodológicas que importam antes de você tomar uma decisão com base em qualquer um deles.

Resposta rápida
- Artificial Analysis Intelligence Index v4.1: Kimi K3 pontua 57, à frente do Claude Opus 4.8 (56), atrás do Claude Fable 5 (60).
- Coding de frontend (LMArena Frontend Code Arena): Kimi K3 está em #1, primeiro em 6 de 7 domínios de frontend, tendo ultrapassado o Claude Fable 5.
- Raciocínio agentic (GDPval-AA v2): Kimi K3 pontua ~1.687, à frente do Claude Opus 4.8 (1.600), mas atrás do Claude Fable 5 Max (~1.815) e GPT-5.6 Sol Max (~1.748).
- Head-to-head vs. Claude Fable 5: nos benchmarks que ambos os vendors reportam, o Fable 5 vence cerca de 8 de 14, o K3 vence cerca de 6 — incluindo coding agentic de longo horizonte, BrowseComp e Terminal-Bench 2.1.
- Head-to-head vs. Claude Opus 4.8: Kimi K3 lidera em 7 de 10 benchmarks comparados (incluindo BrowseComp, FrontierSWE, GDPval-AA e Toolathlon); Opus 4.8 ainda lidera em GPQA Diamond, Humanity's Last Exam e OfficeQA Pro.
- Velocidade: K3 gera aproximadamente 62 tokens/seg com ~2 segundos de time-to-first-token, notavelmente mais rápido que o modo de raciocínio max-effort do Opus 4.8.
- Ressalva: esses números têm dias de idade, são majoritariamente reportados pelo vendor ou por um único agregador, e rodam sob configurações específicas de avaliação (reasoning effort em "max," temperature 1.0, top-p 1.0). Trate-os como um sinal inicial forte, não um veredito definitivo.
O número de destaque: Artificial Analysis Intelligence Index
A Artificial Analysis combina nove avaliações — incluindo GDPval-AA v2, Terminal-Bench 2.1, SciCode, Humanity's Last Exam, GPQA Diamond e testes de raciocínio de contexto longo — em uma única pontuação do Intelligence Index.
| Modelo | AA Intelligence Index v4.1 |
|---|---|
| Claude Fable 5 (Adaptive, Max effort) | 60 |
| Kimi K3 (max reasoning effort) | 57 |
| Claude Opus 4.8 (Adaptive, Max effort) | 56 |
A conclusão que realmente importa: K3 não é o modelo mais inteligente disponível, mas está a poucos pontos da frontier enquanto custa uma fração do que o Fable 5 ou Opus 4.8 cobram por tarefa. Para a maioria dos casos de uso em produção, "perto da frontier, muito mais barato" supera "ligeiramente à frente da frontier, caro" — mas nem sempre, por isso o breakdown por categoria abaixo importa mais do que o número composto único.
Benchmarks agentic e de longo horizonte
É aqui que o K3 é genuinamente forte, e onde a Moonshot claramente otimizou.
GDPval-AA v2
Um benchmark agentic privado que mede quão bem um modelo executa trabalho de conhecimento realista e economicamente valioso.
| Modelo | GDPval-AA v2 (Elo) |
|---|---|
| Claude Fable 5 Max | ~1.815 |
| GPT-5.6 Sol Max | ~1.748 |
| Kimi K3 | ~1.687 |
| Claude Opus 4.8 | 1.600 |
O K3 fica em terceiro no geral — atrás dos dois modelos frontier closed-source mais caros, mas claramente à frente do Opus 4.8.
AA-Briefcase (trabalho de conhecimento agentic)
| Modelo | AA-Briefcase (Elo) |
|---|---|
| Claude Fable 5 Max | ~1.587 |
| Kimi K3 | ~1.527 |
| GPT-5.6 Sol Max | ~1.495 |
Aqui o K3 sobe para o segundo lugar, à frente do GPT-5.6 Sol Max.
BrowseComp (pesquisa web agentic)
O K3 lidera o Claude Fable 5 no BrowseComp — uma das vitórias mais claras a favor da Moonshot, e significativa se seu workload envolve pesquisa autônoma ou navegação web multi-step.
Benchmarks de coding
| Benchmark | Kimi K3 |
|---|---|
| Terminal-Bench 2.1 | 88.3 |
| FrontierSWE | 81.2 |
| Program Bench | 77.8 |
| DeepSWE | 67.5 |
| SWE Marathon | 42.0 |
Uma nota sobre SWE Marathon: uma pontuação absoluta baixa (42.0) não significa que o modelo é fraco — é um dos benchmarks de coding de longo horizonte mais difíceis disponíveis, onde todo modelo frontier pontua baixo em termos absolutos. O que importa é a comparação: o K3 lidera o Claude Fable 5 no SWE Marathon por cerca de 7 pontos, o que é uma margem significativa nesse nível de dificuldade.
LMArena Frontend Code Arena
Este é o benchmark que gerou mais atenção no dia do lançamento, e diferente dos números auto-relatados acima, é um leaderboard independente votado pela comunidade. O Kimi K3 foi do #18 ao #1 em horas após o lançamento, pontuando 1.679 e ficando em primeiro em 6 de 7 domínios de frontend, ultrapassando o Claude Fable 5.
Por ser votado pela comunidade em vez de um test set fixo, é mais difícil de manipular com overlap de training set — o que o torna um dos sinais mais credíveis de todo esse lançamento, não apenas o mais barulhento.
Head-to-head: Kimi K3 vs. Claude Opus 4.8
Nos benchmarks em que ambos são comumente avaliados:
Kimi K3 lidera em: BrowseComp, CharXiv-R, DeepSearchQA, FrontierSWE, GDPval-AA, MCP Atlas, Toolathlon (7 benchmarks)
Claude Opus 4.8 lidera em: GPQA Diamond, Humanity's Last Exam, OfficeQA Pro (3 benchmarks)
O padrão é consistente: K3 vence em tarefas agentic, com uso de ferramentas e adjacentes a coding; Opus 4.8 vence em tarefas de raciocínio acadêmico puro e pesadas em conhecimento. Se seu produto parece mais um agente do que um quiz-taker, esse padrão favorece o K3.
Head-to-head: Kimi K3 vs. Claude Fable 5
O Fable 5 é o Claude mais recente e mais forte, e isso aparece: em 14 benchmarks compartilhados, Fable 5 vence cerca de 8, incluindo vitória de 5,4 pontos no FrontierSWE e sweep de ambas as suites de raciocínio visual. Kimi K3 vence cerca de 6, incluindo SWE Marathon (por ~7 pontos), BrowseComp e Terminal-Bench 2.1.
A comparação completa, incluindo preços e recomendação workload por workload, está em Kimi K3 vs Claude: Fable 5 e Opus 4.8 comparados.
Velocidade e latência
Benchmarks medem correção; para muitas aplicações reais, latência importa tanto quanto.
| Métrica | Kimi K3 | Claude Opus 4.8 (Max effort) |
|---|---|---|
| Velocidade de saída | ~62 tokens/sec | ~56 tokens/sec |
| Tempo até o primeiro token | ~1.99s | ~34.49s |
A diferença de time-to-first-token é o número mais consequente para produtos user-facing — o modo max-reasoning-effort do Opus 4.8 passa muito tempo "pensando" antes do primeiro token aparecer, enquanto o modo thinking sempre ativo do K3 é ajustado para começar a streamar muito mais cedo. Se você está construindo algo com estado de loading visível, essa diferença é sentida pelos usuários, não apenas medida em planilha.
Ressalvas metodológicas — leia isto antes de decidir qualquer coisa
Algumas coisas que valem saber antes de tratar qualquer um dos itens acima como gospel:
- Reasoning effort importa. Os resultados reportados da Kimi usam reasoning effort em "max," temperature 1.0 e top-p 1.0. Uma configuração diferente — incluindo o que seu deploy de produção usa por padrão — pode mover pontuações significativamente.
- Escolha de harness importa. Benchmarks agentic rodam por um harness (Kimi Code, Claude Code, Codex, etc.), e o próprio harness — como lida com retries, gerenciamento de contexto e orquestração de ferramentas — pode deslocar pontuações em vários pontos independentemente do modelo subjacente.
- Esses são números de dias atrás. O K3 foi lançado em 16 de julho de 2026. Algumas figuras circulando (incluindo algumas acima) vêm de um único agregador ou claim do vendor em vez de múltiplas replicações independentes. Espere alguns números serem revisados conforme mais da comunidade roda suas próprias avaliações, e especialmente quando os pesos públicos forem lançados em 27 de julho de 2026 e grupos independentes puderem testar o modelo real em vez da API hospedada.
- Índices compostos escondem desempenho por categoria. Um único número do Intelligence Index é conveniente, mas achata diferenças reais — um modelo mediano em tudo e um modelo brilhante em coding mas fraco em trivia podem cair na mesma pontuação composta. Sempre verifique o breakdown por categoria para seu caso de uso real.
O que isso significa por workload
| Workload | Como os benchmarks do K3 se saem | Veredito |
|---|---|---|
| Geração de código frontend / UI | #1 no LMArena Frontend Code Arena | Boa escolha |
| Agentes autônomos de coding de longo horizonte | Lidera em SWE Marathon, Terminal-Bench 2.1 | Boa escolha |
| Pesquisa web agentic | Lidera Fable 5 no BrowseComp | Boa escolha |
| Engenharia de software frontier (tier mais difícil) | Fica atrás do Fable 5 no FrontierSWE por 5,4 pts | Avalie o Fable 5 também |
| Raciocínio acadêmico / science QA | Fica atrás do Opus 4.8 em GPQA, HLE | Avalie Opus 4.8 / Fable 5 |
| Workloads agentic sensíveis a custo em escala | Pontuação perto da frontier por fração do preço | Boa escolha |
Conclusão
A história de benchmarks do Kimi K3 é genuinamente boa, não apenas barulhenta: resultado #1 em leaderboard de coding votado pela comunidade, pontuação composta à frente do Claude Opus 4.8 e vitórias claras nas categorias agentic e de uso de ferramentas que mais importam para quem constrói agentes autônomos de coding ou pesquisa. Não é o modelo mais inteligente do mercado — o Claude Fable 5 ainda lidera em engenharia frontier e raciocínio acadêmico — mas está perto o suficiente, a um preço baixo o suficiente, para que "testar o K3 primeiro" seja um default razoável para a maioria dos workloads agentic e de coding nesta janela de lançamento.
Para o lado de preços dessa equação, veja Preços do Kimi K3. Para o breakdown completo modelo vs modelo, veja Kimi K3 vs Claude.
FAQ
O Kimi K3 é melhor que o Claude Opus 4.8? Na maioria dos benchmarks compartilhados, sim — K3 lidera em 7 de 10 avaliações comparadas, incluindo BrowseComp, FrontierSWE e GDPval-AA, e pontua mais alto no Artificial Analysis Intelligence Index (57 vs. 56). Opus 4.8 ainda lidera em GPQA Diamond, Humanity's Last Exam e OfficeQA Pro.
O Kimi K3 é melhor que o Claude Fable 5? Não no geral — Fable 5 vence cerca de 8 de 14 benchmarks compartilhados e pontua mais alto no Intelligence Index (60 vs. 57). K3 vence em coding agentic de longo horizonte, BrowseComp e Terminal-Bench 2.1, e custa substancialmente menos por tarefa.
Qual é a pontuação do Kimi K3 no Artificial Analysis Intelligence Index? 57, na metodologia v4.1 do índice, posicionando-o entre Claude Opus 4.8 (56) e Claude Fable 5 (60).
O Kimi K3 realmente chegou ao #1 em um leaderboard de coding? Sim — Frontend Code Arena da LMArena, um leaderboard votado pela comunidade, classificou o K3 em #1 em horas após o lançamento, subindo do #18, ultrapassando o Claude Fable 5 e ficando em primeiro em 6 de 7 domínios de frontend.
Os números de benchmark do Kimi K3 são confiáveis? São um sinal inicial razoável, mas não um veredito final. A maioria das figuras é auto-relatada pelo vendor ou vem de um único agregador independente (Artificial Analysis), avaliado sob configurações específicas (max reasoning effort). Espere refinamento conforme mais grupos testem o modelo independentemente, particularmente após o lançamento dos pesos públicos.
Guias relacionados
Guias relacionados
Continue no cluster do Gemma 4 com o proximo guia que combina com a decisao que voce esta tomando agora.

Kimi K3: O Modelo Open-Weight de 2,8T da Moonshot AI Explicado
O Kimi K3 da Moonshot AI foi lançado em 16 de julho de 2026 como um modelo open-weight de 2,8 trilhões de parâmetros que supera o Claude Opus 4.8 em vários benchmarks. Aqui está o que ele realmente é, o que ainda falta e como testá-lo hoje.

Preços do Kimi K3: Custos de API, Planos de Assinatura e o Que É Realmente Grátis
A API do Kimi K3 custa $3 por milhão de tokens de entrada e $15 por milhão de saída — mas o modo thinking sempre ativo significa que você paga por tokens de raciocínio em cada chamada. Veja quanto isso realmente custa.

Kimi K3 vs Claude: Fable 5 e Opus 4.8 Comparados
O Kimi K3 supera o Claude Opus 4.8 em preço e na maioria dos benchmarks, mas o Claude Fable 5 ainda lidera em engenharia frontier. Veja exatamente onde cada modelo vence, com fontes da Artificial Analysis e números de cada vendor.
Ainda decidindo o que ler depois?
Volte para o hub de guias para navegar por comparacoes de modelos, tutoriais de configuracao e paginas de planejamento de hardware.
