Gemma 4 가이드

Kimi K3 벤치마크: 실제로 어디에 서 있는가

9분 읽기
kimi k3benchmarksllm evaluationcoding llmmoonshot ai
Kimi K3 벤치마크: 실제로 어디에 서 있는가

Kimi K3 벤치마크: 실제로 어디에 서 있는가

Kimi K3가 2026년 7월 16일 출시된 후 몇 시간 만에 LMArena Frontend Code Arena에서 #18에서 #1로 올라 Claude Fable 5를 제쳤습니다. Artificial Analysis Intelligence Index에서도 Claude Opus 4.8보다 높은 점수를 기록했습니다. 이 두 사실만으로도 출시 주간의 대부분의 화제를 설명합니다 — 하지만 단일 리더보드 순위는 모델이 어디에 강하고 약한지, 그 격차가 얼마나 실제인지, 벤치마크 harness 노이즈인지 이해하는 데는 부족합니다.

이 글은 Moonshot 자체 자료와 Artificial Analysis의 독립 평가를 출처로, 카테고리별 Kimi K3 벤치마크 성능을 분석하며, 이 중 어느 것에 기반해 결정하기 전에 알아야 할 방법론상 주의점을 함께 다룹니다.

인텔리전스 인덱스 막대, 코딩 리더보드, 속도/지연 비교 차트가 있는 Kimi K3 벤치마크 대시보드 일러스트

빠른 답변

  • Artificial Analysis Intelligence Index v4.1: Kimi K3 57점, Claude Opus 4.8(56)보다 앞서고 Claude Fable 5(60)보다 뒤.
  • 프론트엔드 코딩(LMArena Frontend Code Arena): Kimi K3 #1, 7개 프론트엔드 도메인 중 6개 1위, Claude Fable 5를 제치고 등극.
  • Agentic reasoning(GDPval-AA v2): Kimi K3 ~1,687, Claude Opus 4.8(1,600)보다 앞서고 Claude Fable 5 Max(~1,815) 및 GPT-5.6 Sol Max(~1,748)보다 뒤.
  • Claude Fable 5와 헤드투헤드: 양쪽 벤더가 보고하는 벤치마크 기준 Fable 5가 약 14개 중 8개, K3가 약 6개 승 — 장기 agentic 코딩, BrowseComp, Terminal-Bench 2.1 포함.
  • Claude Opus 4.8과 헤드투헤드: Kimi K3가 10개 비교 벤치마크 중 7개(BrowseComp, FrontierSWE, GDPval-AA, Toolathlon 포함)에서 앞서고; Opus 4.8은 GPQA Diamond, Humanity's Last Exam, OfficeQA Pro에서 여전히 앞섬.
  • 속도: K3는 약 62 tokens/sec, ~2초 time-to-first-token — Opus 4.8 max-effort reasoning mode보다 눈에 띄게 빠름.
  • 주의: 이 숫자들은 며칠 된 것이며, 대부분 벤더 또는 단일 집계기 보고이고, 특정 평가 설정(reasoning effort "max", temperature 1.0, top-p 1.0) 하에서 실행됨. 확정된 판결보다는 강한 초기 신호로 취급.

헤드라인 숫자: Artificial Analysis Intelligence Index

Artificial Analysis는 GDPval-AA v2, Terminal-Bench 2.1, SciCode, Humanity's Last Exam, GPQA Diamond, 장문 컨텍스트 reasoning 테스트 등 9개 평가를 단일 Intelligence Index 점수로 통합합니다.

Model AA Intelligence Index v4.1
Claude Fable 5 (Adaptive, Max effort) 60
Kimi K3 (max reasoning effort) 57
Claude Opus 4.8 (Adaptive, Max effort) 56

실제로 중요한 결론: K3는 이용 가능한 가장 똑똑한 모델은 아니지만, Fable 5나 Opus 4.8이 작업당 청구하는 비용의 일부 수준으로 프론티어에 몇 점 차이로 근접합니다. 대부분의 프로덕션 사용 사례에서 "프론티어에 가깝고 훨씬 저렴"이 "프론티어를 약간 앞서고 비쌈"을 이기지만 — 항상은 아니므로 아래 카테고리별 분석이 단일 종합 점수보다 중요합니다.

Agentic 및 장기 벤치마크

K3가 진짜 강하고 Moonshot이 분명히 최적화한 영역입니다.

GDPval-AA v2

현실적이고 경제적으로 가치 있는 지식 작업을 모델이 얼마나 잘 수행하는지 측정하는 비공개 agentic 벤치마크.

Model GDPval-AA v2 (Elo)
Claude Fable 5 Max ~1,815
GPT-5.6 Sol Max ~1,748
Kimi K3 ~1,687
Claude Opus 4.8 1,600

K3는 전체 3위 — 가장 비싼 두 클로즈드 소스 프론티어 모델 뒤이지만 Opus 4.8보다 분명히 앞섭니다.

AA-Briefcase (agentic knowledge work)

Model AA-Briefcase (Elo)
Claude Fable 5 Max ~1,587
Kimi K3 ~1,527
GPT-5.6 Sol Max ~1,495

여기서 K3는 2위로 GPT-5.6 Sol Max를 앞섭니다.

BrowseComp (agentic web research)

K3는 BrowseComp에서 Claude Fable 5를 앞섭니다 — Moonshot에게 가장 명확한 승리 중 하나이며, 워크로드가 자율 연구나 다단계 웹 탐색을 포함한다면 의미 있는 승리입니다.

코딩 벤치마크

Benchmark Kimi K3
Terminal-Bench 2.1 88.3
FrontierSWE 81.2
Program Bench 77.8
DeepSWE 67.5
SWE Marathon 42.0

SWE Marathon 참고: 낮은 절대 점수(42.0)가 모델이 약하다는 뜻은 아닙니다 — 이용 가능한 가장 어려운 장기 코딩 벤치마크 중 하나로, 모든 프론티어 모델이 절대적으로 낮은 점수를 받습니다. 중요한 것은 비교: K3는 SWE Marathon에서 Claude Fable 5보다 약 7점 앞서며, 이 난이도에서는 의미 있는 격차입니다.

LMArena Frontend Code Arena

출시일에 가장 많은 관심을 받은 벤치마크이며, 위 벤더 보고 숫자와 달리 크라우드 투표, 독립 운영 리더보드입니다. Kimi K3는 출시 후 몇 시간 만에 #18에서 #1로 올라 1,679점을 기록하고 7개 프론트엔드 도메인 중 6개 1위, Claude Fable 5를 제쳤습니다.

커뮤니티 투표이므로 고정 테스트 세트가 아니어서 학습 세트 중복으로 게임하기 어렵습니다 — 이번 출시 전체에서 가장 큰 소리가 아닌 더 신뢰할 수 있는 신호 중 하나입니다.

헤드투헤드: Kimi K3 vs. Claude Opus 4.8

양쪽이 공통으로 평가되는 벤치마크 기준:

Kimi K3가 앞서는 항목: BrowseComp, CharXiv-R, DeepSearchQA, FrontierSWE, GDPval-AA, MCP Atlas, Toolathlon (7개 벤치마크)

Claude Opus 4.8이 앞서는 항목: GPQA Diamond, Humanity's Last Exam, OfficeQA Pro (3개 벤치마크)

패턴은 일관됩니다: K3는 agentic, tool-using, 코딩 인접 작업에서 이기고; Opus 4.8은 순수 학술 reasoning 및 지식 중심 작업에서 이깁니다. 제품이 퀴즈 풀이기보다 에이전트에 가깝다면 그 패턴은 K3에 유리합니다.

헤드투헤드: Kimi K3 vs. Claude Fable 5

Fable 5는 더 새롭고 강한 Claude 모델이며 그 차이가 드러납니다: 14개 공유 벤치마크 중 Fable 5가 약 8개 승, FrontierSWE에서 5.4점 승과 두 visual-reasoning 스위트 전체 섹 포함. Kimi K3가 약 6개 승, SWE Marathon(약 7점), BrowseComp, Terminal-Bench 2.1 포함.

가격 및 워크로드별 권장을 포함한 전체 비교는 Kimi K3 vs Claude: Fable 5와 Opus 4.8 비교에 있습니다.

속도 및 지연

벤치마크는 정확성을 측정합니다; 많은 실제 애플리케이션에서 지연도 똑같이 중요합니다.

Metric Kimi K3 Claude Opus 4.8 (Max effort)
Output speed ~62 tokens/sec ~56 tokens/sec
Time to first token ~1.99s ~34.49s

Time-to-first-token 격차가 사용자 대면 제품에서 더 중요한 숫자입니다 — Opus 4.8 max-reasoning-effort mode는 첫 토큰이 나오기 전에 오래 "생각"하는 반면, K3의 항상 켜진 thinking mode는 훨씬 빨리 스트리밍을 시작하도록 튜닝되어 있습니다. 로딩 상태가 보이는 무언가를 만든다면 이 차이는 스프레드시트가 아니라 사용자가 느낍니다.

방법론상 주의점 — 결정하기 전에 읽으세요

위 내용을 절대 진리로 취급하기 전에 알아둘 것:

  • Reasoning effort가 중요합니다. Kimi 보고 결과는 reasoning effort "max", temperature 1.0, top-p 1.0 설정을 사용합니다. 프로덕션 배포 기본값을 포함한 다른 구성은 점수를 의미 있게 바꿀 수 있습니다.
  • Harness 선택이 중요합니다. Agentic 벤치마크는 harness(Kimi Code, Claude Code, Codex 등)를 통해 실행되며, harness 자체 — 재시도, 컨텍스트 관리, tool orchestration 처리 방식 — 가 기본 모델과 무관하게 점수를 몇 점 바꿀 수 있습니다.
  • 며칠 된 숫자입니다. K3는 2026년 7월 16일 출시. 일부 수치(위 포함)는 단일 집계기 또는 벤더 주장 출처이며 여러 독립 재현이 아닙니다. 커뮤니티가 자체 평가를 실행하면서 일부 숫자가 수정될 것으로 예상되며, 특히 2026년 7월 27일 공개 가중치 출시 후 독립 그룹이 호스팅 API가 아닌 실제 모델을 테스트할 수 있게 되면 더욱 그렇습니다.
  • 종합 지수는 카테고리 성능을 숨깁니다. 단일 Intelligence Index 숫자는 편리하지만 실제 차이를 평탄화합니다 — 모든 것에 mediocre한 모델과 코딩에는 뛰어나지만 trivia에는 약한 모델이 같은 종합 점수에 도달할 수 있습니다. 실제 사용 사례에 대해서는 항상 카테고리별 분석을 확인하세요.

워크로드별 의미

워크로드 K3 벤치마크 판단
프론트엔드 / UI 코드 생성 LMArena Frontend Code Arena #1 강력한 선택
장기 자율 코딩 에이전트 SWE Marathon, Terminal-Bench 2.1에서 앞섬 강력한 선택
Agentic web research BrowseComp에서 Fable 5 앞섬 강력한 선택
프론티어 소프트웨어 엔지니어링(최고 난이도) FrontierSWE에서 Fable 5보다 5.4점 뒤 Fable 5도 평가
학술 reasoning / 과학 QA GPQA, HLE에서 Opus 4.8 뒤 Opus 4.8 / Fable 5 평가
대규모 비용 민감 agent 워크로드 프론티어에 가까운 점수, 가격은 일부 강력한 선택

결론

Kimi K3의 벤치마크 스토리는 단순히 시끄러운 것이 아니라 진짜 좋습니다: 크라우드 투표 코딩 리더보드 1위, Claude Opus 4.8을 앞선 종합 점수, 자율 코딩 또는 연구 에이전트를 만드는 사람에게 가장 중요한 agentic 및 tool-use 카테고리에서의 명확한 승리. 시장에서 가장 똑똑한 모델은 아닙니다 — Claude Fable 5가 여전히 프론티어 엔지니어링과 학술 reasoning에서 앞서지만 — 충분히 가깝고 충분히 저렴해서, 이번 출시 시점 기준 대부분의 agentic 및 코딩 워크로드에서 "K3를 먼저 테스트"는 합리적인 기본값입니다.

그 방정식의 가격 측면은 Kimi K3 가격 참조. 전체 모델 대 모델 분석은 Kimi K3 vs Claude 참조.

FAQ

Kimi K3가 Claude Opus 4.8보다 나은가요? 대부분의 공유 벤치마크에서 예 — K3가 10개 비교 평가 중 7개(BrowseComp, FrontierSWE, GDPval-AA 포함)에서 앞서고 Artificial Analysis Intelligence Index에서도 더 높음(57 vs. 56). Opus 4.8은 GPQA Diamond, Humanity's Last Exam, OfficeQA Pro에서 여전히 앞섭니다.

Kimi K3가 Claude Fable 5보다 나은가요? 전체적으로는 아님 — Fable 5가 약 14개 공유 벤치마크 중 8개를 이기고 Intelligence Index도 더 높음(60 vs. 57). K3는 장기 agentic 코딩, BrowseComp, Terminal-Bench 2.1에서 이기며 작업당 비용은 훨씬 저렴합니다.

Kimi K3의 Artificial Analysis Intelligence Index 점수는? 지수 v4.1 방법론 기준 57점, Claude Opus 4.8(56)과 Claude Fable 5(60) 사이.

Kimi K3가 정말 코딩 리더보드 1위에 올랐나요? 예 — 크라우드 투표 리더보드인 LMArena Frontend Code Arena에서 출시 후 몇 시간 만에 #18에서 #1로 올라 Claude Fable 5를 제치고 7개 프론트엔드 도메인 중 6개 1위.

Kimi K3 벤치마크 숫자는 신뢰할 수 있나요? 합리적인 초기 신호이지만 최종 판결은 아닙니다. 대부분의 수치는 벤더 보고 또는 단일 독립 집계기(Artificial Analysis) 출처이며, 특정 설정(max reasoning effort) 하에서 평가됨. 공개 가중치 출시 후 더 많은 그룹이 독립적으로 테스트하면서 정제될 것으로 예상.

관련 가이드

관련 가이드

지금 고민 중인 결정과 가장 잘 맞는 다음 가이드를 따라 Gemma 4 클러스터를 계속 탐색해 보세요.

Kimi K3 vs Claude: Fable 5와 Opus 4.8 비교

Kimi K3 vs Claude: Fable 5와 Opus 4.8 비교

Kimi K3는 가격과 대부분의 벤치마크에서 Claude Opus 4.8을 이기지만, Claude Fable 5는 여전히 프론티어 엔지니어링에서 앞섭니다. Artificial Analysis와 각 벤더 숫자를 출처로 각 모델이 이기는 지점을 정리합니다.

다음에 무엇을 읽을지 아직 고민 중인가요?

가이드 허브로 돌아가 모델 비교, 설정 워크스루, 하드웨어 계획 페이지를 둘러보세요.