Gemma 4 가이드
Kimi K3: Moonshot AI의 2.8T Open-Weight 모델 완전 가이드

Kimi K3: Moonshot AI의 2.8T Open-Weight 모델, 완전 가이드
Moonshot AI는 2026년 7월 16일 Kimi K3를 출시했고, 하루 만에 LMArena Frontend Code Arena 1위에 올라 Claude Fable 5를 제치고, Artificial Analysis Intelligence Index에서도 Claude Opus 4.8을 앞선 점수를 기록했습니다. 2.8조 파라미터로, 지금까지 공개된 open-weight 모델 중 가장 큰 규모로 평가받고 있습니다 — 3년 전만 해도 중국 밖에서는 거의 알려지지 않았던 베이징 스타트업이었던 회사의 작품입니다.
이 가이드에서는 Kimi K3가 실제로 무엇인지, 무엇이 확인됐고 무엇이 아직 대기 중인지(공개 가중치는 아직 다운로드 불가), 그리고 실제 평가에 필요한 숫자는 어디서 확인할 수 있는지 다룹니다.

빠른 답변
- 출시: 2026년 7월 16일, Moonshot AI(CEO Yang Zhilin 설립).
- 규모: 총 2.8조 파라미터 — 지금까지 공개된 open-weight 모델 중 최대.
- 아키텍처: Moonshot의 Stable LatentMoE 프레임워크를 사용하는 Mixture-of-Experts(토큰당 896개 전문가 중 16개 활성), 두 가지 자체 혁신 기술 위에 구축: Kimi Delta Attention(하이브리드 선형 어텐션 메커니즘)과 Attention Residuals(표준 잔차 연결의 드롭인 대체).
- 컨텍스트 윈도우: 1,048,576 토큰(~1M), 네이티브 시각 이해 및 항상 켜진 "thinking mode."
- Open weights: Modified MIT 스타일 라이선스 하에 open-weight로 발표됐지만, 출시 시점에는 다운로드 가능한 가중치가 없었음 — Moonshot은 2026년 7월 27일까지 공개를 약속. 그때까지 "오픈소스"는 계획을 설명하는 것이지, 지금 다운로드할 수 있는 것을 의미하지 않음.
- 오늘 접근 방법: Moonshot 자체 API(
platform.kimi.ai), OpenRouter(moonshotai/kimi-k3), 소비자용 Kimi 앱/웹 채팅. Hugging Face 셀프 호스팅은 아직 불가. - Claude 대비 순위: Artificial Analysis Intelligence Index 및 여러 agentic/코딩 벤치마크에서 Claude Opus 4.8을 앞섬; 더 새로운 Claude Fable 5에는 대부분의 벤치마크에서 뒤지지만 장기 agentic 코딩에서는 이기며 가격은 훨씬 저렴.
Kimi K3가 실제로 무엇인가
Kimi K3는 Moonshot AI의 최신 플래그십 모델로, agentic 코딩, tool use, 일반 reasoning에서 가장 큰 클로즈드 소스 연구소와 정면으로 경쟁하는 open-weight 프론티어 시스템으로 포지셔닝되며, 가중치를 공개(현재는 공개를 약속)합니다.
중요한 프레이밍: 이것은 점진적인 포인트 릴리스가 아닙니다. Moonshot은 전작 Kimi K2.6(~1T 파라미터)의 2배 이상인 2.8T 파라미터 모델로 바로 점프했고, 기존 레시피에 스케일만 더한 것이 아니라 새 아키텍처를 함께 도입했습니다. 시장 반응도 즉각적이었습니다 — 이렇게 유능하고, 이렇게 저렴하며, 공개적으로 이용 가능한 모델이 나오면 업계 나머지가 얼마나 많은 컴퓨트를 사야 하는지에 대한 계산이 바뀐다는 논리로 AI 칩 주식 매도와 연결된 보도가 이어졌습니다.
아키텍처 및 사양
두 가지 기술이 핵심을 담당하며, 둘 다 Moonshot 팀이 출시 모델에 등장하기 전에 오픈 리서치로 먼저 발표한 것들입니다:
- Kimi Delta Attention — 표준 어텐션의 이차적 폭발 없이 장문 컨텍스트 추론을 빠르게 유지하도록 설계된 하이브리드 선형 어텐션 메커니즘.
- Attention Residuals — 모델이 스케일될수록 더 일관된 이득을 제공한다고 Moonshot이 말하는, 기존 잔차 연결의 드롭인 대체.
- Stable LatentMoE — mixture-of-experts 레이어 뒤의 라우팅 프레임워크. 896개 전문가 중 토큰당 16개가 활성화되어, 2.8T 파라미터 모델이 매 forward pass마다 2.8T 파라미터 분량의 연산을 필요로 하지 않고 계산적으로 다루 가능하게 유지.
아키텍처와 함께 K3는 다음을 제공합니다:
- 1,048,576 토큰 컨텍스트 윈도우(~1M 토큰), 입력과 출력 모두 포함.
- 네이티브 시각 이해 — 이미지 입력이 후처리로 붙은 것이 아니라 내장.
- 항상 켜진 reasoning mode("thinking mode") — 켜는 토글을 기억할 필요 없음.
Moonshot은 공개 가중치 출시와 함께 학습 및 평가 세부 사항이 담긴 전체 기술 보고서를 제공할 것이라고 밝혔습니다. 그때까지는 여기 요약된 내용을 넘어서는 아키텍처 세부 사항은 잠정적으로 취급하세요.
Kimi K3는 오픈소스인가?
K3에 대해 가장 많이 검색되는 질문이며, 솔직한 답은 두 부분으로 나뉩니다:
계획은 open-weight입니다. Moonshot은 K3가 Kimi K2.6과 같은 방식의 Modified MIT 스타일 라이선스 하에 출시될 것이라고 밝혔습니다(압도적 다수 사용자에게는 허용적이며, 매우 대규모 배포에서만 attribution 조항이 적용).
가중치는 아직 다운로드할 수 없습니다. 출시 시점에 Kimi K3는 Moonshot 호스팅 API, OpenRouter, 소비자 앱을 통해서만 접근 가능하며, 이 중 어느 것도 기본 모델 파일을 제공하거나 요구하지 않습니다. Moonshot은 2026년 7월 27일까지 실제 가중치와 기술 보고서를 함께 공개할 것을 약속했습니다. 그 날짜까지 "Kimi K3는 오픈소스"는 의도와 라이선스에 대한 진술이지, 오늘 git clone하거나 vLLM으로 실행할 수 있다는 뜻이 아닙니다.
셀프 호스팅, 온프레미스 추론이 꼭 필요하다면, 지금은 북마크해 두고 7월 27일 이후 다시 확인하는 것이 실용적입니다 — 2.8T 파라미터 모델(희소 MoE라도)은 K2.6보다 훨씬 더 많은 메모리가 필요하므로 하드웨어 대화는 별도로 예산을 잡으세요.
Kimi K3 성능
전체 분석: Kimi K3 벤치마크: 실제로 어디에 서 있는가
요약: Artificial Analysis Intelligence Index에서 K3는 57점으로 Claude Opus 4.8의 56점보다 앞서지만 Claude Fable 5의 60점보다는 뒤집니다. agentic 벤치마크 — GDPval-AA, BrowseComp, 장기 코딩 — 에서는 K3가 시장에서 가장 비싼 클로즈드 소스 모델과 실질적으로 경쟁하거나 때로는 앞섭니다. 출시 후 몇 시간 만에 LMArena Frontend Code Arena 1위에 올라 Claude Fable 5를 제쳤습니다.
약한 영역: GPQA Diamond, Humanity's Last Exam 같은 reasoning 중심 학술 벤치마크 — 여기서는 Claude Opus 4.8이 여전히 앞섭니다.
Kimi K3 가격
전체 분석: Kimi K3 가격: API 비용 및 구독 플랜
요약: API는 입력 백만 토큰당 $3, 출력 백만 토큰당 $15, 캐시된 입력은 백만 토큰당 $0.30으로 90% 할인 — agentic 및 RAG 스타일 워크로드에서 중요합니다. Claude Opus 4.8보다 입력·출력 모두 약 1.7배 저렴합니다. 소비자 앱은 무료(Adagio)부터 월 $199(Vivace)까지 5단계 구독 티어가 있지만, 이는 채팅 앱과 도구를 위한 것이며 API 사용은 포함하지 않습니다.
Claude 및 다른 모델과의 비교
전체 분석: Kimi K3 vs Claude: Fable 5와 Opus 4.8 비교
요약: Claude Opus 4.8 대비 K3는 벤치마크와 가격 모두에서 이깁니다 — Opus 4.8이 기준이었다면 꽤 깔끔한 업그레이드입니다. 더 새로운 Claude Fable 5와는 그림이 더 가깝습니다: Fable 5가 전체적으로 더 많은 벤치마크에서 이기지만(헤드투헤드 비교 14개 중 약 8개), 특히 프론티어 엔지니어링과 vision 작업에서, K3는 장기 agentic 코딩과 터미널 기반 작업에서 이기며 Fable 5 비용의 일부 수준입니다.
K3는 GLM 5.2 및 이전 Kimi K2.6과 같은 시기에 경쟁 open-weight 옵션으로 등장했습니다 — open 모델을 구체적으로 평가 중이라면 GLM 5.2 리뷰와 Kimi K2.6 vs GLM-5.1 비교가 유용한 동반 자료이며, K3 vs GLM-5.2 직접 비교는 준비 중입니다.
오늘 Kimi K3에 접근하는 방법
네 가지 경로가 있으며, 현재 어느 것도 (미출시) 가중치를 필요로 하지 않습니다:
platform.kimi.ai의 Moonshot 자체 API — 가입, 키 생성, 토큰당 과금. 설정 단계는 가격 가이드 참조.- OpenRouter,
moonshotai/kimi-k3로 등록 — 이미 OpenRouter로 여러 프로바이더를 라우팅 중이라 K3를 드롭인 옵션으로 추가하고 싶을 때 유용. - 소비자 Kimi 앱 및 웹 채팅 — 무료 티어(Adagio) 제공, 더 많은 사용량·에이전트 크레딧·도구를 위한 유료 티어는 월 $199까지. API와 별도 과금.
- Kimi Code, Moonshot의 터미널 코딩 에이전트 — K3를 CLI 코딩 워크플로에 연결하고 싶은 구독자용.
아직 불가: Hugging Face 가중치, 따라서 어떤 형태의 진정한 셀프 호스팅도.
Kimi K3 vs Kimi K2.6: 실제로 무엇이 바뀌었나
2026년 초에 Kimi K2.6을 평가하거나 배포했다면, K3는 사소한 버전 업이 아닙니다:
| Kimi K2.6 | Kimi K3 | |
|---|---|---|
| 총 파라미터 | ~1T | 2.8T |
| 컨텍스트 윈도우 | 256K | ~1M |
| 아키텍처 | 표준 MoE 어텐션 | Kimi Delta Attention + Attention Residuals + Stable LatentMoE |
| 시각 입력 | 이미지 + 실험적 비디오 | 네이티브 이미지 이해 |
| Reasoning mode | 토글(Thinking / Instant) | 항상 켜진 thinking mode |
| Open weights | Hugging Face에서 이용 가능 | 대기 중, 2026년 7월 27일 예상 |
이미 통합되어 있고 더 큰 컨텍스트나 최신 벤치마크 순위가 필요 없다면 K2.6도 합리적인 선택입니다. 새 평가는 K3부터 시작하세요.
Kimi K3를 써야 하는 사람
- Agentic 코딩 도구를 만드는 팀 — 장기 agent 및 터미널 벤치마크가 K3가 가격 대비 가장 강한 영역.
- 작업당 비용이 중요한 Claude Opus 4.8 사용자 — K3가 대부분의 팀이 신경 쓰는 벤치마크에서 이기며 의미 있게 더 저렴.
- 프론트엔드 중심 워크플로 — LMArena Frontend Code Arena 1위는 자체 보고 숫자가 아닌 검증 가능한 신호.
- ~1M 컨텍스트 윈도우와 90% 할인 캐시 입력 가격의 이점을 받을 수 있는 장문 컨텍스트 및 RAG 파이프라인.
기다려야 하는 사람
- 오늘 셀프 호스팅, 온프레미스 추론이 필요한 사람. 가중치가 아직 없음. 2026년 7월 27일 이후 다시 확인.
- 워크로드가 학술 reasoning 벤치마크(경시 수학, GPQA 스타일 과학)에 크게 기울어진 팀 — Claude Opus 4.8과 Fable 5가 여전히 우위.
- 완전히 성숙하고 독립적으로 검증된 벤치마크 그림이 필요한 사람. K3는 출시 며칠째; 일부 숫자는 여전히 벤더 보고 또는 단일 집계기 출처이며, 커뮤니티가 자체 평가를 실행하면서 정제될 가능성이 큼.
FAQ
Kimi K3란 무엇인가요? Kimi K3는 Moonshot AI의 플래그십 대규모 언어 모델로, 2026년 7월 16일 출시됐습니다. ~1M 토큰 컨텍스트 윈도우, 네이티브 시각 이해, 항상 켜진 reasoning mode를 갖춘 2.8조 파라미터 mixture-of-experts 모델로, Claude와 GPT에 대항하는 open-weight 경쟁자로 포지셔닝됩니다.
Kimi K3는 오픈소스인가요? Modified MIT 스타일 라이선스 하에 open-weight로 설계됐지만, 출시 시점에는 실제 다운로드 가능한 가중치가 없었습니다. Moonshot은 2026년 7월 27일까지 전체 기술 보고서와 함께 공개할 것을 약속했습니다.
Kimi K3는 무료인가요? 소비자 채팅 앱에 무료 티어(Adagio)가 있습니다. API는 입력 $3/M, 출력 $15/M로 유료이며, 프로덕션용 무료 티어는 없습니다. 전체 내용은 가격 가이드 참조.
Kimi K3는 어떻게 사용하나요?
오늘은 platform.kimi.ai의 Moonshot API, OpenRouter의 moonshotai/kimi-k3, 또는 소비자 Kimi 앱·웹 채팅을 통해 사용합니다. 공개 가중치가 출시될 때까지 셀프 호스팅은 불가능합니다.
Kimi K3가 Claude보다 나은가요? 어떤 Claude인지에 따라 다릅니다. K3는 Artificial Analysis Intelligence Index와 대부분의 agentic 벤치마크에서 Claude Opus 4.8을 이기며 더 저렴합니다. 더 새로운 Claude Fable 5와는 Fable 5가 전체적으로 더 많은 벤치마크에서 이기지만, K3는 장기 agentic 코딩에서 이기며 훨씬 저렴합니다. 전체 비교 참조.
Kimi K3는 얼마나 큰가요? 총 2.8조 파라미터이며, 토큰당 896개 전문가 중 16개를 활성화하는 mixture-of-experts 설계(Stable LatentMoE)를 사용 — 따라서 추론 비용은 총 파라미터 수가 시사하는 것보다 훨씬 낮습니다.
관련 가이드
관련 가이드
지금 고민 중인 결정과 가장 잘 맞는 다음 가이드를 따라 Gemma 4 클러스터를 계속 탐색해 보세요.

Kimi K3 벤치마크: 실제로 어디에 서 있는가
Kimi K3는 출시 하루 만에 LMArena Frontend Code Arena 1위에 올라 Artificial Analysis Intelligence Index에서 Claude Opus 4.8을 제쳤습니다. 숫자가 실제로 무엇을 말하는지 — 그리고 전체 이야기를 말하지 못하는 곳 — 을 정리합니다.

Kimi K3 가격: API 비용, 구독 플랜, 그리고 실제로 무료인 것
Kimi K3 API는 입력 백만 토큰당 $3, 출력 백만 토큰당 $15 — 하지만 항상 켜진 thinking mode 때문에 모든 호출에서 reasoning 토큰 비용을 냅니다. 실제로 얼마나 드는지 정리합니다.

Kimi K3 vs Claude: Fable 5와 Opus 4.8 비교
Kimi K3는 가격과 대부분의 벤치마크에서 Claude Opus 4.8을 이기지만, Claude Fable 5는 여전히 프론티어 엔지니어링에서 앞섭니다. Artificial Analysis와 각 벤더 숫자를 출처로 각 모델이 이기는 지점을 정리합니다.
다음에 무엇을 읽을지 아직 고민 중인가요?
가이드 허브로 돌아가 모델 비교, 설정 워크스루, 하드웨어 계획 페이지를 둘러보세요.
