Gemma 4 가이드

Kimi K3 가격: API 비용, 구독 플랜, 그리고 실제로 무료인 것

9분 읽기
kimi k3kimi apiapi pricingllm pricingmoonshot ai
Kimi K3 가격: API 비용, 구독 플랜, 그리고 실제로 무료인 것

Kimi K3 가격: API 비용, 구독 플랜, 그리고 실제로 무료인 것

Kimi K3의 헤드라인 API 가격 — 입력 백만 토큰당 $3, 출력 백만 토큰당 $15 — 은 Claude 및 GPT급 가격 대비 경쟁력 있어 보입니다. 실제로 그렇습니다. 하지만 K3에는 토큰 가격보다 계산을 더 바꾸는 속성이 하나 있습니다: thinking mode는 항상 켜져 있고 끌 수 없습니다. 모든 호출에서 reasoning 토큰 비용을 지불하며, 원했든 아니든 출력으로 청구됩니다. 이 가이드는 실제 가격 구조, reasoning 토큰 비용이 청구서에 어떻게 나타나는지, API와 완전히 별개 제품인 소비자 구독 티어를 다룹니다.

토큰 비용 티어, 캐시 히트 미터, reasoning-effort 토글 옵션이 있는 Kimi K3 가격 대시보드 일러스트

빠른 답변

  • API 가격: 입력 $3 / MTok, 출력 $15 / MTok, 캐시된 입력 $0.30 / MTok(캐시 히트 시 90% 할인).
  • Base URL: https://api.moonshot.ai/v1, OpenAI 호환. Model ID: kimi-k3.
  • 키 발급: platform.kimi.ai 또는 platform.moonshot.ai(동일 콘솔).
  • Thinking mode는 끌 수 없습니다. K3는 답변 전에 항상 reasoning하며, reasoning 토큰은 출력 토큰으로 청구 — 독립 테스트에서 max reasoning effort로 짧은 작업 하나에 13,000개 이상 thinking 토큰 기록.
  • Reasoning effort 3단계 — Standard, High, Max — 세션 중간에 전환하면 컨텍스트 캐시가 무효화되어 비싼 re-prefill 발생.
  • 캐싱은 자동. 수동 cache ID나 TTL 설정 없음; Moonshot은 코딩 워크로드에서 90% 이상 캐시 히트율 보고.
  • OpenRouter에도 moonshotai/kimi-k3로 동일 $3/$15 per-million 가격.
  • 소비자 앱 구독(Adagio/Moderato/Allegretto/Allegro/Vivace, $0–$199/월)은 API와 별도 과금이며 API 호출 미포함.

Kimi K3 API 키 발급 방법

  1. platform.kimi.ai(또는 platform.moonshot.ai — 둘 다 현재 동일 개발자 콘솔로 연결)에 접속해 로그인하거나 계정 생성.
  2. 필요한 인증 완료.
  3. API keys 섹션을 열고 새 키 생성. 즉시 복사 — 한 번만 표시됨.
  4. 소량 테스트를 넘어 실행하기 전에 예산 상한과 잔액 부족 알림 설정. 항상 켜진 reasoning 토큰 때문에 헤드라인 per-token 가격만큼 예상보다 빨리 비용이 올라갈 수 있음.

키는 비밀로 취급 — 환경 변수나 secret manager, 소스에 커밋 금지.

Kimi K3 공식 가격

Cached input Input Output
Kimi K3 $0.30 / MTok $3.00 / MTok $15.00 / MTok

캐시된 입력과 캐시되지 않은 입력 사이 10배, 입력과 출력 사이 5배 차이. 다음 이유로 대부분의 모델보다 K3에서 두 배수 모두 더 중요합니다.

"항상 켜진 thinking"이 청구서를 바꾸는 이유

대부분의 모델은 visible reasoning에 토큰을 쓸지 선택할 수 있습니다. Kimi K3는 그렇지 않습니다 — 모든 응답에 최종 답변 전에 생성된 reasoning_content가 포함되며, Moonshot은 reasoning 토큰을 출력 토큰으로 전액 $15/MTok 요율로 청구합니다.

실제로는:

  • 짧은 사실 답변도 겉보기보다 훨씬 비쌀 수 있습니다. 독립 테스트에서 최종 답변이 몇 문장인 작업에 13,000개 이상 thinking 토큰 소비 기록. $15/MTok 기준 reasoning만 약 $0.20, visible 답변 생성 전.
  • 옵트아웃 불가. Kimi K2.6처럼 지연·비용 민감 호출을 위해 thinking mode를 완전히 끌 수 없음. K3에는 "instant" mode 없음. 워크로드가 고볼륨·지연·비용 민감 — 자동완성, 단순 분류, 짧은 채팅 — 이라면 K3의 호출당 최소 비용은 스티커 가격보다 높음.
  • 조절 가능한 것은 reasoning effort이지 reasoning 자체입니다. K3는 Standard, High, Max 3단계 reasoning_effort 파라미터를 제공 — reasoning 양을 바꾸지, reasoning 여부를 바꾸지 않음.

Reasoning effort 티어와 캐시 함정

3단계 effort(Standard / High / Max)로 비용·지연과 답변 품질을 트레이드오프. 함정: 세션 중간에 reasoning effort를 바꾸면 컨텍스트 캐시가 무효화됩니다. 긴 대화, 큰 문서, 에이전트의 실행 중 tool-call 기록 등 큰 캐시 컨텍스트를 쌓은 뒤 Max에서 High로(또는 그 반대) 중간에 바꾸면 전체 캐시가 forfeited되고 다음 호출이 전액 uncached-input 가격으로 re-prefill.

실용 규칙: 워크로드당 reasoning effort 티어 하나를 정하고 세션 또는 에이전트 실행 전체에 유지. 해당 경우 cache-invalidation 비용이 가치 있는지 확인하지 않았다면 대화 중간에 effort를 동적으로 조정하지 마세요.

Kimi K3에서 캐싱이 실제로 작동하는 방식

일부 프로바이더와 달리 캐싱을 수동 관리하지 않습니다 — cache ID 생성이나 TTL 설정 없음. Moonshot 플랫폼(Mooncake disaggregated inference 아키텍처 기반)은 반복 prefix를 자동 캐시하고 코딩 워크로드에서 90% 이상 캐시 히트율 보고.

실제로 그 히트율을 얻으려면:

  • 안정적 콘텐츠 — system prompt, tool 정의, 긴 참조 문서 — 를 프롬프트 에 배치.
  • 매 호출마다 바뀌는 부분 — 사용자 최신 메시지, 최신 tool 결과 — 을 에 배치.
  • 세션 내 reasoning effort 티어 일정하게 유지(위 참조).
  • 호출 간 system prompt 순서 변경이나 가벼운 재작성 피하기; 작은 변경도 prefix match를 깨고 cache miss 유발.

OpenAI 호환 요청 형식

Kimi K3 API는 OpenAI Chat Completions 요청/응답 형태와 일치하므로 base URL과 model name만 바꾸면 OpenAI SDK 사용 가능.

curl

curl https://api.moonshot.ai/v1/chat/completions \
  -H "Authorization: Bearer $MOONSHOT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {"role": "user", "content": "Summarize the tradeoffs of hybrid linear attention in two sentences."}
    ]
  }'

Python (OpenAI SDK)

from openai import OpenAI

client = OpenAI(
    api_key="your-moonshot-api-key",
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "user", "content": "Write a Python function to debounce calls."}
    ],
)
print(response.choices[0].message.content)

Reasoning effort 설정

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[...],
    extra_body={"reasoning_effort": "standard"},  # "standard" | "high" | "max"
)

같은 세션에서 호출 간 이 값을 바꾸면 캐시가 무효화됩니다.

OpenRouter에서 Kimi K3 사용

K3는 OpenRouter에도 moonshotai/kimi-k3로 등록, 직접 API와 동일 $3/$15 per-million. 이미 OpenRouter로 여러 모델 프로바이더를 라우팅 중이라 별도 Moonshot 계정 없이 K3를 추가하고 싶을 때 합리적 — OpenRouter 계정 충전 및 대시보드 키 필요.

Kimi K3는 무료인가?

세 가지 질문, 세 가지 답:

Kimi 소비자 앱 또는 웹 채팅 사용. 예, 사용량 제한이 있는 무료 티어(Adagio). API가 아님 — API 크레딧을 쓰지 않으며 별도(또는 비) 과금.

Kimi K3 API 사용. 프로덕션용 지속 무료 티어 없음. 신규 계정에 테스트용 제한 trial 가능하지만 지속 사용은 충전된 유료 계정 필요.

OpenRouter 등 라우터 경유 Kimi K3. 완전히 별도 과금, 자체 크레딧 시스템. 같은 모델에 도달하지만 "Kimi API"는 아님.

소비자 구독 티어

API와 별개 제품, 웹 앱, 모바일 앱, Kimi Code CLI, 에이전트 크레딧, Slides 등 도구 포함:

티어 월 요금 포함 내용
Adagio 무료 웹/모바일 채팅, 제한된 사용량
Moderato $19 더 높은 사용량 한도
Allegretto $39 더 높은 사용량 한도, 더 많은 에이전트 크레딧
Allegro $99 많은 사용량, 확장된 도구
Vivace $199 최고 티어, 최대 에이전트 크레딧

어느 티어도 API 접근 미포함 — 제품이나 통합을 만든다면 개인 구독 티어와 무관하게 별도 유료 API 계정 필요.

주의할 추가 비용

  • 모든 호출의 reasoning 토큰. 위에서 다룸 — K3 특유의 가장 큰 예상 외 비용 요인.
  • 캐시 무효화 effort 전환. 세션 중간 reasoning_effort 변경 시 캐시 forfeited, 전액 re-prefill.
  • 에이전트 루프. tool-using 에이전트의 각 단계는 보통 system prompt, tool schema, 실행 기록을 재전송. 매 단계 reasoning 토큰이 추가되면 긴 에이전트 실행 비용이 빠르게 누적 — max steps 상한 및 wall-clock timeout 설정.
  • Tool 및 검색 수수료, Moonshot 내장 도구 사용 시 — 모델 토큰과 별도 과금되며 결과가 다음 요청 input에 추가되므로 현재 tools 가격 페이지 확인.

Kimi K3 API 비용 관리 방법

  • 테스트를 넘어 확장하기 전 콘솔에서 하드 예산 상한과 잔액 부족 알림 설정.
  • 워크로드당 reasoning effort 티어 하나 선택, 세션 중간 전환 피하기.
  • 캐시 우선 프롬프트 구조: 안정 콘텐츠 앞, 변동 콘텐츠 뒤.
  • 항상 max_tokens 전달, reasoning 토큰이 길어질 수 있는 에이전트 루프에서 특히.
  • 에이전트 루프 step counter와 timeout으로 bound.
  • input, output, cached-input, reasoning-token 수를 별도 로깅 — 청구 출처를 정확히 파악; visible output만 로깅하면 reasoning 토큰 놓치기 쉬움.

최종 권장

Kimi K3 per-token 가격은 진짜 경쟁력 있고, reasoning-effort 트레이드오프를 이해하면 캐싱 스토리도 강합니다. 하지만 항상 켜진 thinking mode 때문에 "단순" 호출의 실효 비용은 헤드라인 가격보다 높고, reasoning을 완전히 끌 수 있던 Kimi K2.6보다도 높습니다. 고볼륨·지연 민감 워크로드에 K3를 확정하기 전에 실제 테스트 배치를 실행하고 reasoning 토큰 소비를 특별히 로깅 — 스티커 가격이 전부라고 가정하지 마세요.

K3 가격이 Claude와 직접 어떻게 비교되는지는 Kimi K3 vs Claude. 전체 모델 개요는 Kimi K3 완전 가이드에서 시작.

FAQ

Kimi K3 비용은 얼마인가요? 입력 백만 토큰당 $3, 출력 백만 토큰당 $15, 캐시된 입력 백만 토큰당 $0.30 — 캐시 히트 시 약 90% 할인.

비용 절감을 위해 Kimi K3 thinking mode를 끌 수 있나요? 아니요. Kimi K2.6과 달리 Kimi K3는 항상 thinking mode입니다. reasoning effort 티어(Standard, High, Max)만 조절 가능, reasoning 자체는 끌 수 없음.

Kimi K3 청구서가 예상보다 높은 이유는? 가장 흔한 원인은 reasoning 토큰 — K3는 모든 호출에서 reasoning_content 생성, 출력 토큰으로 $15/MTok 청구. 짧은 visible 답변 앞에 수천 reasoning 토큰. reasoning 토큰 수를 별도 로깅해 실제 breakdown 확인.

Reasoning effort 전환으로 돈을 아낄 수 있나요? 호출당 reasoning 토큰 양은 줄일 수 있지만, 세션 중간 effort 티어 전환은 컨텍스트 캐시 무효화, 전액 re-prefill. 동적 조정보다 세션당 티어 하나 선택.

Kimi K3는 무료로 사용할 수 있나요? 소비자 채팅 앱에 무료 티어(Adagio). API는 지속 프로덕션 무료 티어 없음 — 신규 계정 제한 trial 가능, 지속 사용은 유료.

Kimi K3 API 키는 어떻게 받나요? platform.kimi.ai 또는 platform.moonshot.ai 로그인, API keys 섹션에서 새 키 생성. 항상 켜진 reasoning 토큰 비용을 고려해 즉시 예산 상한 설정.

Kimi K3가 Claude보다 저렴한가요? Per-token 기준 예 — K3 $3/$15가 Claude Opus 4.8 $5/$25보다 저렴. Opus 4.8은 reasoning effort를 더 세밀히 제어 가능하므로 직접 비교는 실제 토큰 mix에 달림. 전체 가격 비교 참조.

관련 가이드

관련 가이드

지금 고민 중인 결정과 가장 잘 맞는 다음 가이드를 따라 Gemma 4 클러스터를 계속 탐색해 보세요.

Kimi K3 벤치마크: 실제로 어디에 서 있는가

Kimi K3 벤치마크: 실제로 어디에 서 있는가

Kimi K3는 출시 하루 만에 LMArena Frontend Code Arena 1위에 올라 Artificial Analysis Intelligence Index에서 Claude Opus 4.8을 제쳤습니다. 숫자가 실제로 무엇을 말하는지 — 그리고 전체 이야기를 말하지 못하는 곳 — 을 정리합니다.

다음에 무엇을 읽을지 아직 고민 중인가요?

가이드 허브로 돌아가 모델 비교, 설정 워크스루, 하드웨어 계획 페이지를 둘러보세요.