Hướng dẫn Gemma 4

Giá Kimi K3: Chi Phí API, Gói Đăng Ký và Cái Gì Thực Sự Miễn Phí

Đọc trong 9 phút
kimi k3kimi apiapi pricingllm pricingmoonshot ai
Giá Kimi K3: Chi Phí API, Gói Đăng Ký và Cái Gì Thực Sự Miễn Phí

Giá Kimi K3: Chi Phí API, Gói Đăng Ký và Cái Gì Thực Sự Miễn Phí

Giá API headline của Kimi K3 — $3 mỗi triệu input token, $15 mỗi triệu output — trông cạnh tranh so với giá Claude và GPT-tier. Và đúng vậy. Nhưng K3 có một đặc tính thay đổi phép tính nhiều hơn giá token: thinking mode luôn bật và không thể tắt. Mọi lần gọi đều trả token reasoning, tính như output, dù bạn có muốn hay không. Bài hướng dẫn này bao phủ cấu trúc giá thực, chi phí token reasoning thực sự hiện trên hóa đơn thế nào, và các gói đăng ký người dùng — sản phẩm hoàn toàn tách biệt với API.

Minh họa dashboard giá Kimi K3 với các mức chi phí token, đồng hồ cache-hit và tùy chọn reasoning-effort

Câu trả lời nhanh

  • Giá API: $3 / MTok input, $15 / MTok output, $0,30 / MTok cached input (giảm 90% khi cache hit).
  • Base URL: https://api.moonshot.ai/v1, tương thích OpenAI. Model ID: kimi-k3.
  • Lấy key tại: platform.kimi.ai hoặc platform.moonshot.ai (cùng console cơ bản).
  • Không thể tắt thinking mode. K3 luôn suy luận trước khi trả lời, và các token reasoning đó tính như output token — kiểm thử độc lập đã ghi hơn 13.000 thinking token cho một tác vụ ngắn ở max reasoning effort.
  • Reasoning effort có ba mức — Standard, High, Max — và chuyển giữa chúng giữa session vô hiệu hóa context cache, buộc re-prefill đắt.
  • Caching tự động. Không cấu hình cache ID hay TTL thủ công; Moonshot báo cáo tỷ lệ cache hit trên 90% với workload coding.
  • Cũng có trên OpenRouter với moonshotai/kimi-k3, cùng giá $3/$15 mỗi triệu.
  • Gói đăng ký app người dùng (Adagio/Moderato/Allegretto/Allegro/Vivace, $0–$199/tháng) tính riêng với API và không bao gồm lần gọi API.

Cách lấy Kimi K3 API key

  1. Vào platform.kimi.ai (hoặc platform.moonshot.ai — hiện cả hai đều route tới cùng developer console) và đăng nhập hoặc tạo tài khoản.
  2. Hoàn tất xác minh nếu được yêu cầu.
  3. Mở mục API keys và tạo key mới. Sao chép ngay — chỉ hiển thị một lần.
  4. Đặt budget cap và cảnh báo số dư thấp trước khi chạy bất cứ thứ gì ngoài vài lần gọi thử. Với token reasoning luôn bật, chi phí có thể leo nhanh hơn bạn kỳ vọng từ giá headline mỗi token.

Coi key như bí mật — biến môi trường hoặc secret manager, không commit vào source.

Giá chính thức Kimi K3

Cached input Input Output
Kimi K3 $0,30 / MTok $3,00 / MTok $15,00 / MTok

Đó là chênh 10 lần giữa cached và uncached input, và 5 lần giữa input và output. Cả hai hệ số quan trọng hơn với K3 so với đa số model, vì lý do sẽ nói tiếp.

Vì sao "thinking luôn bật" thay đổi hóa đơn

Đa số model cho bạn chọn có dùng token cho reasoning hiển thị hay không. Kimi K3 thì không — mọi phản hồi gồm reasoning_content sinh trước câu trả lời cuối, và Moonshot tính các token reasoning đó như output token, ở mức $15/MTok đầy đủ.

Thực tế, điều này có nghĩa:

  • Câu trả lời thực tế ngắn có thể đắt hơn nhiều so với vẻ ngoài. Kiểm thử độc lập đã ghi hơn 13.000 thinking token cho tác vụ mà câu trả lời cuối chỉ vài câu. Ở $15/MTok, đó khoảng $0,20 chỉ riêng reasoning, trước khi sinh câu trả lời hiển thị.
  • Bạn không thể opt out. Khác Kimi K2.6, cho phép tắt hoàn toàn thinking mode cho lần gọi nhạy độ trễ và chi phí, K3 không có chế độ "instant". Nếu workload volume cao và nhạy độ trễ hoặc chi phí — autocomplete, phân loại đơn giản, chat reply ngắn — sàn mỗi lần gọi của K3 cao hơn so với giá sticker gợi ý.
  • Bạn kiểm soát được reasoning effort, không phải việc có reasoning hay không. K3 expose tham số reasoning_effort với ba mức — Standard, HighMax — thay đổi mức model suy luận, không phải có suy luận hay không.

Mức reasoning effort và bẫy cache

Ba mức effort (Standard / High / Max) cho phép đổi chi phí và độ trễ lấy chất lượng câu trả lời. Điểm bẫy: chuyển reasoning effort giữa session vô hiệu hóa context cache. Nếu bạn đã tích lũy context cached lớn — hội thoại dài, tài liệu lớn, lịch sử tool-call của agent — rồi chuyển từ Max sang High (hoặc ngược lại) giữa chừng, toàn bộ cache bị mất và lần gọi tiếp theo re-prefill ở giá uncached-input đầy đủ.

Quy tắc thực tế: chọn một mức reasoning effort cho mỗi workload và giữ cố định suốt session hoặc agent run. Đừng điều chỉnh effort động giữa hội thoại trừ khi bạn xác nhận chi phí vô hiệu hóa cache xứng đáng cho trường hợp cụ thể đó.

Caching thực sự hoạt động thế nào trên Kimi K3

Khác một số provider, bạn không quản lý cache thủ công — không có cache ID để tạo hay TTL để đặt. Nền tảng Moonshot (xây trên kiến trúc suy luận tách rời Mooncake) tự động cache prefix lặp lại và báo cáo tỷ lệ cache hit trên 90% với workload coding.

Để đạt tỷ lệ hit đó thực tế:

  • Đặt nội dung ổn định — system prompt, định nghĩa tool, tài liệu tham chiếu dài — trước trong prompt.
  • Đặt phần thay đổi mỗi lần gọi — tin nhắn mới nhất của user, kết quả tool mới nhất — sau.
  • Giữ mức reasoning effort cố định trong session (xem trên).
  • Tránh sắp xếp lại hoặc sửa nhẹ system prompt giữa các lần gọi; thay đổi nhỏ cũng có thể phá prefix match và gây cache miss.

Định dạng request tương thích OpenAI

API Kimi K3 khớp hình dạng request/response OpenAI Chat Completions, nên mọi OpenAI SDK hoạt động bằng cách đổi base URL và tên model.

curl

curl https://api.moonshot.ai/v1/chat/completions \
  -H "Authorization: Bearer $MOONSHOT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {"role": "user", "content": "Summarize the tradeoffs of hybrid linear attention in two sentences."}
    ]
  }'

Python (OpenAI SDK)

from openai import OpenAI

client = OpenAI(
    api_key="your-moonshot-api-key",
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "user", "content": "Write a Python function to debounce calls."}
    ],
)
print(response.choices[0].message.content)

Đặt reasoning effort

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[...],
    extra_body={"reasoning_effort": "standard"},  # "standard" | "high" | "max"
)

Nhớ: đổi giá trị này giữa các lần gọi trong cùng session sẽ vô hiệu hóa cache.

Dùng Kimi K3 trên OpenRouter

K3 cũng có trên OpenRouter với moonshotai/kimi-k3, cùng giá $3/$15 mỗi triệu như API trực tiếp. Đây là lựa chọn hợp lý nếu bạn đã route nhiều model provider qua OpenRouter và muốn thêm K3 mà không cần tài khoản Moonshot riêng — bạn cần tài khoản OpenRouter có nạp tiền và key từ dashboard OpenRouter.

Kimi K3 có miễn phí không?

Ba câu hỏi khác nhau, ba câu trả lời khác nhau:

Dùng app Kimi hoặc web chat cho người dùng. Có, gói miễn phí (Adagio) với giới hạn usage. Đó không phải API — không tiêu API credits và billing (hoặc không billing) tách biệt.

Dùng Kimi K3 API. Không có gói miễn phí production liên tục. Tài khoản mới có thể có trial giới hạn để test, nhưng usage bền vững cần tài khoản trả phí có nạp tiền.

Dùng Kimi K3 qua OpenRouter hoặc router tương tự. Billing hoàn toàn tách biệt, với hệ credit riêng. Không phải "Kimi API" dù vẫn tới cùng model.

Gói đăng ký người dùng

Sản phẩm tách biệt với API, bao phủ web app, mobile app, Kimi Code CLI, agent credits, Slides và công cụ khác:

Gói Giá/tháng Bao gồm
Adagio Miễn phí Web/mobile chat, usage giới hạn
Moderato $19 Giới hạn usage cao hơn
Allegretto $39 Giới hạn usage cao hơn, thêm agent credits
Allegro $99 Usage nặng, mở rộng công cụ
Vivace $199 Gói cao nhất, agent credits tối đa

Không gói nào bao gồm truy cập API — nếu bạn xây sản phẩm hoặc tích hợp, bạn cần tài khoản API trả phí riêng bất kể gói đăng ký cá nhân của bạn.

Chi phí phụ cần theo dõi

  • Token reasoning mỗi lần gọi. Đã nói ở trên — đây là yếu tố bất ngờ lớn nhất đặc thù K3.
  • Chuyển effort làm mất cache. Đổi reasoning_effort giữa session mất cache và re-prefill với giá đầy đủ.
  • Vòng lặp agent. Mỗi bước trong agent dùng tool thường gửi lại system prompt, tool schema và lịch sử đang chạy. Với token reasoning cộng thêm mỗi bước, agent run dài có thể tích lũy chi phí nhanh — giới hạn max steps và đặt timeout theo thời gian thực.
  • Phí tool và search, nếu dùng công cụ tích hợp của Moonshot — kiểm tra trang giá công cụ hiện tại, vì chúng tính riêng khỏi token model và kết quả được thêm vào input của lần gọi tiếp theo.

Cách kiểm soát chi phí Kimi K3 API

  • Đặt budget cap cứng và cảnh báo số dư thấp trong console trước khi scale vượt giai đoạn test.
  • Chọn một mức reasoning effort cho mỗi workload và tránh đổi giữa session.
  • Cấu trúc prompt cache-first: nội dung ổn định trước, nội dung biến động sau.
  • Luôn truyền max_tokens, đặc biệt trong vòng lặp agent nơi token reasoning có thể chạy dài.
  • Giới hạn vòng lặp agent bằng bộ đếm bước và timeout.
  • Log input, output, cached-input và số token reasoning riêng để thấy chính xác hóa đơn đến từ đâu — token reasoning dễ bỏ sót nếu bạn chỉ log output hiển thị.

Khuyến nghị cuối

Giá mỗi token của Kimi K3 thực sự cạnh tranh, và câu chuyện caching mạnh khi bạn hiểu tradeoff reasoning-effort. Nhưng thinking mode luôn bật nghĩa là chi phí hiệu dụng của lần gọi "đơn giản" cao hơn giá headline gợi ý, và cao hơn Kimi K2.6, vốn cho phép tắt reasoning hoàn toàn. Trước khi cam kết K3 cho workload volume cao, nhạy độ trễ, hãy chạy batch test thực và log riêng mức tiêu thụ token reasoning — đừng giả định giá sticker là toàn bộ câu chuyện.

Để so sánh giá K3 trực tiếp với Claude, xem Kimi K3 vs Claude. Để tổng quan model đầy đủ, bắt đầu tại Giải thích Kimi K3.

FAQ

Kimi K3 giá bao nhiêu? $3 mỗi triệu input token, $15 mỗi triệu output token, và $0,30 mỗi triệu cho cached input hit — giảm khoảng 90% khi cache hit.

Có thể tắt thinking mode trên Kimi K3 để tiết kiệm không? Không. Khác Kimi K2.6, Kimi K3 luôn chạy ở thinking mode. Bạn chỉ có thể điều chỉnh mức reasoning effort (Standard, High, Max), không thể tắt reasoning hoàn toàn.

Vì sao hóa đơn Kimi K3 cao hơn kỳ vọng? Nguyên nhân phổ biến nhất là token reasoning — K3 sinh reasoning_content mỗi lần gọi, tính như output token ở $15/MTok. Câu trả lời hiển thị ngắn có thể đi kèm hàng nghìn token reasoning. Log riêng số token reasoning để thấy phân tích thực.

Chuyển reasoning effort có tiết kiệm không? Có thể giảm volume token reasoning mỗi lần gọi, nhưng chuyển mức effort giữa session vô hiệu hóa context cache, buộc re-prefill với giá đầy đủ. Chọn một mức mỗi session thay vì điều chỉnh động.

Kimi K3 có miễn phí không? App chat người dùng có gói miễn phí (Adagio). API không có gói production miễn phí liên tục — tài khoản mới có thể có trial giới hạn, nhưng usage bền vững trả phí.

Làm sao lấy Kimi K3 API key? Đăng nhập tại platform.kimi.ai hoặc platform.moonshot.ai, mở mục API keys và tạo key mới. Đặt budget cap ngay, vì chi phí token reasoning luôn bật.

Kimi K3 có rẻ hơn Claude không? Theo giá mỗi token, có — giá $3/$15 của K3 rẻ hơn Claude Opus 4.8 $5/$25. Nhưng Opus 4.8 cho kiểm soát reasoning effort chi tiết hơn, nên so sánh trực tiếp phụ thuộc mix token thực tế. Xem so sánh giá đầy đủ.

Hướng dẫn liên quan

Hướng dẫn liên quan

Tiếp tục khám phá cụm nội dung Gemma 4 với bài hướng dẫn tiếp theo phù hợp với quyết định hiện tại của bạn.

Vẫn chưa biết nên đọc gì tiếp theo?

Quay lại trung tâm hướng dẫn để duyệt các bài so sánh model, hướng dẫn cài đặt và trang lập kế hoạch phần cứng.