Hướng dẫn Gemma 4
Giá Kimi K3: Chi Phí API, Gói Đăng Ký và Cái Gì Thực Sự Miễn Phí

Giá Kimi K3: Chi Phí API, Gói Đăng Ký và Cái Gì Thực Sự Miễn Phí
Giá API headline của Kimi K3 — $3 mỗi triệu input token, $15 mỗi triệu output — trông cạnh tranh so với giá Claude và GPT-tier. Và đúng vậy. Nhưng K3 có một đặc tính thay đổi phép tính nhiều hơn giá token: thinking mode luôn bật và không thể tắt. Mọi lần gọi đều trả token reasoning, tính như output, dù bạn có muốn hay không. Bài hướng dẫn này bao phủ cấu trúc giá thực, chi phí token reasoning thực sự hiện trên hóa đơn thế nào, và các gói đăng ký người dùng — sản phẩm hoàn toàn tách biệt với API.

Câu trả lời nhanh
- Giá API: $3 / MTok input, $15 / MTok output, $0,30 / MTok cached input (giảm 90% khi cache hit).
- Base URL:
https://api.moonshot.ai/v1, tương thích OpenAI. Model ID:kimi-k3. - Lấy key tại:
platform.kimi.aihoặcplatform.moonshot.ai(cùng console cơ bản). - Không thể tắt thinking mode. K3 luôn suy luận trước khi trả lời, và các token reasoning đó tính như output token — kiểm thử độc lập đã ghi hơn 13.000 thinking token cho một tác vụ ngắn ở max reasoning effort.
- Reasoning effort có ba mức — Standard, High, Max — và chuyển giữa chúng giữa session vô hiệu hóa context cache, buộc re-prefill đắt.
- Caching tự động. Không cấu hình cache ID hay TTL thủ công; Moonshot báo cáo tỷ lệ cache hit trên 90% với workload coding.
- Cũng có trên OpenRouter với
moonshotai/kimi-k3, cùng giá $3/$15 mỗi triệu. - Gói đăng ký app người dùng (Adagio/Moderato/Allegretto/Allegro/Vivace, $0–$199/tháng) tính riêng với API và không bao gồm lần gọi API.
Cách lấy Kimi K3 API key
- Vào
platform.kimi.ai(hoặcplatform.moonshot.ai— hiện cả hai đều route tới cùng developer console) và đăng nhập hoặc tạo tài khoản. - Hoàn tất xác minh nếu được yêu cầu.
- Mở mục API keys và tạo key mới. Sao chép ngay — chỉ hiển thị một lần.
- Đặt budget cap và cảnh báo số dư thấp trước khi chạy bất cứ thứ gì ngoài vài lần gọi thử. Với token reasoning luôn bật, chi phí có thể leo nhanh hơn bạn kỳ vọng từ giá headline mỗi token.
Coi key như bí mật — biến môi trường hoặc secret manager, không commit vào source.
Giá chính thức Kimi K3
| Cached input | Input | Output | |
|---|---|---|---|
| Kimi K3 | $0,30 / MTok | $3,00 / MTok | $15,00 / MTok |
Đó là chênh 10 lần giữa cached và uncached input, và 5 lần giữa input và output. Cả hai hệ số quan trọng hơn với K3 so với đa số model, vì lý do sẽ nói tiếp.
Vì sao "thinking luôn bật" thay đổi hóa đơn
Đa số model cho bạn chọn có dùng token cho reasoning hiển thị hay không. Kimi K3 thì không — mọi phản hồi gồm reasoning_content sinh trước câu trả lời cuối, và Moonshot tính các token reasoning đó như output token, ở mức $15/MTok đầy đủ.
Thực tế, điều này có nghĩa:
- Câu trả lời thực tế ngắn có thể đắt hơn nhiều so với vẻ ngoài. Kiểm thử độc lập đã ghi hơn 13.000 thinking token cho tác vụ mà câu trả lời cuối chỉ vài câu. Ở $15/MTok, đó khoảng $0,20 chỉ riêng reasoning, trước khi sinh câu trả lời hiển thị.
- Bạn không thể opt out. Khác Kimi K2.6, cho phép tắt hoàn toàn thinking mode cho lần gọi nhạy độ trễ và chi phí, K3 không có chế độ "instant". Nếu workload volume cao và nhạy độ trễ hoặc chi phí — autocomplete, phân loại đơn giản, chat reply ngắn — sàn mỗi lần gọi của K3 cao hơn so với giá sticker gợi ý.
- Bạn kiểm soát được reasoning effort, không phải việc có reasoning hay không. K3 expose tham số
reasoning_effortvới ba mức — Standard, High và Max — thay đổi mức model suy luận, không phải có suy luận hay không.
Mức reasoning effort và bẫy cache
Ba mức effort (Standard / High / Max) cho phép đổi chi phí và độ trễ lấy chất lượng câu trả lời. Điểm bẫy: chuyển reasoning effort giữa session vô hiệu hóa context cache. Nếu bạn đã tích lũy context cached lớn — hội thoại dài, tài liệu lớn, lịch sử tool-call của agent — rồi chuyển từ Max sang High (hoặc ngược lại) giữa chừng, toàn bộ cache bị mất và lần gọi tiếp theo re-prefill ở giá uncached-input đầy đủ.
Quy tắc thực tế: chọn một mức reasoning effort cho mỗi workload và giữ cố định suốt session hoặc agent run. Đừng điều chỉnh effort động giữa hội thoại trừ khi bạn xác nhận chi phí vô hiệu hóa cache xứng đáng cho trường hợp cụ thể đó.
Caching thực sự hoạt động thế nào trên Kimi K3
Khác một số provider, bạn không quản lý cache thủ công — không có cache ID để tạo hay TTL để đặt. Nền tảng Moonshot (xây trên kiến trúc suy luận tách rời Mooncake) tự động cache prefix lặp lại và báo cáo tỷ lệ cache hit trên 90% với workload coding.
Để đạt tỷ lệ hit đó thực tế:
- Đặt nội dung ổn định — system prompt, định nghĩa tool, tài liệu tham chiếu dài — trước trong prompt.
- Đặt phần thay đổi mỗi lần gọi — tin nhắn mới nhất của user, kết quả tool mới nhất — sau.
- Giữ mức reasoning effort cố định trong session (xem trên).
- Tránh sắp xếp lại hoặc sửa nhẹ system prompt giữa các lần gọi; thay đổi nhỏ cũng có thể phá prefix match và gây cache miss.
Định dạng request tương thích OpenAI
API Kimi K3 khớp hình dạng request/response OpenAI Chat Completions, nên mọi OpenAI SDK hoạt động bằng cách đổi base URL và tên model.
curl
curl https://api.moonshot.ai/v1/chat/completions \
-H "Authorization: Bearer $MOONSHOT_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [
{"role": "user", "content": "Summarize the tradeoffs of hybrid linear attention in two sentences."}
]
}'
Python (OpenAI SDK)
from openai import OpenAI
client = OpenAI(
api_key="your-moonshot-api-key",
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "Write a Python function to debounce calls."}
],
)
print(response.choices[0].message.content)
Đặt reasoning effort
response = client.chat.completions.create(
model="kimi-k3",
messages=[...],
extra_body={"reasoning_effort": "standard"}, # "standard" | "high" | "max"
)
Nhớ: đổi giá trị này giữa các lần gọi trong cùng session sẽ vô hiệu hóa cache.
Dùng Kimi K3 trên OpenRouter
K3 cũng có trên OpenRouter với moonshotai/kimi-k3, cùng giá $3/$15 mỗi triệu như API trực tiếp. Đây là lựa chọn hợp lý nếu bạn đã route nhiều model provider qua OpenRouter và muốn thêm K3 mà không cần tài khoản Moonshot riêng — bạn cần tài khoản OpenRouter có nạp tiền và key từ dashboard OpenRouter.
Kimi K3 có miễn phí không?
Ba câu hỏi khác nhau, ba câu trả lời khác nhau:
Dùng app Kimi hoặc web chat cho người dùng. Có, gói miễn phí (Adagio) với giới hạn usage. Đó không phải API — không tiêu API credits và billing (hoặc không billing) tách biệt.
Dùng Kimi K3 API. Không có gói miễn phí production liên tục. Tài khoản mới có thể có trial giới hạn để test, nhưng usage bền vững cần tài khoản trả phí có nạp tiền.
Dùng Kimi K3 qua OpenRouter hoặc router tương tự. Billing hoàn toàn tách biệt, với hệ credit riêng. Không phải "Kimi API" dù vẫn tới cùng model.
Gói đăng ký người dùng
Sản phẩm tách biệt với API, bao phủ web app, mobile app, Kimi Code CLI, agent credits, Slides và công cụ khác:
| Gói | Giá/tháng | Bao gồm |
|---|---|---|
| Adagio | Miễn phí | Web/mobile chat, usage giới hạn |
| Moderato | $19 | Giới hạn usage cao hơn |
| Allegretto | $39 | Giới hạn usage cao hơn, thêm agent credits |
| Allegro | $99 | Usage nặng, mở rộng công cụ |
| Vivace | $199 | Gói cao nhất, agent credits tối đa |
Không gói nào bao gồm truy cập API — nếu bạn xây sản phẩm hoặc tích hợp, bạn cần tài khoản API trả phí riêng bất kể gói đăng ký cá nhân của bạn.
Chi phí phụ cần theo dõi
- Token reasoning mỗi lần gọi. Đã nói ở trên — đây là yếu tố bất ngờ lớn nhất đặc thù K3.
- Chuyển effort làm mất cache. Đổi
reasoning_effortgiữa session mất cache và re-prefill với giá đầy đủ. - Vòng lặp agent. Mỗi bước trong agent dùng tool thường gửi lại system prompt, tool schema và lịch sử đang chạy. Với token reasoning cộng thêm mỗi bước, agent run dài có thể tích lũy chi phí nhanh — giới hạn max steps và đặt timeout theo thời gian thực.
- Phí tool và search, nếu dùng công cụ tích hợp của Moonshot — kiểm tra trang giá công cụ hiện tại, vì chúng tính riêng khỏi token model và kết quả được thêm vào input của lần gọi tiếp theo.
Cách kiểm soát chi phí Kimi K3 API
- Đặt budget cap cứng và cảnh báo số dư thấp trong console trước khi scale vượt giai đoạn test.
- Chọn một mức reasoning effort cho mỗi workload và tránh đổi giữa session.
- Cấu trúc prompt cache-first: nội dung ổn định trước, nội dung biến động sau.
- Luôn truyền
max_tokens, đặc biệt trong vòng lặp agent nơi token reasoning có thể chạy dài. - Giới hạn vòng lặp agent bằng bộ đếm bước và timeout.
- Log input, output, cached-input và số token reasoning riêng để thấy chính xác hóa đơn đến từ đâu — token reasoning dễ bỏ sót nếu bạn chỉ log output hiển thị.
Khuyến nghị cuối
Giá mỗi token của Kimi K3 thực sự cạnh tranh, và câu chuyện caching mạnh khi bạn hiểu tradeoff reasoning-effort. Nhưng thinking mode luôn bật nghĩa là chi phí hiệu dụng của lần gọi "đơn giản" cao hơn giá headline gợi ý, và cao hơn Kimi K2.6, vốn cho phép tắt reasoning hoàn toàn. Trước khi cam kết K3 cho workload volume cao, nhạy độ trễ, hãy chạy batch test thực và log riêng mức tiêu thụ token reasoning — đừng giả định giá sticker là toàn bộ câu chuyện.
Để so sánh giá K3 trực tiếp với Claude, xem Kimi K3 vs Claude. Để tổng quan model đầy đủ, bắt đầu tại Giải thích Kimi K3.
FAQ
Kimi K3 giá bao nhiêu? $3 mỗi triệu input token, $15 mỗi triệu output token, và $0,30 mỗi triệu cho cached input hit — giảm khoảng 90% khi cache hit.
Có thể tắt thinking mode trên Kimi K3 để tiết kiệm không? Không. Khác Kimi K2.6, Kimi K3 luôn chạy ở thinking mode. Bạn chỉ có thể điều chỉnh mức reasoning effort (Standard, High, Max), không thể tắt reasoning hoàn toàn.
Vì sao hóa đơn Kimi K3 cao hơn kỳ vọng?
Nguyên nhân phổ biến nhất là token reasoning — K3 sinh reasoning_content mỗi lần gọi, tính như output token ở $15/MTok. Câu trả lời hiển thị ngắn có thể đi kèm hàng nghìn token reasoning. Log riêng số token reasoning để thấy phân tích thực.
Chuyển reasoning effort có tiết kiệm không? Có thể giảm volume token reasoning mỗi lần gọi, nhưng chuyển mức effort giữa session vô hiệu hóa context cache, buộc re-prefill với giá đầy đủ. Chọn một mức mỗi session thay vì điều chỉnh động.
Kimi K3 có miễn phí không? App chat người dùng có gói miễn phí (Adagio). API không có gói production miễn phí liên tục — tài khoản mới có thể có trial giới hạn, nhưng usage bền vững trả phí.
Làm sao lấy Kimi K3 API key?
Đăng nhập tại platform.kimi.ai hoặc platform.moonshot.ai, mở mục API keys và tạo key mới. Đặt budget cap ngay, vì chi phí token reasoning luôn bật.
Kimi K3 có rẻ hơn Claude không? Theo giá mỗi token, có — giá $3/$15 của K3 rẻ hơn Claude Opus 4.8 $5/$25. Nhưng Opus 4.8 cho kiểm soát reasoning effort chi tiết hơn, nên so sánh trực tiếp phụ thuộc mix token thực tế. Xem so sánh giá đầy đủ.
Hướng dẫn liên quan
Hướng dẫn liên quan
Tiếp tục khám phá cụm nội dung Gemma 4 với bài hướng dẫn tiếp theo phù hợp với quyết định hiện tại của bạn.

API Key và Bảng Giá Kimi K2.6: Chi Phí Chính Thức, Rate Limit và Phí Tìm Kiếm Web
Mức giá token chính thức của Kimi K2.6, ý nghĩa của cached input và uncached input, cách các tier rate limit thực sự hoạt động và những chi phí bổ sung như web search mà mọi người thường bỏ sót khi lập ngân sách.

Kimi K3: Giải Thích Mô Hình Open-Weight 2.8T Của Moonshot AI
Kimi K3 của Moonshot AI ra mắt ngày 16 tháng 7 năm 2026 với 2,8 nghìn tỷ tham số open-weight, vượt Claude Opus 4.8 trên nhiều benchmark. Đây là những gì nó thực sự là, còn thiếu gì và cách thử ngay hôm nay.

Benchmark Kimi K3: Thực Tế So Sánh Thế Nào
Kimi K3 đạt #1 trên LMArena Frontend Code Arena và vượt Claude Opus 4.8 trên Artificial Analysis Intelligence Index chỉ trong một ngày sau ra mắt. Đây là những gì các con số thực sự nói — và nơi chúng không kể hết câu chuyện.
Vẫn chưa biết nên đọc gì tiếp theo?
Quay lại trung tâm hướng dẫn để duyệt các bài so sánh model, hướng dẫn cài đặt và trang lập kế hoạch phần cứng.
