Hướng dẫn Gemma 4
API Key và Bảng Giá Kimi K2.6: Chi Phí Chính Thức, Rate Limit và Phí Tìm Kiếm Web

Cập nhật ngày 14 tháng 6 năm 2026: Kimi hiện đã có K2.7 Code là mô hình coding mới hơn. Giá toàn cầu: K2.6 $0.16 cache hit / $0.95 input / $4.00 output mỗi MTok; K2.7 Code $0.19 / $0.95 / $4.00. Hãy kiểm tra billing theo khu vực, rate limit và giá công cụ trong console trực tiếp.
API Key và Bảng Giá Kimi K2.6: Chi Phí Chính Thức, Rate Limit và Phí Tìm Kiếm Web
Nếu bạn sắp đăng ký API key Kimi để chạy K2.6, thì giá token chỉ là một phần của bức tranh. Caching, các tier rate limit, phí web search và những lần retry kiểu agent đều âm thầm định hình hóa đơn hàng tháng của bạn. Bài hướng dẫn này sẽ đi lần lượt từng phần, dùng đúng các con số Moonshot hiện công bố trên các trang nền tảng của họ.

Câu trả lời nhanh
- Kimi K2.6 dùng API tương thích OpenAI của Moonshot tại
https://api.moonshot.ai/v1— mọi OpenAI SDK đều có thể dùng như client thay thế trực tiếp. - Mức giá chính thức của K2.6 trên trang nền tảng Moonshot:
- Input được cache: $0.16 / 1M tokens
- Input không được cache: $0.95 / 1M tokens
- Output: $4.00 / 1M tokens
- Cửa sổ ngữ cảnh: 262,144 tokens
- Bạn lấy API key bằng cách đăng ký tại
platform.moonshot.airồi tạo khóa trong console. - Tính năng web search tích hợp được tính giá công cụ hiện tại cho mỗi lần gọi, cộng thêm số token mà kết quả tìm kiếm tiêu thụ ở request
/chat/completionskế tiếp. - Tier miễn phí (Tier 0) cho phép giới hạn hiện tại trong console, 1 request đồng thời và có trần token theo ngày. Muốn dùng nặng hơn, bạn cần nạp tiền để lên tier cao hơn.
Phần bên dưới sẽ bóc tách các con số này và những “bãi mìn” đi kèm.
Cách tạo API key Kimi
Quy trình gần giống hầu hết nhà cung cấp LLM:
- Truy cập
platform.moonshot.aivà đăng nhập hoặc đăng ký. - Xác minh tài khoản nếu được yêu cầu.
- Mở mục API keys trong console và bấm Create API key.
- Sao chép khóa ngay lập tức — nó chỉ hiện đúng một lần.
- Tùy chọn nhưng rất nên làm: đặt mức trần ngân sách và cảnh báo số dư thấp trước khi chạy bất kỳ workload nào.
Hãy xem API key như mật khẩu: lưu vào biến môi trường hoặc secret manager, không lưu trong source code. Nếu bị lộ, hãy rotate khóa ngay từ cùng trang console đó.
Một điều đáng lưu ý với tài khoản mới: Moonshot áp dụng rate limit theo tier và các tier này tăng theo tổng số tiền bạn đã nạp lũy kế. Một tài khoản mới tinh bắt đầu ở Tier 0 với giới hạn rất chặt — ổn cho vài request test, không ổn cho coding agent chạy liên tục. Hãy xem phần rate limit bên dưới trước khi bắt đầu benchmark.
Giá chính thức của Kimi K2.6
Các con số hiện được công bố trên trang giá toàn cầu của Kimi:
| Mô hình | Cache hit | Input | Output | Ghi chú |
|---|---|---|---|---|
| Kimi K2.6 | $0.16 / MTok | $0.95 / MTok | $4.00 / MTok | Giá K2.6 chung do Kimi hiển thị |
| Kimi K2.7 Code | $0.19 / MTok | $0.95 / MTok | $4.00 / MTok | Tùy chọn mới hơn tập trung vào coding |
Có hai điểm cần chú ý. Thứ nhất, nền tảng global của Kimi hiện hiển thị giá bằng USD trên mỗi triệu token (MTok); nếu tài khoản của bạn dùng console China/RMB, hãy kiểm tra trang billing địa phương trước khi trích dẫn chi phí. Thứ hai, cache-hit input rẻ hơn đáng kể so với input thường. Dòng này quyết định phần lớn kinh tế của workload long-context và agent.
"Cached input" và "uncached input" nghĩa là gì
Moonshot, giống phần lớn các nhà cung cấp frontier khác, triển khai context caching: khi một phần prompt của bạn đã được nhìn thấy gần đây, server bỏ qua việc tính lại prefix đó và tính phí token thấp hơn rất nhiều.
Cụ thể:
- Cache hit (cached input) — một prefix bạn đã gửi trước đó (system prompt, các lượt hội thoại trước, ngữ cảnh tài liệu dài) khớp với phần đang được cache ở phía server. Bạn trả mức giá cached.
- Cache miss (uncached input) — nội dung prompt mới, thứ tự khác đi hoặc một prefix đã hết hạn trong cache. Bạn trả mức giá uncached đầy đủ.
Tại sao điều này quan trọng trong workflow thực tế:
- RAG với ngữ cảnh dài — nếu bạn nhét 100K tokens tri thức vào system prompt và tái sử dụng qua nhiều request, caching biến hóa đơn nặng thành hóa đơn dễ chịu hơn rất nhiều.
- Agent loop — mỗi bước của agent dùng công cụ thường gửi lại system prompt, schema công cụ và toàn bộ cuộc hội thoại đang diễn ra. Nếu không có cache, mỗi bước đều trả giá uncached. Có cache, chỉ phần kết quả công cụ mới thêm vào và câu trả lời mới của assistant mới bị tính giá cao.
- Prompt giống nhau cho nhiều người dùng — nếu hai người dùng đi qua cùng một system prompt, người thứ hai sẽ hưởng lợi từ cache.
Hệ quả thực tế là: hãy thiết kế prompt sao cho các phần ổn định và tái sử dụng được (hướng dẫn, tài liệu dài, định nghĩa công cụ) nằm ở đầu, còn phần thay đổi theo người dùng nằm ở cuối. Cách này tối đa hóa tỉ lệ cache hit và có thể giảm chi phí input xuống năm lần hoặc hơn.
Định dạng request tương thích OpenAI
API của Moonshot tương thích OpenAI, nghĩa là mọi OpenAI SDK đều dùng được nếu đổi base URL và API key.
curl
curl https://api.moonshot.ai/v1/chat/completions \
-H "Authorization: Bearer $MOONSHOT_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.6",
"messages": [
{"role": "user", "content": "Explain caching in one paragraph."}
]
}'
Python (OpenAI SDK)
from openai import OpenAI
client = OpenAI(
api_key="your-moonshot-api-key",
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k2.6",
messages=[
{"role": "user", "content": "Write a Python function to debounce calls."}
],
)
print(response.choices[0].message.content)
Chế độ Thinking và Instant
K2.6 mặc định chạy ở chế độ Thinking. Nếu muốn ép sang Instant và không sinh reasoning tokens, hãy truyền:
response = client.chat.completions.create(
model="kimi-k2.6",
messages=[...],
extra_body={"thinking": {"type": "disabled"}},
)
Ở chế độ Thinking, reasoning tokens được tính vào output và bị tính phí như output. Nếu bạn không cần, tắt nó là cách tiết kiệm rất hiệu quả.
Input đa phương thức
K2.6 là mô hình đa phương thức gốc — hỗ trợ input dạng văn bản, hình ảnh và video. Ảnh hoạt động trực tiếp qua phần image_url tiêu chuẩn của OpenAI. Video được hỗ trợ trên API chính thức, nhưng Moonshot đánh dấu là experimental trên các triển khai bên thứ ba, vì vậy hãy test end-to-end nếu sản phẩm của bạn phụ thuộc vào nó.
Rate limit và các tier tài khoản
Moonshot áp dụng rate limit theo tier cho từng tài khoản. Mức cụ thể phụ thuộc vào trạng thái tài khoản, lịch sử nạp tiền và chính sách nền tảng hiện tại, nên các con số có thể thay đổi theo thời gian.
Hãy kiểm tra trang limits trong console trước khi sizing workload. Một vài nguyên tắc:
- Tier miễn phí hoặc entry phù hợp để kiểm thử. Bạn có thể dựng tích hợp, chạy vài request thử và xác nhận SDK OpenAI hoạt động.
- Giới hạn entry không đủ cho coding agent. Một agent loop thật cần đủ RPM, concurrency và token throughput để không liên tục backoff.
- Mở throughput đủ sớm. Với workload thật, cách rẻ nhất thường là dùng tier mà benchmark cần, thay vì tối ưu quanh giới hạn nhỏ nhất.
Các chi phí bổ sung mọi người hay bỏ sót
Bảng giá theo token không kể hết câu chuyện. Có ba nhóm chi phí âm thầm xuất hiện trong môi trường production.
Web search tích hợp. Moonshot cung cấp công cụ $web_search mà model có thể gọi trong lúc sinh nội dung. Mỗi lần gọi bị tính giá công cụ hiện tại. Nghe có vẻ nhỏ, nhưng nội dung kết quả tìm kiếm sau đó được đưa vào request /chat/completions tiếp theo như input bổ sung — và những token đó bị tính theo giá input bình thường. Một agent hay “lắm lời” mà tìm kiếm mười lần trong một lượt người dùng sẽ phải trả mười lần phí search và mười khối token input từ kết quả.
Reasoning tokens. Ở chế độ Thinking, model tạo ra reasoning tokens nội bộ và chúng được tính như output. Với câu hỏi đơn giản thì không sao. Nhưng với agent gọi công cụ liên tục, reasoning tích lũy qua 50 lượt tool call rất dễ trở thành khoản lớn nhất trên hóa đơn. Nếu tác vụ không cần, hãy tắt đi.
Retry của agent và vòng lặp kéo dài. Tài liệu của Moonshot nhấn mạnh K2.6 có thể thực hiện hơn 4,000 tool calls trong 12 giờ. Đó là năng lực ấn tượng — và cũng là một hóa đơn rất thật. Demo agent dài hơi rất hữu ích, nhưng cũng là cách nhanh nhất để đốt một khoản ngân sách lớn mà không nhận ra. Luôn đặt giới hạn số bước và số token tối đa khi chạy workflow agent.
Mẫu cache miss. Đổi thứ tự prompt, thay system message liên tục hoặc phục vụ quá nhiều người dùng với ngữ cảnh hoàn toàn khác nhau sẽ làm giảm tỉ lệ cache hit. Nếu bạn thấy chi phí “input” lớn hơn mong đợi, lý do thường nằm ở đây.
Kimi K2.6 có miễn phí không?
Có ba cách hiểu khác nhau về “miễn phí”, và mỗi cách có câu trả lời khác nhau:
Dùng Kimi trên trình duyệt tại kimi.com. Các sản phẩm consumer của Moonshot thường có tier miễn phí với hạn mức dùng theo ngày. Đó không phải API — các cuộc trò chuyện ở đó không tiêu tốn credit API.
Dùng API Kimi K2.6 mà không trả tiền. Tier 0 miễn phí cho phép bạn thực hiện một số lượng nhỏ request mà không cần nạp tiền. Đủ để test tích hợp, không đủ cho workload duy trì liên tục. Vượt Tier 0 thì API sẽ có phí.
Dùng Kimi K2.6 qua Ollama Cloud, OpenRouter hoặc dịch vụ tương tự. Đây là các hệ thống tính tiền riêng, có credit miễn phí và bảng giá riêng. Chúng không phải là “Kimi API chính thức” dù cùng trỏ tới một model.
Nói ngắn gọn: có cách miễn phí để thử, nhưng không có cách miễn phí để chạy workload production trên K2.6 qua API chính thức.
Cách kiểm soát chi phí API Kimi
Checklist ngắn trước khi scale:
- Đặt mức trần ngân sách cứng trong console.
- Bật cảnh báo số dư thấp để phát hiện chi tiêu bất ngờ sớm.
- Luôn truyền
max_tokenscho output, đặc biệt trong agent loop. - Đặt ngữ cảnh ổn định ở trước, nội dung thay đổi theo người dùng ở sau.
- Tắt chế độ Thinking cho các tác vụ không cần nó.
- Chỉ bật
$web_searchkhi thật sự cần, đừng để prompt nào cũng gọi. - Giới hạn agent loop bằng bộ đếm bước tối đa và timeout theo thời gian thực.
- Log số token input, output và cached input theo từng request để biết chi phí thực sự nằm ở đâu.
Khuyến nghị cuối cùng
Nếu bạn đang đánh giá Kimi cho coding agent hoặc workflow long-context, cấu trúc chi phí có thể dùng được nhưng không tự động rẻ. Giá token chính khá cạnh tranh và cache-hit hữu ích, nhưng chỉ khi prompt của bạn được thiết kế để thật sự hit cache. Với coding-agent mới, hãy so sánh K2.6 với K2.7 Code thay vì mặc định mô hình cũ vẫn là lựa chọn tốt nhất.
Với đa số team, điểm bắt đầu hợp lý là: dựng tích hợp, đo cache-hit rate và phân bổ token thực tế trong production, kiểm tra rate limit hiện tại của tài khoản, rồi mới quyết định K2.6, K2.7 Code hay mô hình khác có cost-per-task phù hợp nhất.
FAQ
Làm sao lấy API key Kimi?
Đăng nhập platform.moonshot.ai, mở phần API keys và tạo key mới. Hãy copy ngay vì key chỉ hiện một lần. Nên đặt budget cap cùng lúc.
Kimi K2.6 giá bao nhiêu? Trên trang giá global, K2.6 được liệt kê với cache hit $0.16 / MTok, input $0.95 / MTok và output $4.00 / MTok. K2.7 Code được liệt kê với cache hit $0.19 / MTok, input $0.95 / MTok và output $4.00 / MTok. Nếu tài khoản của bạn billing bằng RMB, hãy kiểm tra console địa phương.
Kimi K2.6 có miễn phí không? Sản phẩm consumer tại kimi.com có thể có free tier riêng, tách khỏi billing API. Tài khoản API cũng có thể có quyền dùng entry hoặc khuyến mãi, nhưng workload production nên được tính như usage trả phí.
Kimi API có hỗ trợ OpenAI SDK không?
Có. Kimi API tương thích OpenAI. Trỏ SDK OpenAI đến https://api.moonshot.ai/v1, dùng key Moonshot và đặt model là kimi-k2.6.
Rate limit của API Kimi là gì? Limit theo tier và có thể thay đổi theo trạng thái tài khoản, lịch sử nạp tiền và chính sách nền tảng hiện tại. Khi sizing production, hãy dùng trang limits trong live console thay vì copy một bảng RPM cũ.
Web search của Kimi giá bao nhiêu? Hãy kiểm tra trang tools pricing hiện tại. Web search hoặc các tool tương tự có thể được tính riêng với model tokens, và nội dung trả về cũng có thể làm tăng input-token bill của request tiếp theo.
Có thể dùng Kimi K2.6 với tools và function calling không?
Có. K2.6 hỗ trợ tool use và function calling theo phong cách OpenAI. Theo tài liệu Moonshot, khi bật Thinking mode, tool_choice nên là auto hoặc none, và bạn cần giữ reasoning_content của assistant qua các turn gọi tool.
Hướng dẫn liên quan
Tiếp tục khám phá cụm nội dung Gemma 4 với bài hướng dẫn tiếp theo phù hợp với quyết định hiện tại của bạn.

Giá Kimi K3: Chi Phí API, Gói Đăng Ký và Cái Gì Thực Sự Miễn Phí
API Kimi K3 là $3 mỗi triệu input token và $15 mỗi triệu output — nhưng thinking mode luôn bật nghĩa là bạn trả token reasoning trên mọi lần gọi. Đây là chi phí thực tế.

Đánh Giá Kimi K2.6: Benchmark, Giá, API và Có Đáng Dùng Không
Kimi K2.6 ra mắt ngày 20 tháng 4 năm 2026 như một model open-weight cho agentic coding với context 256K, hỗ trợ ảnh và video gốc, cùng một câu chuyện agent swarm rất mạnh. Bài này tách phần thực chất ra khỏi phần marketing.

Vì Sao Kimi K3 Hết Chỗ? Giải Thích Pause Capacity GPU
Kimi K3 không bị ngừng hay thực sự "hết hàng" — Moonshot pause đăng ký mới sau khi nhu cầu chạm trần GPU trong 48 giờ sau ra mắt. Đây là ý nghĩa nếu bạn đang cố truy cập ngay.
Vẫn chưa biết nên đọc gì tiếp theo?
Quay lại trung tâm hướng dẫn để duyệt các bài so sánh model, hướng dẫn cài đặt và trang lập kế hoạch phần cứng.
