Hướng dẫn Gemma 4

Kimi K3: Giải Thích Mô Hình Open-Weight 2.8T Của Moonshot AI

Đọc trong 9 phút
kimi k3moonshot aiopen source llmllm comparisonagentic ai
Kimi K3: Giải Thích Mô Hình Open-Weight 2.8T Của Moonshot AI

Kimi K3: Giải Thích Mô Hình Open-Weight 2.8T Của Moonshot AI

Moonshot AI phát hành Kimi K3 vào ngày 16 tháng 7 năm 2026, và chỉ trong một ngày, nó đã leo lên vị trí số 1 trên LMArena Frontend Code Arena, vượt qua Claude Fable 5, đồng thời ghi điểm Artificial Analysis Intelligence Index cao hơn Claude Opus 4.8. Với 2,8 nghìn tỷ tham số, nó được mô tả là mô hình open-weight lớn nhất từng được phát hành — từ một công ty mà chỉ ba năm trước vẫn còn là startup Bắc Kinh mà ít người bên ngoài Trung Quốc biết đến.

Bài hướng dẫn này giải thích Kimi K3 thực sự là gì, điều gì đã được xác nhận so với còn đang chờ (weights công khai chưa thể tải xuống), và nơi tìm các con số quan trọng cho một đánh giá thực tế.

Minh họa tổng quan Kimi K3 với hub model trung tâm kết nối biểu đồ benchmark, console API và bảng so sánh với Claude

Câu trả lời nhanh

  • Ra mắt: 16 tháng 7 năm 2026, bởi Moonshot AI (do CEO Yang Zhilin sáng lập).
  • Quy mô: 2,8 nghìn tỷ tham số tổng — mô hình open-weight lớn nhất từng phát hành cho tới nay.
  • Kiến trúc: Mixture-of-Experts dùng framework Stable LatentMoE của Moonshot (16 trong 896 experts hoạt động mỗi token), xây trên hai đổi mới nội bộ: Kimi Delta Attention (cơ chế hybrid linear attention) và Attention Residuals (thay thế drop-in cho residual connection tiêu chuẩn).
  • Context window: 1.048.576 token (~1M), với hiểu biết hình ảnh gốc và chế độ "thinking mode" luôn bật.
  • Open weights: Công bố là open-weight theo giấy phép kiểu Modified MIT, nhưng weights tải xuống chưa có tại thời điểm ra mắt — Moonshot cam kết công bố trước 27 tháng 7 năm 2026. Cho tới lúc đó, "open source" mô tả kế hoạch, không phải thứ bạn có thể tải về.
  • Truy cập hôm nay: API riêng của Moonshot (platform.kimi.ai), OpenRouter (moonshotai/kimi-k3), và ứng dụng/web chat Kimi cho người dùng. Self-hosting trên Hugging Face chưa khả dụng.
  • So với Claude: Vượt Claude Opus 4.8 trên Artificial Analysis Intelligence Index và nhiều benchmark agentic/coding; thua Claude Fable 5 mới hơn trên đa số benchmark nhưng thắng ở agentic coding dài hạn và rẻ hơn rất nhiều.

Kimi K3 thực sự là gì

Kimi K3 là flagship mới nhất của Moonshot AI, được định vị như hệ thống frontier open-weight cạnh tranh trực diện với các phòng lab closed-source lớn nhất về agentic coding, tool use và reasoning tổng quát — đồng thời công bố (hoặc hiện tại là hứa công bố) weights.

Khung định vị quan trọng: đây không phải bản nâng cấp điểm nhỏ. Moonshot nhảy thẳng lên mô hình 2.8T tham số, hơn gấp đôi tiền nhiệm Kimi K2.6 (~1T tham số), và ghép với kiến trúc mới thay vì chỉ scale thêm trên công thức cũ. Phản ứng thị trường diễn ra ngay — các bài viết liên kết bản phát hành với đợt bán tháo cổ phiếu chip AI rộng hơn, với logic rằng một model vừa mạnh, vừa rẻ, vừa mở công khai thay đổi cách tính toán compute mà phần còn lại của ngành cần mua.

Kiến trúc và thông số

Hai kỹ thuật đảm nhận phần lớn công việc bên dưới, và cả hai đều từng được Moonshot công bố dưới dạng nghiên cứu mở trước khi xuất hiện trong model thương mại:

  • Kimi Delta Attention — cơ chế hybrid linear attention thiết kế để giữ suy luận long-context nhanh mà không gặp bùng nổ bậc hai thông thường của standard attention.
  • Attention Residuals — thay thế drop-in cho residual connection thông thường mà Moonshot cho biết mang lại cải thiện ổn định hơn khi model scale.
  • Stable LatentMoE — framework routing phía sau lớp mixture-of-experts. Trong 896 experts tổng, 16 hoạt động mỗi token, đó là cách một model 2.8T tham số vẫn khả thi về compute thay vì cần compute tương đương 2.8T tham số cho mỗi forward pass.

Bên cạnh kiến trúc, K3 có:

  • Context window 1.048.576 token (~1M token) bao gồm cả input và output.
  • Hiểu biết hình ảnh gốc — input ảnh được tích hợp sẵn, không phải gắn thêm.
  • Chế độ reasoning luôn bật ("thinking mode") thay vì toggle bạn phải nhớ bật.

Moonshot cho biết báo cáo kỹ thuật đầy đủ với chi tiết huấn luyện và đánh giá sẽ đi kèm khi phát hành weights công khai. Cho tới lúc đó, hãy coi các chi tiết kiến trúc ngoài phần tóm tắt ở đây là tạm thời.

Kimi K3 có phải open source không?

Đây là câu hỏi được tìm kiếm nhiều nhất về K3, và câu trả lời thành thật có hai phần:

Kế hoạch là open-weight. Moonshot tuyên bố K3 sẽ phát hành theo giấy phép kiểu Modified MIT, theo cùng hướng với Kimi K2.6 (permissive cho đa số người dùng, với điều khoản attribution chỉ kích hoạt ở quy mô triển khai rất lớn).

Weights chưa thể tải xuống. Tại thời điểm ra mắt, Kimi K3 chỉ truy cập được qua API hosted của Moonshot, OpenRouter và app người dùng — không cái nào cung cấp file model cơ bản. Moonshot cam kết công bố weights thực tế, cùng báo cáo kỹ thuật, trước 27 tháng 7 năm 2026. Cho tới ngày đó, "Kimi K3 là open source" là tuyên bố về ý định và giấy phép, không phải thứ bạn có thể git clone hoặc chạy với vLLM hôm nay.

Nếu bạn cụ thể cần self-hosted, on-prem inference, bước thực tế hiện tại là đánh dấu và quay lại sau 27/7 — đồng thời tính riêng cuộc trò chuyện phần cứng, vì model 2.8T tham số (dù là sparse MoE) sẽ cần bộ nhớ lớn hơn đáng kể so với K2.6.

Kimi K3 hoạt động thế nào

Phân tích đầy đủ: Benchmark Kimi K3: thực tế so sánh thế nào

Tóm tắt: trên Artificial Analysis Intelligence Index, K3 ghi 57, cao hơn Claude Opus 4.8 (56) nhưng thua Claude Fable 5 (60). Ở benchmark agentic cụ thể — GDPval-AA, BrowseComp, coding dài hạn — K3 thực sự cạnh tranh với, và đôi khi vượt, các model closed-source đắt nhất trên thị trường. Nó cũng chiếm vị trí #1 trên LMArena Frontend Code Arena trong vài giờ sau ra mắt, vượt Claude Fable 5.

Điểm yếu hơn: benchmark học thuật nặng reasoning như GPQA Diamond và Humanity's Last Exam, nơi Claude Opus 4.8 vẫn nhỉnh hơn.

Kimi K3 giá bao nhiêu

Phân tích đầy đủ: Giá Kimi K3: chi phí API và gói đăng ký

Tóm tắt: API là $3 mỗi triệu input token$15 mỗi triệu output token, với cached input giảm xuống $0,30 mỗi triệu — giảm 90% rất quan trọng cho workload agentic và kiểu RAG. Mức này rẻ hơn Claude Opus 4.8 khoảng 1,7 lần cả input lẫn output. App người dùng có năm gói đăng ký từ miễn phí (Adagio) đến $199/tháng (Vivace), nhưng các gói đó bao phủ chat app và công cụ, không phải API.

So sánh với Claude và các model khác

Phân tích đầy đủ: Kimi K3 vs Claude: so sánh Fable 5 và Opus 4.8

Tóm tắt: so với Claude Opus 4.8, K3 thắng cả benchmark lẫn giá — khá sạch nếu Opus 4.8 là baseline của bạn. So với Claude Fable 5 mới hơn, bức tranh sát hơn: Fable 5 thắng nhiều benchmark hơn (khoảng 8/14 trong so sánh head-to-head), đặc biệt ở frontier engineering và tác vụ vision, nhưng K3 thắng ở agentic coding dài hạn và công việc terminal-driven, với chi phí chỉ bằng một phần nhỏ Fable 5.

K3 cũng ra mắt cùng cửa sổ với GLM 5.2Kimi K2.6 trước đó như các lựa chọn open-weight cạnh tranh — nếu bạn đánh giá model mở cụ thể, đánh giá GLM 5.2so sánh Kimi K2.6 vs GLM-5.1 là tài liệu bổ sung hữu ích trong khi bản so sánh trực tiếp K3 vs GLM-5.2 đang được chuẩn bị.

Cách truy cập Kimi K3 hôm nay

Bốn cách, không cái nào hiện cần weights (chưa phát hành):

  • API riêng của Moonshot tại platform.kimi.ai — đăng ký, tạo key, thanh toán theo token. Xem hướng dẫn giá để biết các bước thiết lập.
  • OpenRouter, liệt kê là moonshotai/kimi-k3 — hữu ích nếu bạn đã route nhiều provider qua OpenRouter và muốn K3 như tùy chọn drop-in.
  • App Kimi và web chat cho người dùng — có gói miễn phí (Adagio), gói trả phí đến $199/tháng cho usage nặng hơn, agent credits và công cụ. Billing tách biệt với API.
  • Kimi Code, coding agent terminal của Moonshot, cho subscriber muốn K3 tích hợp vào workflow CLI coding.

Chưa có: weights Hugging Face, và do đó mọi hình thức self-hosting thực sự.

Kimi K3 vs Kimi K2.6: thực sự thay đổi gì

Nếu bạn đã đánh giá hoặc triển khai Kimi K2.6 đầu năm 2026, K3 không phải bản nâng cấp nhỏ:

Kimi K2.6 Kimi K3
Tổng tham số ~1T 2.8T
Context window 256K ~1M
Kiến trúc Standard MoE attention Kimi Delta Attention + Attention Residuals + Stable LatentMoE
Input hình ảnh Ảnh + video thử nghiệm Hiểu biết ảnh gốc
Chế độ reasoning Toggle (Thinking / Instant) Thinking mode luôn bật
Open weights Có trên Hugging Face Đang chờ, dự kiến 27/7/2026

K2.6 vẫn hợp lý nếu bạn đã tích hợp và không cần context lớn hơn hay vị trí benchmark mới nhất. Với mọi đánh giá mới, bắt đầu với K3.

Ai nên dùng Kimi K3

  • Team xây công cụ agentic coding — benchmark agent và terminal dài hạn là nơi K3 mạnh nhất so với giá.
  • Ai đang trả cho Claude Opus 4.8 khi cost-per-task quan trọng — K3 vượt nó trên benchmark mà đa số team quan tâm và rẻ hơn đáng kể.
  • Workflow nặng frontend — kết quả #1 LMArena Frontend Code Arena là tín hiệu thực, có thể xác minh, không chỉ số tự báo cáo.
  • Pipeline long-context và RAG hưởng lợi từ context window ~1M và giá cached-input giảm 90%.

Ai nên chờ

  • Ai cần self-hosted, on-prem inference hôm nay. Weights chưa ra. Quay lại sau 27/7/2026.
  • Team workload nặng benchmark reasoning học thuật (toán thi đấu, khoa học kiểu GPQA) — Claude Opus 4.8 và Fable 5 vẫn nhỉnh hơn ở đó.
  • Ai cần bức tranh benchmark trưởng thành, được xác minh độc lập đầy đủ. K3 mới vài ngày; một số số liệu lan truyền vẫn là vendor-reported hoặc từ một aggregator duy nhất, và có thể được tinh chỉnh khi cộng đồng chạy thêm đánh giá riêng.

FAQ

Kimi K3 là gì? Kimi K3 là flagship large language model của Moonshot AI, phát hành 16 tháng 7 năm 2026. Đây là model mixture-of-experts 2,8 nghìn tỷ tham số với context window ~1M token, hiểu biết hình ảnh gốc và chế độ reasoning luôn bật, được định vị như đối thủ open-weight của Claude và GPT.

Kimi K3 có phải open source không? Thiết kế để là open-weight theo giấy phép kiểu Modified MIT, nhưng weights tải xuống thực tế chưa có tại thời điểm ra mắt. Moonshot cam kết công bố chúng, cùng báo cáo kỹ thuật đầy đủ, trước 27 tháng 7 năm 2026.

Kimi K3 có miễn phí không? App chat người dùng có gói miễn phí (Adagio). API trả phí, $3/M input và $15/M output token, không có gói production miễn phí. Xem hướng dẫn giá để biết chi tiết đầy đủ.

Làm sao dùng Kimi K3? Hôm nay, qua API Moonshot tại platform.kimi.ai, qua OpenRouter với moonshotai/kimi-k3, hoặc qua app Kimi và web chat cho người dùng. Self-hosting không khả thi cho tới khi weights công khai phát hành.

Kimi K3 có tốt hơn Claude không? Tùy Claude nào. K3 vượt Claude Opus 4.8 trên Artificial Analysis Intelligence Index và đa số benchmark agentic, với giá thấp hơn. So với Claude Fable 5 mới hơn, Fable 5 thắng nhiều benchmark hơn, nhưng K3 thắng ở agentic coding dài hạn và rẻ hơn rất nhiều. Xem so sánh đầy đủ.

Kimi K3 lớn cỡ nào? 2,8 nghìn tỷ tham số tổng, dùng thiết kế mixture-of-experts (Stable LatentMoE) kích hoạt 16 trong 896 experts mỗi token — nên chi phí inference thấp hơn nhiều so với tổng tham số gợi ý.

Hướng dẫn liên quan

Hướng dẫn liên quan

Tiếp tục khám phá cụm nội dung Gemma 4 với bài hướng dẫn tiếp theo phù hợp với quyết định hiện tại của bạn.

Vẫn chưa biết nên đọc gì tiếp theo?

Quay lại trung tâm hướng dẫn để duyệt các bài so sánh model, hướng dẫn cài đặt và trang lập kế hoạch phần cứng.