
Đánh giá Kimi K3: Mô hình mở 2,8T của Moonshot so với Fable 5 và GPT-5.6 Sol
Xác minh lần cuối: Ngày 17 tháng 7 năm 2026. Mọi thông số kỹ thuật, mức giá và kết quả kiểm tra hiệu năng dưới đây đã được kiểm tra lại dựa trên tài liệu nền tảng của Moonshot, Artificial Analysis và các nguồn tin độc lập vào ngày bài viết này được công bố. Kimi K3 ra mắt vào ngày 16 tháng 7 năm 2026.
Trong bài đánh giá Kimi K3 này, một con số ra mắt đã tự lên tiếng: mô hình mới của Moonshot đã debut ở vị trí số 1 trên bảng xếp hạng Frontend Code của Arena, tăng 17 bậc so với Kimi K2.6 và xếp trên Claude Fable 5. Đây là một mô hình mã nguồn mở trọng số (open-weight) của Trung Quốc chiến thắng trong một cuộc thi lập trình front-end được đánh giá bởi các nhà phát triển thực tế trong các trận đấu ẩn danh. Bên dưới lớp vỏ, nó là thiết kế Mixture-of-Experts (MoE) với 2,8 nghìn tỷ tham số, chỉ kích hoạt 16 trong số 896 chuyên gia (experts) cho mỗi token, đọc ngữ cảnh lên tới một triệu token và có mức giá đầu vào từ $0,30 đến $3,00 cho mỗi triệu token. Điểm cần lưu ý trước khi bạn quá hào hứng: bạn chưa thể tải xuống bộ trọng số (weights) ngay lúc này, và Moonshot cho biết điều đó sẽ thay đổi vào ngày 27 tháng 7.
Nhận định nhanh:
- Nó là gì: Sản phẩm chủ lực của Moonshot AI, một mô hình MoE với 2,8 nghìn tỷ tham số, ngữ cảnh 1 triệu token, hỗ trợ đầu vào hình ảnh và video gốc, cùng khả năng suy luận luôn bật. ID API là
kimi-k3. - Điểm mạnh: Duyệt web dạng tác nhân (agentic browsing) (BrowseComp 91.2) và lập trình tầm nhìn dài (SWE Marathon 42.0, cao hơn cả Fable 5 và GPT-5.6 Sol). Đứng số 1 trên Arena's Frontend Code Arena.
- Điểm yếu: FrontierSWE và HLE-Full (Fable 5 dẫn đầu), DeepSWE (GPT-5.6 Sol dẫn đầu). Artificial Analysis độc lập xếp hạng nó ở vị trí thứ 4 trên tổng số 189 mô hình.
- Chi phí: $0,30 cho truy xuất bộ nhớ đệm (cache-hit) / $3,00 cho đầu vào mới, $15,00 cho đầu ra trên mỗi triệu token. Đây là mô hình đắt đỏ nhất mà bất kỳ phòng thí nghiệm nào của Trung Quốc từng phát hành.
- Điểm hạn chế: Được gọi là "open-weight" nhưng checkpoint chưa công khai cho đến ngày 27 tháng 7 năm 2026. Cho đến lúc đó, không thể tự lưu trữ (self-hosting) và không có đánh giá độc lập từ bên thứ ba.
Nếu bạn muốn câu trả lời ngắn gọn: Kimi K3 là mô hình mã nguồn mở trọng số đầu tiên thực sự cạnh tranh sòng phẳng với các mô hình đóng tiên tiến nhất (closed frontier), nhưng đây là phần mềm vừa ra mắt với việc phát hành trọng số còn pending và mức giá cao cấp. Hãy đọc tiếp để xem các thông số kỹ thuật, thực tế về điểm chuẩn (bao gồm một lưu ý quan trọng thay đổi cách bạn nên đọc mọi con số), phép tính giá cả và ai thực sự nên sử dụng nó.
Kimi K3 là gì?
Kimi K3 là mô hình ngôn ngữ lớn mới nhất của Moonshot AI, ra mắt ngày 16 tháng 7 năm 2026. Đây là mô hình Mixture-of-Experts với tổng cộng 2,8 nghìn tỷ tham số, chỉ kích hoạt 16 trong số 896 chuyên gia trên mỗi token, giúp chi phí tính toán trên mỗi token thấp hơn nhiều so với những gì một mô hình dày đặc (dense) 2,8T sẽ yêu cầu. Nó chấp nhận văn bản, hình ảnh và video, duy trì cửa sổ ngữ cảnh một triệu token và giữ chế độ suy luận luôn bật theo mặc định.
Dưới đây là bảng thông số kỹ thuật tóm tắt.
| Thông số | Kimi K3 |
|---|---|
| Ngày phát hành | 16 tháng 7 năm 2026 |
| Nhà phát triển | Moonshot AI |
| Tổng tham số | 2,8 nghìn tỷ (Mixture-of-Experts) |
| Kích hoạt mỗi token | 16 trong số 896 chuyên gia |
| Cơ chế Attention | Kimi Delta Attention (KDA), giải mã nhanh hơn gấp 6,3 lần ở ngữ cảnh 1M |
| Cửa sổ ngữ cảnh | 1.000.000 token |
| Phương thức đầu vào | Văn bản, hình ảnh và video |
| Suy luận (Reasoning) | Luôn bật; một mức "max" duy nhất tại thời điểm ra mắt |
| ID mô hình API | kimi-k3 (tương thích OpenAI-SDK) |
| Trọng số (Weights) | Open-weight; hứa hẹn phát hành công khai ngày 27 tháng 7 năm 2026 |
| Giá mỗi triệu token | $0,30 cache-hit hoặc $3,00 đầu vào mới, $15,00 đầu ra |
Câu chuyện kỹ thuật thú vị nằm ở thiết kế attention. Moonshot gọi nó là Kimi Delta Attention, hay KDA, một cơ chế attention tuyến tính lai mà công ty báo cáo mang lại tốc độ giải mã nhanh hơn gấp 6,3 lần trong các ngữ cảnh triệu token. K3 kết hợp nó với một loạt các kỹ thuật mới hơn mà phòng thí nghiệm đặt tên là Attention Residuals, Gated MLA và Stable LatentMoE. Bạn không cần phải ghi nhớ các từ viết tắt này. Điều chúng cộng lại tạo thành một mô hình có thể duy trì tốc độ nhanh trong khi xử lý ngữ cảnh khổng lồ, chính là khối lượng công việc khiến các kiến trúc cũ hơn bị vỡ trận.
Đặt K3 cạnh mô hình mà nó thay thế, bước nhảy vọt là rất lớn. Nó gần như gấp ba số lượng tham số của Kimi K2 (2,8T so với khoảng 1T), gấp bốn lần cửa sổ ngữ cảnh của dòng K2.6 và K2.7 (1M so với 256K), và thêm đầu vào hình ảnh và video vào một họ mô hình vốn trước đây chỉ tập trung vào văn bản. Nếu bạn đã thử một phiên bản Kimi earlier và shrugged vai, thì đây là một con vật hoàn toàn khác.
Điểm chuẩn Kimi K3: Nơi nó thắng và nơi nó thua
Các điểm chuẩn ra mắt của Kimi K3 thực sự mạnh mẽ, nhưng cũng thực sự hỗn hợp. Nó dẫn đầu lĩnh vực ở một số tác vụ coding và agent, nhưng rõ ràng là tụt hậu so với biên giới đóng (closed frontier) ở những tác vụ khác. Trước khi đi vào bảng số liệu, có một lưu ý quan trọng hơn bất kỳ điểm số đơn lẻ nào: Moonshot đã chạy mỗi mô hình bên trong môi trường coding riêng của họ. K3 được chấm điểm trong KimiCode, Fable 5 trong Claude Code, và GPT-5.6 Sol trong Codex. Phần mềm bao quanh một mô hình ảnh hưởng đến kết quả của nó, vì vậy hãy đọc các con số này theo hướng xu hướng, không phải như một bảng xếp hạng đã được chốt hạ.
Dưới đây là các con số nổi bật về coding và agent từ bảng ra mắt của Moonshot.
| Bài kiểm tra (Benchmark) | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Program Bench | 77.8 | 77.6 | 76.8 |
| SWE Marathon | 42.0 | 39.0 | 35.0 |
| Terminal-Bench 2.1 | 88.3 | 88.8 | 84.6 |
| DeepSWE | 67.5 | 73.0 | 70.0 |
| FrontierSWE | 81.2 | 71.3 | 86.6 |
| BrowseComp | 91.2 | chưa công bố | chưa công bố |
| OmniDocBench | 91.1 | chưa công bố | chưa công bố |
Nhìn ngang qua các hàng, một mô hình xuất hiện. K3 chiến thắng trong những công việc dài hơi và gian nan. Trên SWE Marathon, thước đo các phiên kỹ thuật kéo dài nhiều giờ, mức 42.0 của K3 vượt trội hơn cả GPT-5.6 Sol và Fable 5 với khoảng cách rõ rệt. Nó nhỉnh hơn đối thủ trên Program Bench, và cũng dẫn đầu ở phía agent, đạt 91.2 trên BrowseComp và 91.1 trên OmniDocBench, nơi Moonshot cũng báo cáo vị trí số 1 trên Automation Bench.
Nó thua ở đâu? Trên DeepSWE, GPT-5.6 Sol vượt lên với 73.0. Trên FrontierSWE, Fable 5 dẫn xa với 86.6, mặc dù đáng chú ý là mức 81.2 của K3 vẫn tốt hơn mức 71.3 của Sol ở mục này. Bảng số liệu của chính Moonshot thừa nhận rằng K3 thua Fable 5 trên FrontierSWE và HLE-Full, và thua GPT-5.6 Sol trên DeepSWE. Đây không phải là một mô hình đánh bại biên giới ở mọi nơi. Nó là một mô hình đánh bại biên giới ở một số nơi, điều mà chưa có bản phát hành open-weight nào thực sự làm được trước đây.
Góc nhìn độc lập xác nhận điều đó. Artificial Analysis chấm K3 ở mức 57 trên Chỉ số Trí tuệ (Intelligence Index) và xếp hạng nó thứ 4 trong số 189 mô hình, đứng sau Claude Fable 5 và hai cài đặt suy luận của GPT-5.6 Sol nhưng đứng trên Claude Opus 4.8. Tốc độ đầu ra đo lường được khá khiêm tốn ở mức 62 token mỗi giây. Về khía cạnh ưu tiên của con người, vị trí số 1 của K3 trên Arena's Frontend Code Arena là điểm nổi bật, vì bảng xếp hạng này đến từ các nhà phát triển bỏ phiếu cho đầu ra front-end thực tế chứ không phải là điểm số tự báo cáo.
Nhà phát triển độc lập Simon Willison đã thử nghiệm K3 qua bài kiểm tra SVG pelican-on-a-bicycle của anh ấy vào ngày ra mắt. Mô hình tạo ra kết quả vững chắc và viết văn bản thay thế (alt text) chính xác cho hình ảnh của chính nó, điều này nói lên khả năng thị giác tốt của nó. Anh ấy cũng chỉ ra sự ngạc nhiên về chi phí mà chúng ta sẽ đề cập trong phần giá cả, và nhắc nhở độc giả rằng một bài kiểm tra SVG nhanh không nói lên điều gì về việc gọi công cụ dạng tác nhân (agentic tool calling), nơi mà một mô hình như thế này chứng minh giá trị của nó. Một lời cảnh báo hợp lý.
Kimi K3 so với Fable 5, GPT-5.6 Sol, DeepSeek và Qwen
Vậy K3 đứng ở đâu trong bức tranh rộng lớn hơn? Hai phép so sánh quan trọng: so với biên giới đóng (closed frontier), và so với các mô hình open-weight đồng hương Trung Quốc.
So với biên giới, cách diễn đạt trung thực là "cận biên giới, không phải đứng đầu biên giới." Claude Fable 5 và GPT-5.6 Sol vẫn dẫn đầu các bảng xếp hạng trí tuệ tổng hợp, và Fable 5 giữ lợi thế thực sự trong các đánh giá suy luận khó nhất và coding biên giới. Điều thay đổi với K3 là khoảng cách đã thu hẹp thành các cuộc trao đổi ở từng bài kiểm tra đơn lẻ thay vì một vực thẳm về phân loại. Việc một mô hình có thể tải xuống dẫn đầu SWE Marathon và đứng đầu trong một cuộc bỏ phiếu coding front-end ẩn danh là vùng đất mới.
So với các đối thủ open-weight, K3 là mốc cao mới về khả năng thô, nhưng nó không phải là lựa chọn mặc định hiển nhiên cho mọi công việc. Nếu bạn đang cân nhắc các tùy chọn open-weight của Trung Quốc như một nhóm, bài so sánh Qwen vs DeepSeek vs GLM của chúng tôi phân tích cách ba họ mô hình này chia sẻ thị trường: Qwen cho footprint self-host nhẹ nhất và giấy phép thoáng nhất, DeepSeek cho token rẻ nhất, GLM cho coding thực hành. K3 hiện đứng trên tất cả chúng về điểm chuẩn đỉnh cao, và cũng đứng trên chúng về giá cả. Nó là tùy chọn cao cấp trong một danh mục vốn xây dựng danh tiếng nhờ sự rẻ tiền.
Đối với một lĩnh vực rộng hơn bao gồm các mô hình thực sự đánh bại chất lượng lớp GPT-4, bài tổng hợp LLM mã nguồn mở tốt nhất năm 2026 của chúng tôi đặt các tuyên bố của K3 vào bối cảnh. Tóm lại: K3 nâng trần nhà cho open weights, nhưng "open weights" và "rẻ" chính thức không còn là cùng một thứ nữa.
Giá cả Kimi K3 và Phép tính Cache-Hit
Đây là nơi K3 gây chia rẽ. Moonshot định giá nó ở mức $0,30 cho mỗi triệu token đầu vào truy xuất bộ nhớ đệm (cache-hit), $3,00 cho mỗi triệu token đầu vào mới, và $15,00 cho mỗi triệu token đầu ra, áp dụng đồng nhất trên toàn bộ ngữ cảnh triệu token.
Đặt nó cạnh mô hình mà nó thay thế, sự thay đổi rất rõ rệt.
| Loại token | Kimi K3 | Kimi K2.6 |
|---|---|---|
| Đầu vào, mới | $3,00 / M | $0,95 / M |
| Đầu vào, cache-hit | $0,30 / M | không công bố |
| Đầu ra | $15,00 / M | $4,00 / M |
Đó là mức tăng khoảng 3 lần cho đầu vào và gần 4 lần cho đầu ra so với K2.6. Willison lưu ý rằng mức giá $3/$15 nằm trong cùng phân khúc với Claude Sonnet. The Decoder gọi K3 là tín hiệu cho thấy kỷ nguyên AI Trung Quốc siêu rẻ đang kết thúc. Nếu toàn bộ lý do bạn chạy một mô hình Trung Quốc là vì giá cả, K3 sẽ khiến bạn phải suy nghĩ lại.
Nhưng tỷ lệ cache-hit mới là con số quyết định hóa đơn thực sự của bạn, vì vậy hãy làm phép tính cho một vòng lặp tác nhân (agentic loop) thực tế, sử dụng mức giá công bố của Moonshot. Giả sử agent coding của bạn đọc ngữ cảnh codebase 200.000 token và viết 8.000 token đầu ra, và nó làm điều đó 20 lần một ngày:
- Cache-miss (lần đọc lạnh đầu tiên): 200.000 token đầu vào ở mức $3,00/M là $0,60, cộng với 8.000 token đầu ra ở mức $15,00/M là $0,12. Tổng cộng khoảng $0,72 mỗi lần gọi, hoặc $14,40 một ngày.
- Cache-hit (ngữ cảnh lặp lại, trường hợp phổ biến trong phiên coding): 200.000 token đầu vào ở mức $0,30/M là $0,06, cộng với $0,12 đầu ra như trên. Tổng cộng khoảng $0,18 mỗi lần gọi, hoặc $3,60 một ngày.
Kinh tế học bộ nhớ đệm cắt giảm hóa đơn đầu xuống khoảng mười lần, từ $0,60 xuống $0,06 mỗi lần gọi. Moonshot báo cáo tỷ lệ cache-hit trên 90% trong các khối lượng công việc coding, đây là kịch bản khiến K3 trở nên phải chăng thay vì đắt cắt cổ. Bài học cho ngân sách của bạn: K3 đắt đỏ trong các lệnh gọi lạnh, one-shot và hợp lý trong một vòng lặp ấm, nặng về ngữ cảnh.
Một bẫy chi phí khác mà Willison nêu ra. K3 hiện chỉ phơi bày một mức suy luận "max" duy nhất, và các token suy luận được tính phí ở mức đầu ra. Bài kiểm tra SVG đơn giản của anh ấy đã đốt cháy 13.241 token suy luận ngoài 3.417 token đầu ra, vì vậy một prompt tầm thường tốn khoảng 25 xu. Chưa có chế độ "low reasoning" giá rẻ, nghĩa là K3 trả quá nhiều cho các câu hỏi dễ. Nếu kiểm soát chi phí là ưu tiên của bạn, các hướng dẫn của chúng tôi về giá API LLM và cách giảm chi phí API LLM áp dụng trực tiếp ở đây: tận dụng bộ nhớ đệm mạnh mẽ, chuyển hướng các lệnh gọi tầm thường sang mô hình rẻ hơn và dành riêng K3 cho các công việc khó, ngữ cảnh dài nơi nó xứng đáng với mức giá cao cấp.
Open Weights: "Open" thực sự nghĩa là gì ở đây
Đây là phần mà các tiêu đề ra mắt đã lướt qua. Kimi K3 được công bố là mô hình open-weight, và Moonshot có thành tích thực sự trong việc phát hành các checkpoint có thể tải xuống. Nhưng tính đến ngày 17 tháng 7 năm 2026, trọng số của K3 chưa công khai. Tổ chức Hugging Face của Moonshot vẫn chỉ liệt kê các checkpoint dòng K2. Công ty cho biết đầy đủ trọng số sẽ đến vào ngày 27 tháng 7 năm 2026.
Tại sao khoảng trống đó lại quan trọng? Ba lý do thực tế:
- Chưa có self-hosting. Bạn không thể chạy K3 trên phần cứng của riêng mình hoặc một cụm riêng tư cho đến khi trọng số được phát hành. Đối với các đội có yêu cầu về cư trú dữ liệu hoặc air-gap, K3 hiện chỉ là API-only, điều này đánh bại một phần lớn lý do bạn chọn một mô hình mở. Khi trọng số thực sự ra mắt, các hướng dẫn của chúng tôi về các công cụ tốt nhất để chạy LLM cục bộ và chạy LLM cục bộ sẽ giúp bạn bắt đầu, mặc dù một mô hình 2,8 nghìn tỷ tham số thuộc lớp cụm (cluster-class), không phải lớp laptop.
- Chưa có đánh giá độc lập. Mọi điểm chuẩn K3 bạn đã thấy đều do nhà cung cấp chạy, trong môi trường riêng của Moonshot. Các con số nghiêm túc từ bên thứ ba về những thứ như HLE hoặc các tác vụ dành riêng cho agent không thể tồn tại cho đến khi các phòng thí nghiệm bên ngoài có trọng số để kiểm tra. Hãy coi bảng ra mắt như một tuyên bố mạnh mẽ, không phải là kết quả đã được xác minh.
- Điều khoản giấy phép vẫn đang được ổn định. Các bản phát hành Kimi trước đây sử dụng giấy phép thoáng, nhưng hãy xác nhận giấy phép K3 chính xác đối với thẻ mô hình (model card) chính thức khi checkpoint được công bố, đặc biệt nếu bạn có kế hoạch triển khai thương mại.
Không điều nào trong số này làm cho K3 kém ấn tượng. Nó có nghĩa là nếu kế hoạch của bạn phụ thuộc vào việc tải xuống và tinh chỉnh (fine-tuning) mô hình, việc đánh giá thực sự của bạn bắt đầu vào ngày 27 tháng 7, không phải ngày 16 tháng 7.
Cách chúng tôi đánh giá Kimi K3 cho công việc khách hàng
Một ghi chú nhanh về nguồn gốc của bài đánh giá này và nơi nó dừng lại. Tại Techsy, chúng tôi tích hợp các LLM bên thứ ba vào các quy trình sản xuất cho khách hàng B2B, thường thông qua các endpoint tương thích OpenAI-SDK để chúng tôi có thể hoán đổi mô hình mà không cần xây dựng lại hệ thống ống nước. K3 phù hợp với lộ trình đó một cách sạch sẽ: nó phơi bày một API tương thích OpenAI với ID mô hình kimi-k3, vì vậy việc đưa nó vào một tích hợp hiện có để dùng thử là một thay đổi cấu hình, không phải viết lại.
Mỗi khi một mô hình mới ra mắt, chúng tôi chạy nó qua cùng một đánh giá cố định trên các tác vụ đại diện cho khách hàng trước khi khuyến nghị bất cứ điều gì. Và đây là giới hạn trung thực của bài đánh giá này: chúng tôi chưa công bố điểm số K3 của riêng mình. Trọng số chưa ra mắt, các điểm chuẩn ra mắt được nhà cung cấp chạy trong môi trường riêng của Moonshot, và một con số công bằng cần một thiết lập trung lập trên các tác vụ trông giống như công việc khách hàng thực tế, không phải là bảng xếp hạng. Trích dẫn một điểm chuẩn từ bên thứ nhất từ một mô hình mới một ngày tuổi, đang chờ trọng số, sẽ chính xác là loại con số mà chúng tôi khuyên khách hàng không nên tin tưởng.
Những gì chúng tôi có thể đánh giá hôm nay từ API trực tiếp là phần không cần bảng xếp hạng: bề mặt tích hợp, mô hình chi phí và các chế độ lỗi. Phép tính giá cả ở trên là tính toán của riêng chúng tôi từ mức giá công bố của Moonshot, không phải là điểm chuẩn, và nó đã cho bạn biết sự thật vận hành: kỷ luật bộ nhớ đệm là sự khác biệt giữa việc K3 phải chăng và trở thành vấn đề ngân sách. Nếu bạn muốn giúp đỡ để tìm hiểu xem một mô hình như K3 có thuộc về ngăn xếp (stack) của bạn hay không, đó là loại đánh giá mà chúng tôi thực hiện tại thực tiễn tích hợp AI của Techsy, và bạn có thể đặt lịch tư vấn miễn phí để thảo luận về nó.
Ai nên sử dụng Kimi K3 (và ai không nên)
Kimi K3 phù hợp mạnh mẽ với một tập hợp công việc cụ thể và kém phù hợp với những công việc khác. Hãy khớp nó với khối lượng công việc thực tế của bạn.
Hãy chọn K3 nếu:
- Bạn chạy agentic browsing hoặc nghiên cứu. Dẫn đầu BrowseComp và Automation Bench, cộng với kết quả đọc nghiên cứu agent độc lập hàng đầu, làm cho nó trở thành tùy chọn open-weight có khả năng nhất cho các agent sử dụng công cụ ngay bây giờ.
- Bạn thực hiện coding tầm nhìn dài. SWE Marathon là điểm chuẩn phản ánh các phiên kỹ thuật kéo dài nhiều giờ, và K3 dẫn đầu nó. Nếu các agent của bạn làm việc trên các codebase lớn trong các lần chạy dài, đây là sân nhà của nó.
- Bạn muốn một mô hình cận biên giới open-weight và có thể chờ trọng số. Nếu mục tiêu là self-hosting một mô hình mở hàng đầu vào ngày 27 tháng 7, K3 là ứng cử viên có khả năng nhất hiện có.
Hãy hoãn lại nếu:
- Bạn cần trọng số ngay hôm nay. Cho đến ngày 27 tháng 7, K3 chỉ là API-only. Một mô hình đã có thể tải xuống sẽ phục vụ bạn tốt hơn trong tuần này.
- Bạn chạy lưu lượng truy cập khối lượng lớn, nhạy cảm về chi phí. Với một mức suy luận đắt đỏ duy nhất và giá đầu ra cao cấp, K3 trả quá nhiều cho các lệnh gọi đơn giản. Kimi K2.7-Code hoặc một mô hình mở rẻ hơn sẽ thắng trong công việc số lượng lớn.
- Bạn yêu cầu các đánh giá độc lập đã được chứng minh trước khi áp dụng. Các con số ra mắt được nhà cung cấp chạy. Nếu quy trình của bạn đòi hỏi xác minh từ bên thứ ba, hãy đợi vài tuần.
Câu hỏi thường gặp
Kimi K3 là gì?
Kimi K3 là mô hình ngôn ngữ lớn chủ lực của Moonshot AI, ra mắt ngày 16 tháng 7 năm 2026. Đây là mô hình Mixture-of-Experts với 2,8 nghìn tỷ tham số, kích hoạt 16 trong số 896 chuyên gia trên mỗi token, hỗ trợ cửa sổ ngữ cảnh 1 triệu token và chấp nhận đầu vào văn bản, hình ảnh và video với chế độ suy luận luôn bật.
Kimi K3 có phải là mã nguồn mở không?
Kimi K3 được công bố là mô hình open-weight, nhưng trọng số chưa công khai tính đến ngày 17 tháng 7 năm 2026. Moonshot cho biết checkpoint đầy đủ sẽ được phát hành vào ngày 27 tháng 7 năm 2026. Cho đến lúc đó, nó chỉ khả dụng thông qua các ứng dụng Kimi và API, vì vậy bạn chưa thể tự lưu trữ (self-host) nó.
Kimi K3 khác Kimi K2 như thế nào?
K3 gần như gấp ba số lượng tham số của K2 (2,8 nghìn tỷ so với khoảng 1 nghìn tỷ), gấp bốn lần cửa sổ ngữ cảnh của dòng K2.6 và K2.7 (1 triệu so với 256 nghìn token), và thêm đầu vào hình ảnh và video gốc vào một họ mô hình trước đây tập trung vào văn bản. Nó cũng giới thiệu thiết kế Kimi Delta Attention mới.
Kimi K3 có giá bao nhiêu?
Moonshot định giá K3 ở mức $0,30 cho mỗi triệu token đầu vào cache-hit, $3,00 cho mỗi triệu token đầu vào mới và $15,00 cho mỗi triệu token đầu ra. Con số này cao gấp khoảng ba lần giá đầu vào của K2.6 và gần gấp bốn lần giá đầu ra, khiến K3 trở thành mô hình đắt đỏ nhất mà một phòng thí nghiệm Trung Quốc từng phát hành.
Cửa sổ ngữ cảnh của Kimi K3 là bao nhiêu?
Kimi K3 hỗ trợ cửa sổ ngữ cảnh một triệu token, và giá cả giữ nguyên trên toàn bộ cửa sổ đó. Mô hình sử dụng thiết kế attention mới gọi là Kimi Delta Attention, mà Moonshot báo cáo mang lại tốc độ giải mã nhanh hơn gấp 6,3 lần ở độ dài ngữ cảnh triệu token.
Tôi có thể chạy Kimi K3 cục bộ không?
Chưa. Trọng số chưa công khai cho đến ngày 27 tháng 7 năm 2026. Sau đó, việc self-hosting là khả thi về mặt kỹ thuật, nhưng một mô hình 2,8 nghìn tỷ tham số cần phần cứng lớp cụm (cluster-class) thay vì một trạm làm việc đơn lẻ, vì vậy hầu hết các đội vẫn sẽ truy cập nó thông qua API.
Kimi K3 có thực sự tốt hơn Fable 5 không?
Tùy thuộc vào tác vụ. K3 đánh bại Claude Fable 5 trên SWE Marathon, Program Bench và cuộc bỏ phiếu coding front-end ẩn danh của Arena. Fable 5 vẫn dẫn đầu trên FrontierSWE, HLE-Full và các bảng xếp hạng trí tuệ tổng hợp chung. Mọi điểm chuẩn ra mắt cũng được chạy trong môi trường riêng của từng nhà cung cấp, vì vậy hãy coi các chiến thắng ở từng bài kiểm tra đơn lẻ là xu hướng.
Kimi K3 có tốt cho coding không?
Có, đặc biệt là cho các phiên coding dài, bền bỉ và công việc front-end, nơi nó hiện đang dẫn đầu. Nó cũng mạnh mẽ trong các tác vụ agentic và terminal. Nhược điểm chính là chi phí: với một mức suy luận đắt đỏ, nó trả quá nhiều cho các lệnh gọi tầm thường, vì vậy hãy kết hợp nó với các mô hình rẻ hơn cho công việc thường xuyên khối lượng lớn.
Làm thế nào để truy cập Kimi K3?
Bạn có thể sử dụng Kimi K3 thông qua ứng dụng web Kimi, Kimi Work và Kimi Code, hoặc thông qua API với ID mô hình kimi-k3. API tương thích với OpenAI-SDK, vì vậy việc thêm nó vào một tích hợp kiểu OpenAI hiện có chủ yếu là thay đổi cấu hình.
Về tác giả
Mert Batur Gurbuz, Đồng sáng lập, Techsy.io (Đại học Birmingham). Kết nối trên LinkedIn.
Mert Batur Gurbuz là Đồng sáng lập của Techsy.io, nơi đội ngũ phát triển các agent AI, hệ thống tự động hóa và quy trình voice/SDR cho khách hàng B2B. Anh ấy đang học tại Đại học Birmingham và viết về ngăn xếp công cụ LLM mà đội ngũ Techsy thực sự sử dụng trong sản xuất.
Những điểm chính
- Kimi K3 là mô hình open-weight đầu tiên thực sự cạnh tranh sòng phẳng với biên giới đóng, dẫn đầu SWE Marathon và đứng đầu cuộc bỏ phiếu coding front-end ẩn danh của Arena trên Claude Fable 5.
- Nó cận biên giới, không phải đứng đầu biên giới. Artificial Analysis độc lập xếp hạng nó thứ 4 trên 189, và nó thua Fable 5 trong các bài kiểm tra suy luận khó nhất và coding biên giới.
- Open trên danh nghĩa, pending trong thực tế. Trọng số chưa được công bố cho đến ngày 27 tháng 7 năm 2026, vì vậy không có self-hosting và không có đánh giá độc lập cho đến lúc đó.
- Giá cả đã kết thúc kỷ nguyên AI Trung Quốc giá rẻ. Ở mức $3/$15 mỗi triệu token, kỷ luật bộ nhớ đệm là yếu tố giữ cho K3 phải chăng; hãy lập ngân sách cho một vòng lặp ấm, nặng ngữ cảnh, không phải các lệnh gọi one-shot lạnh.
- Tốt nhất cho nghiên cứu dạng tác nhân và coding tầm nhìn dài. Nếu bạn cần trọng số ngay hôm nay hoặc chạy lưu lượng khối lượng lớn nhạy cảm về chi phí, hãy đợi hoặc chọn một mô hình rẻ hơn. Nói chuyện với chúng tôi nếu bạn cần giúp đỡ để quyết định.