
Kimi K3 評測:Moonshot 2.8T 開源模型對決 Fable 5 與 GPT-5.6 Sol
最後驗證日期:2026 年 7 月 17 日。 本文發布當天,我們已根據 Moonshot 的平台文件、Artificial Analysis 以及獨立報導,重新核對了下方的所有規格、價格和基準測試數據。Kimi K3 於 2026 年 7 月 16 日正式發布。
在這篇 Kimi K3 評測中,有一個發布數據最具說服力:Moonshot 的新模型在 Arena 的前端程式碼(Frontend Code)排行榜上首次亮相即奪得第一名,較 Kimi K2.6 躍升了 17 個名次,排名甚至高於 Claude Fable 5。這意味著一款中國的開權重模型,在由真實開發者進行的盲測配對中,贏得了前端程式設計競賽。其底層架構是一個擁有 2.8 兆參數的混合專家(Mixture-of-Experts, MoE)設計,每個 token 僅啟用 896 個專家中的 16 個,能讀取百萬 token 的上下文,輸入價格介於每百萬 token $0.30 至 $3.00 之間。但在你興奮之前,必須知道一個關鍵限制:你目前還無法下載權重,Moonshot 表示這情況將在 7 月 27 日改變。
快速結論:
- 它是什麼: Moonshot AI 的旗艦模型,具備 2.8T 參數的 MoE 架構、100 萬 token 上下文窗口、原生支援圖像和視頻輸入,並預設開啟推理功能。API 識別碼為
kimi-k3。 - 優勢領域: 代理瀏覽任務(BrowseComp 得分 91.2)和長週期程式設計(SWE Marathon 得分 42.0,高於 Fable 5 和 GPT-5.6 Sol)。在 Arena 的前端程式碼競技場中排名第一。
- 弱勢領域: FrontierSWE 和 HLE-Full(Fable 5 領先)、DeepSWE(GPT-5.6 Sol 領先)。獨立的 Artificial Analysis 將其總體排名列為第 4 名(共 189 個模型)。
- 費用成本: 緩存命中輸入 $0.30 / 新輸入 $3.00,輸出 $15.00(每百萬 token)。這是任何中國實驗室發布過的定價最高的模型。
- 注意事項: 雖名為開權重,但檢查點(checkpoint)直到 2026 年 7 月 27 日才會公開。在此之前,無法自行託管,也無獨立的第三方評估。
如果你想要一句話的答案:Kimi K3 是第一款能與閉源前沿模型真正抗衡的開權重模型,但它仍是發布初期的軟體,權重尚未釋出且定價偏高。繼續閱讀以了解詳細規格、基準測試現實(包含一個會改變你解讀數據方式的注意事項)、定價計算,以及誰應該實際使用它。
什麼是 Kimi K3?
Kimi K3 是 Moonshot AI 最新的大型語言模型,於 2026 年 7 月 16 日發布。它是一個擁有 2.8 兆總參數的混合專家(MoE)模型,在處理每個 token 時僅啟用其 896 個專家中的 16 個,因此每個 token 的計算成本遠低於密集的 2.8T 模型。它接受文字、圖像和視頻輸入,擁有百萬 token 的上下文窗口,並預設保持推理功能開啟。
以下是規格概覽。
| 規格 | Kimi K3 |
|---|---|
| 發布日期 | 2026 年 7 月 16 日 |
| 開發者 | Moonshot AI |
| 總參數量 | 2.8 兆(混合專家架構) |
| 每個 Token 啟用參數 | 896 個專家中的 16 個 |
| 注意力機制 | Kimi Delta Attention (KDA),在 1M 上下文下解碼速度最快提升 6.3 倍 |
| 上下文窗口 | 1,000,000 tokens |
| 多模態支援 | 文字、圖像和視頻輸入 |
| 推理能力 | 始終開啟;發布時僅有一個「max」等級 |
| API 模型 ID | kimi-k3(相容 OpenAI SDK) |
| 權重狀態 | 開權重;承諾於 2026 年 7 月 27 日公開發布 |
| 每百萬 Token 價格 | 緩存命中 $0.30 或新輸入 $3.00,輸出 $15.00 |
有趣的工程故事在於其注意力機制設計。Moonshot 稱之為 Kimi Delta Attention(簡稱 KDA),這是一種混合線性注意力機制,公司報告指出在百萬 token 的上下文中,解碼速度可提升高達 6.3 倍。K3 將其與實驗室稱為 Attention Residuals、Gated MLA 和 Stable LatentMoE 的一系列新技術結合。你不需要記住這些縮寫。它們加總起來的效果是讓模型在攜帶巨大上下文時仍能保持高速,這正是擊垮舊架構的工作負載。
將 K3 與其取代的模型相比,進步幅度巨大。它的參數量幾乎是 Kimi K2 的三倍(2.8T 對比約 1T),上下文窗口是 K2.6 和 K2.7 系列的四倍(1M 對比 256K),並為原本以文字為主的家庭增加了圖像和視頻輸入功能。如果你試過早期的 Kimi 並覺得平平無奇,這完全是不同的動物。
Kimi K3 基準測試:勝場與敗績
Kimi K3 的發布基準測試數據確實強勁,但也呈現兩極化。它在某些程式設計和代理任務上領先群雄,但在其他方面則明顯落後於閉源前沿模型。在查看表格之前,有一個比任何單一分数都更重要的注意事項:Moonshot 在各自的程式設計環境中運行每個模型。K3 在 KimiCode 中評分,Fable 5 在 Claude Code 中評分,而 GPT-5.6 Sol 在 Codex 中評分。包裹模型的軟體會影響其結果,因此請將這些數據視為方向性參考,而非定論排行榜。
以下是 Moonshot 發布表中的主要程式設計和代理數據。
| 基準測試 | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Program Bench | 77.8 | 77.6 | 76.8 |
| SWE Marathon | 42.0 | 39.0 | 35.0 |
| Terminal-Bench 2.1 | 88.3 | 88.8 | 84.6 |
| DeepSWE | 67.5 | 73.0 | 70.0 |
| FrontierSWE | 81.2 | 71.3 | 86.6 |
| BrowseComp | 91.2 | 未發布 | 未發布 |
| OmniDocBench | 91.1 | 未發布 | 未發布 |
橫向閱讀各行數據,可以看出一種模式。K3 在長期、耗時的任務中獲勝。在衡量持續數小時工程會議的 SWE Marathon 中,K3 的 42.0 分以明顯優勢擊敗了 GPT-5.6 Sol 和 Fable 5。它在 Program Bench 上險勝對手,在代理方面也處於領先地位,在 BrowseComp 上獲得 91.2 分,在 OmniDocBench 上獲得 91.1 分,Moonshot 還報告其在 Automation Bench 上也位居榜首。
那麼它在哪裡輸了?在 DeepSWE 上,GPT-5.6 Sol 以 73.0 分領先。在 FrontierSWE 上,Fable 5 以 86.6 分大幅領先,不過值得注意的是,K3 的 81.2 分仍然高於 Sol 的 71.3 分。Moonshot 自己的表格承認,K3 在 FrontierSWE 和 HLE-Full 上落後於 Fable 5,在 DeepSWE 上落後於 GPT-5.6 Sol。這並不是一款在所有地方都擊敗前沿的模型。它是一款在某些地方擊敗前沿的模型,這在過去的開權重發布中幾乎未曾實現。
獨立的解讀證實了這一點。Artificial Analysis 在智慧指數中給 K3 打了 57 分,將其排在 189 個模型中的第 4 名,落後於 Claude Fable 5 和兩個 GPT-5.6 Sol 推理設定,但領先於 Claude Opus 4.8。其測量的輸出速度相當普通,為每秒 62 個 token。在人類偏好方面,K3 在 Arena 前端程式碼競技場中的第一名表現最為突出,因為該排名來自開發者對真實前端輸出的投票,而非自我報告的分數。
獨立開發者 Simon Willison 在發布當天通過 他的騎自行車鵜鶘 SVG 測試 運行了 K3。該模型產生了紮實的結果,並為其生成的圖像撰寫了準確的替代文字,這證明了其視覺能力的優秀。他也指出了我們將在定價部分討論的成本驚喜,並提醒讀者,快速的 SVG 測試無法告訴你關於代理工具調用的任何資訊,而這才是這類模型發揮價值的地方。這是公平的警告。
Kimi K3 對決 Fable 5、GPT-5.6 Sol、DeepSeek 和 Qwen
那麼 K3 在更廣泛的領域中處於什麼位置?兩個比較至關重要:對抗閉源前沿模型,以及對抗其他中國開權重模型。
對抗前沿模型,誠實的定位是「接近前沿,而非超越前沿」。Claude Fable 5 和 GPT-5.6 Sol 仍然領先綜合智慧排名,且 Fable 5 在最困難的推理和前沿程式設計評估中保持實質優勢。K3 帶來的改變是,差距縮小到單個基準測試的互有勝負,而非類別上的巨大鴻溝。對於一款可下載的模型來說,能在 SWE Marathon 中領先並在盲測前端程式設計投票中奪冠,屬於新的領域。
對抗其開權重同儕,K3 在原始能力上樹立了新的高標,但並非每項工作的首選默认選項。如果你正在評估中國開權重選項群組,我們的 Qwen vs DeepSeek vs GLM 比較 詳細說明瞭這三個家族如何分割市場:Qwen 適合最輕量的自行託管 footprint 和最寬鬆的許可證,DeepSeek 適合最便宜的 token,GLM 適合動手程式設計。K3 現在在峰值基準測試和價格上都高於它們所有。它是建立在「便宜」聲譽類別中的高級選項。
對於包含實際上擊敗 GPT-4 級別品質模型的更廣泛領域,我們的 2026 年最佳開源 LLM 匯總 將 K3 的主張置於背景中。簡而言之:K3 提高了開權重的上限,但「開權重」和「便宜」已正式不再等同。
Kimi K3 定價與緩存命中數學
這裡是 K3 引發爭議的地方。Moonshot 將其定價為每百萬緩存命中輸入 token $0.30,每百萬新輸入 token $3.00,每百萬輸出 token $15.00,整個百萬 token 上下文統一費率。
將其與取代的模型並列,轉變顯得鮮明。
| Token 類型 | Kimi K3 | Kimi K2.6 |
|---|---|---|
| 輸入,新請求 | $3.00 / M | $0.95 / M |
| 輸入,緩存命中 | $0.30 / M | 未披露 |
| 輸出 | $15.00 / M | $4.00 / M |
這大約是 K2.6 輸入價格的 3 倍,輸出價格的近 4 倍。Willison 指出,$3/$15 的費率落在與 Claude Sonnet 相同的層級。The Decoder 稱 K3 是一個信號,表明超便宜中國 AI 時代即將結束。如果你運行中國模型的唯一原因是價格,K3 會讓你三思。
但緩存命中率是決定你實際帳單的關鍵數字,所以讓我們使用 Moonshot 發布的費率,針對現實的代理循環進行數學計算。假設你的程式設計代理讀取 200,000 token 的程式碼庫上下文,並寫入 8,000 token 的輸出,每天執行 20 次:
- 緩存未命中(首次冷讀取): 200,000 輸入 token 按 $3.00/M 計算為 $0.60,加上 8,000 輸出 token 按 $15.00/M 計算為 $0.12。每次調用約 $0.72,每天 $14.40。
- 緩存命中(重複上下文,程式設計 session 中的常見情況): 200,000 輸入 token 按 $0.30/M 計算為 $0.06,加上相同的 $0.12 輸出。每次調用約 $0.18,每天 $3.60。
緩存經濟學將輸入帳單削減了約十倍,從每次調用 $0.60 降至 $0.06。Moonshot 報告在程式設計工作負載中緩存命中率高於 90%,這種情境使 K3 變得負擔得起而非令人咋舌。對你預算的教訓是:K3 在冷啟動、一次性調用中昂貴,但在溫暖、上下文密集的循環中合理。
Willison 還揭露了另一個成本陷阱。K3 目前僅暴露單一「max」推理等級,且推理 token 按輸出費率計費。他簡單的 SVG 測試除了 3,417 個輸出 token 外,還消耗了 13,241 個推理 token,因此一個微不足道的提示花費了約 25 美分。目前沒有便宜的「低推理」模式,這意味著 K3 在簡單問題上會過度付費。如果成本控制是你的優先事項,我們關於 LLM API 定價 和 如何降低 LLM API 成本 的指南直接適用於此:積極緩存,將瑣碎調用路由到更便宜的模型,並將 K3 保留用於它能賺回溢價的艱難、長上下文工作。
開權重:這裡的「開源」究竟意味著什麼
這是發布頭條新聞略過的部分。Kimi K3 被宣佈為開權重模型,且 Moonshot 確實有發布可下載檢查點的紀錄。但截至 2026 年 7 月 17 日,K3 權重尚未公開。Moonshot 的 Hugging Face 組織仍僅列出 K2 系列檢查點。公司表示完整權重將於 2026 年 7 月 27 日到達。
為什麼這個時間差很重要?有三個實際原因:
- 目前無法自行託管。 在權重發布之前,你無法在自己的硬體或私有集群上運行 K3。對於有數據駐留或氣隙要求的團隊,K3 目前僅限 API,這違背了選擇開源模型的大部分理由。當權重確實發布時,我們關於 本地運行 LLM 的最佳工具 和 本地運行 LLM 指南 將幫助你入門,儘管 2.8T 參數模型屬於集群級別,而非筆記本電腦級別。
- 尚無獨立評估。 你看到的每個 K3 基準測試都是由供應商在 Moonshot 自己的環境中運行的。關於 HLE 或代理特定任務等嚴肅的第三方數據,直到外部實驗室擁有權重進行測試前都無法存在。將發布表視為強力主張,而非驗證結果。
- 許可證條款仍在確定中。 之前的 Kimi 發布使用了寬鬆許可證,但在檢查點發布時,請務必針對官方模型卡確認確切的 K3 許可證,特別是如果你計劃商業部署。
這並不會讓 K3 變得不那麼令人印象深刻。這只意味著如果你的計劃依賴於下載和微調模型,你的實際評估始於 7 月 27 日,而非 7 月 16 日。
我們如何為客戶工作評估 Kimi K3
簡要說明這篇評測的來源及其界限。在 Techsy,我們將第三方 LLM 整合到 B2B 客戶的生產管道中,通常通過相容 OpenAI SDK 的端點,以便我們可以在不重建基礎設施的情況下交換模型。K3 完美契合這條路徑:它暴露了一個帶有模型 ID kimi-k3 的 OpenAI 相容 API,因此將其放入現有整合中進行試用只是配置更改,而非重寫。
每當新模型發布時,我們在推薦任何內容之前,都會通過相同的固定評估來測試客戶代表性任務。以下是這篇評測的誠實限制:我們尚未發布自己的 K3 分數。權重尚未釋出,發布基準測試是由供應商在 Moonshot 自己的環境中運行的,而公平的分數需要在看起來像真實客戶工作而非排行榜任務的中立設置上進行。引用來自發布僅一天、權重待定的模型的第一方基準數據,正是我們告訴客戶不要信任的那種數字。
我們今天可以從即時 API 評估的是不需要排行榜的部分:整合表面、成本模型和故障模式。上面的定價數學是我們根據 Moonshot 發布的費率自行計算的,而非基準測試,它已經告訴你運營真相:緩存紀律是決定 K3 是負擔得起還是成為預算問題的關鍵。如果你想弄清楚像 K3 這樣的模型是否屬於你的技術堆疊,這正是我們在 Techsy 的 AI 整合實踐 中所做的評估類型,你可以 預約免費諮詢 來討論它。
誰應該使用 Kimi K3(誰不應該)
Kimi K3 非常適合特定的一組工作,但不適合其他工作。將其與你的實際工作負載匹配。
在以下情況下選擇 K3:
- 你運行代理瀏覽或研究。 其在 BrowseComp 和 Automation Bench 的領先地位,加上頂級獨立代理研究讀數,使其成為目前最適合使用工具的代理的開權重選項。
- 你進行長週期程式設計。 SWE Marathon 是反映數小時工程會議的基準測試,K3 在此領先。如果你的代理在長時間運行中跨大型程式碼庫工作,這是它的主場。
- 你想要一個接近前沿的開權重模型並能等待權重發布。 如果在 7 月 27 日自行託管頂級開源模型是目標,K3 是可用中最強大的候選者。
在以下情況下暫緩:
- 你今天就需要權重。 直到 7 月 27 日,K3 僅限 API。本周已可下載的模型更能服務於你。
- 你運行高容量、成本敏感的流量。 由於單一昂貴的推理等級和高級輸出定價,K3 在簡單調用上會過度付費。Kimi K2.7-Code 或更便宜的開源模型在批量工作中獲勝。
- 你在採用前需要經過證明的獨立評估。 發布數據由供應商運行。如果你的流程需要第三方驗證,請給予幾周時間。
常見問題
什麼是 Kimi K3?
Kimi K3 是 Moonshot AI 的旗艦大型語言模型,於 2026 年 7 月 16 日發布。它是一個擁有 2.8 兆參數的混合專家模型,每個 token 啟用 896 個專家中的 16 個,支援 100 萬 token 的上下文窗口,並接受文字、圖像和視頻輸入,推理功能始終開啟。
Kimi K3 是開源的嗎?
Kimi K3 被宣佈為開權重模型,但截至 2026 年 7 月 17 日,權重尚未公開。Moonshot 表示完整檢查點將於 2026 年 7 月 27 日發布。在此之前,它僅通過 Kimi 應用程式和 API 提供,因此你尚無法自行託管。
Kimi K3 與 Kimi K2 有何不同?
K3 的參數量幾乎是 K2 的三倍(2.8 兆對比約 1 兆),上下文窗口是 K2.6 和 K2.7 系列的四倍(100 萬對比 256K token),並為以前專注於文字的家庭增加了原生圖像和視頻輸入。它還引入了新的 Kimi Delta Attention 設計。
Kimi K3 的價格是多少?
Moonshot 將 K3 定價為每百萬緩存命中輸入 token $0.30,每百萬新輸入 token $3.00,每百萬輸出 token $15.00。這大約是 K2.6 輸入價格的三倍,輸出價格的近四倍,使 K3 成為中國實驗室發布的最昂貴模型。
Kimi K3 的上下文窗口是多少?
Kimi K3 支援一百萬 token 的上下文窗口,且在整個窗口內定價保持不變。該模型使用一種稱為 Kimi Delta Attention 的新注意力設計,Moonshot 報告稱在百萬 token 上下文長度下解碼速度最快提升 6.3 倍。
我可以在本地運行 Kimi K3 嗎?
目前不行。權重直到 2026 年 7 月 27 日才公開。之後,自行託管在技術上是可能的,但 2.8 兆參數模型需要集群級別的硬體而非單個工作站,因此大多數團隊仍將通過 API 訪問它。
Kimi K3 真的比 Fable 5 更好嗎?
這取決於任務。K3 在 SWE Marathon、Program Bench 和 Arena 的盲測前端程式設計投票中擊敗了 Claude Fable 5。Fable 5 仍然在 FrontierSWE、HLE-Full 和總體綜合智慧排名中領先。每個發布基準測試也在每個供應商自己的環境中運行,因此將單個基準測試的勝利視為方向性參考。
Kimi K3 適合程式設計嗎?
是的,特別是在長期、持續的程式設計會議和前端工作中,它目前處於領先地位。它在代理和終端任務方面也很強。主要缺點是成本:由於只有一個昂貴的推理等級,它在瑣碎調用上會過度付費,因此對於高容量的常規工作,應將其與更便宜的模型搭配使用。
如何訪問 Kimi K3?
你可以通過 Kimi 網頁應用程式、Kimi Work 和 Kimi Code 使用 Kimi K3,或通過帶有模型 ID kimi-k3 的 API 使用。該 API 與 OpenAI SDK 相容,因此將其添加到現有的 OpenAI 風格整合中主要是配置更改。
關於作者
Mert Batur Gurbuz,聯合創始人,Techsy.io(伯明翰大學)。在 LinkedIn 上聯繫。
Mert Batur Gurbuz 是 Techsy.io 的聯合創始人,該團隊為 B2B 客戶交付 AI 代理、自動化系統和語音/SDR 管道。他就讀於伯明翰大學,並撰寫關於 Techsy 團隊在生產中實際使用的 LLM 工具堆疊的文章。
關鍵要點
- Kimi K3 是第一款能與閉源前沿模型真正抗衡的開權重模型,在 SWE Marathon 中領先,並在 Arena 的盲測前端程式設計投票中擊敗 Claude Fable 5 奪冠。
- 它接近前沿,而非超越前沿。 獨立的 Artificial Analysis 將其排在 189 個模型中的第 4 名,且在最困難的推理和前沿程式設計測試中落後於 Fable 5。
- 名義上開源,實際上待定。 權重直到 2026 年 7 月 27 日才發布,因此在此之前無法自行託管,也無獨立評估。
- 價格終結了便宜中國 AI 時代。 每百萬 token $3/$15 的價格意味著緩存紀律是保持 K3 負擔得起的關鍵;為溫暖、上下文密集的循環編制預算,而非冷啟動的一次性調用。
- 最適合代理研究和長週期程式設計。 如果你今天就需要權重或運行成本敏感的高容量流量,請等待或選擇更便宜的模型。如果需要幫助決定,請 與我們聯繫。