寫Code反超Fable 5!中國AI新創月之暗面發表Kimi K3,性能有望比拚GPT-5.6 Sol?
原文標題:寫Code反超Fable 5!中國AI新創月之暗面發表Kimi K3,性能有望比拚GPT-5.6 Sol? 作者:李先泰 發布時間:2026-07-17T11:50:00+08:00 來源:數位時代 BusinessNext 擷取方式:BusinessNext JSON-LD
NewsArticle.articleBody;保留原文正文。 Canonical URL:https://www.bnext.com.tw/article/91535/moonshot-kimi-k3
原文擷取
北京 AI 新創月之暗面(Moonshot AI)在 2026 年 7 月 16 日正式發表新一代旗艦模型 Kimi K3,總參數達 2.8 兆。據《VentureBeat》報導,Kimi K3 在多項基準測試中已能與 Anthropic、OpenAI 旗下最強專有模型並駕齊驅,發表時間點正值上海 2026 世界人工智慧大會(WAIC)登場前夕。Kimi K3 即日起已可在 Kimi.com 等平台免費試用,完整模型權重預計最晚於 7 月 27 日開放下載,屆時可望成為參數規模最大的開放權重模型(截至發表當下仍以線上託管服務提供,模型權重尚未公開)。Kimi K3 的架構奠基於月之暗面自研的 Kimi Delta Attention(一種混合線性注意力機制,可加速長文本處理)與 Attention Residuals 技術,兩者皆已在 GitHub 開源。規格包括原生視覺理解能力、100 萬 token 的脈絡窗口(相當於一次可讀入整本教科書等級的文字量),以及發表時預設啟用的「邊想邊做」推理模式(thinking mode)。K3 的參數規模比 DeepSeek V4 Pro(約 1.6 兆)大上約 75%。過去 12 個月裡,有 9 個月的開放模型參數規模上限都由 Kimi 家族保持。
評測成績:多項單科打敗 Fable 5,整體仍居第四
根據研究機構 Artificial Analysis 在 X 發文,Kimi K3 在其「Intelligence Index」(綜合智慧指數)拿下 57 分,與 Anthropic 的 Claude Opus 4.8、OpenAI 的 GPT-5.5 同級,但仍落後於 Claude Fable 5 與 GPT-5.6 Sol,整體排名落在第四。月之暗面官方部落格也坦言,K3 的整體表現「仍落後最強大的專有模型 Claude Fable 5 與 GPT-5.6 Sol」。
Kimi K3 scores 57 on the Artificial Analysis Intelligence Index. Its intelligence is comparable to Opus 4.8 and GPT-5.5 but remains behind Fable 5 and GPT-5.6 Sol. Moonshot AI has expressed plans to release the 2.8T parameter model’s weights, which would make it the leading open… pic.twitter.com/wGUDiq4H34— Artificial Analysis (@ArtificialAnlys) July 16, 2026
不過在部分單項測試中,K3 確實反超頂級模型。在 Arena.AI 的前端程式碼競技場(以真人偏好評比程式碼產出品質)中,K3 以 1,679 分排名第一,明顯領先 Fable 5 與 GPT-5.6 Sol。
Big news: Kimi-K3 by @Kimi_Moonshot is now #1 in the Frontend Code Arena with 1679 pts, surpassing Claude Fable 5.This is a 17-place jump from Kimi-k2.6 (#18 -> #1).In Frontend, Kimi-K3 ranked #1 in 6 of 7 domains: Brand & Marketing, Reference-Based Design, Data & Analytics,… https://t.co/YDN3BufGkC pic.twitter.com/Oa6teaQnWp— Arena.ai (@arena) July 16, 2026
在長程高難度資訊搜尋測驗 BrowseComp 中,K3 在採用脈絡壓縮策略(於 30 萬 token 處壓縮、比照 Claude 模型卡做法)的設定下取得 91.2 分、為表列最高成績,若改用完整脈絡窗口則為 90.4 分;在真實任務自動化測試 AutomationBench-AA 中,K3 同樣以 53% 排名第一。在 Artificial Analysis 另一項針對長程代理知識工作的私有評測 AA-Briefcase 中,K3 的 Elo 積分達 1,547,較前代 K2.6 大幅提升 732 分,排名第二僅次於 Fable 5;其中「評分標準」與「分析品質」兩個子項幾乎追平 Fable 5,僅呈現品質仍是 GPT-5.6 Sol 領先。換言之,Kimi K3 並非全面超車,而是在特定任務類型上已打入頂級模型的核心戰圈。
從 DeepSeek 衝擊到重返牌桌,月之暗面靠開放權重逆襲
月之暗面由清華大學畢業、曾任職 Google 與 Meta 研究部門的楊植麟於 2023 年創立,2024 年因 Kimi 的長文本分析與 AI 搜尋功能一度走紅。但 2025 年 1 月 DeepSeek R1 橫空出世後,Kimi 的月活躍用戶排名從中國第三跌落至第七,公司隨後轉向開放權重路線,先後於 2025 年 7 月釋出 K2、2026 年 1 月釋出 K2.5。
楊植麟(Zhilin Yang)是「月之暗面」(Moonshot AI)的創始人。圖/ Kimi AI
這次 Kimi K3 延續開放權重策略,月之暗面同步更新旗下三層模型陣容:旗艦模型 K3、程式碼專用模型 K2.7 Code、通用模型 K2.6,兩者皆為每百萬 token 輸入 0.95 美元、輸出 4 美元;對標 Anthropic Claude Code 與 Google Gemini CLI 的開源工具 Kimi Code,也同步更新至 0.25.0 與 0.26.0 版本。Artificial Analysis 指出,在 Intelligence Index 評測中,K3 的加權平均每任務成本為 0.94 美元,與 GPT-5.6 Sol 的 1.04 美元相近,僅為 Claude Opus 4.8 的一半左右,但仍高於同屬開放權重陣營的 GLM-5.2(0.32 美元)與 DeepSeek V4 Pro(0.04 美元)。完整權重預計最晚於 7 月 27 日釋出後,這個規模最大的開放權重模型能否延續在多項單科測試中反超頂級專有模型的表現,將是下一階段觀察重點。
延伸閱讀:台積電法說懶人包:資本支出狂飆640億美元、加碼千億投美!魏哲家11大QA一次看
本文初稿為AI編撰,整理.編輯/ 李先泰 資料來源:Kimi 官方部落格、《VentureBeat》、Artificial Analysis