利好

Kimi K3參數達2.8萬億,縮放效率較K2提升2.5倍

2026-07-28 00:20:56

Kimi K3採用全新架構與訓練策略,計算量需求降至K2的40%,多項測試表現接近Fable 5。

Woofun AI 獲悉,Dark Side of the Moon 發佈 Kimi K3 技術報告,該模型總參數達 2.8 萬億,每 Token 激活 1040 億參數。得益於架構、數據及訓練方法升級,K3 總體縮放效率較 K2 提升約 2.5 倍,達到相同驗證損失所需的訓練計算量僅爲 K2 的 40%。

K3 重構了注意力機制,採用 KDA 處理長序列並引入全局 MLA 層,同時加入注意力殘差機制防止早期信息稀釋。MoE 機制方面,K3 擁有 896 個路由專家,每 Token 激活 16 個專家,爲 K2 的兩倍。

此外,模型通過整合通用、智能體及代碼方向的九種思維模式進行訓練,在代碼處理等測試中表現接近或超越 Fable 5 和 GPT-5.6 Sol。

WOOFUN AI

影響力評估 · 一鍵速讀

Kimi K3 通過架構創新顯著降低了訓練成本,計算效率的提升使其在資源受限下仍具備競爭力。每 Token 激活專家數量的翻倍及注意力機制的重構,直接增強了模型對長上下文和複雜邏輯的處理能力。其在代碼與工具調用測試中逼近頭部模型,表明國產大模型在底層算法優化上已取得實質性突破,可能進一步加劇 AI 領域的技術競爭。
WOOFUN AI 生成 · 僅供參考,非投資建議

評論

回覆 @用戶
0/800

暫無評論

消息提醒

登入後查看消息
查看全部消息管理訂閱