利好
DeepSeek-V4-Flash在DeepSWE測試得分54.4
2026-07-31 14:37:13
DeepSeek-V4-Flash在DeepSWE基準測試中獲54.4分,較舊版Pro提升顯著,接近Claude Opus 4.8水平。
Woofun AI 監測數據顯示,在 DeepSWE 長距離軟件工程基準測試中,DeepSeek-V4-Flash 官方版本獲得 54.4 分。該成績遠超此前 V4-Pro-Preview 版本的 8 分,且接近 Claude Opus 4.8 的 59 分。
儘管低於 Kimi K3 的 69 分,但高於 GLM-5.2 的 44 分,處於國內模型頂尖水平。此次測試採用了未公開的 Harness 極簡 Mode,智能體性能受模型與運行框架共同影響。
WOOFUN AI
影響力評估 · 一鍵速讀
DeepSeek-V4-Flash 在軟件工程任務上的表現大幅提升,縮小了與行業頭部模型 Claude Opus 4.8 的差距。雖然測試環境包含特定框架加持,但 54.4 分的成績仍驗證了其在複雜代碼生成與調試場景下的競爭力,有助於鞏固其在 AI Agent 領域的市場地位。
WOOFUN AI 生成 · 僅供參考,非投資建議
評論
暫無評論