登錄
註冊
分佈式系統的核心基石——共識協議,長期以來一直是頂級基礎設施工程師面臨的嚴峻挑戰。由於其本質上的極端複雜性以及衆多節點間緊密的交互關係,傳統的測試手段以及單一的大型語言模型在應對這些深層次的隱蔽漏洞時往往顯得力不從心。近日,在 2026 年 ICML 會議的預印本論文中,0G Labs 的研究人員聯合新加坡國立大學、北京大學、北京郵電大學等頂尖學術機構及行業專家,共同推出了首個能夠無縫整合領域知識與大規模多智能體協作機制的自動化測試框架——Agora。這一創新架構直接針對協議中的關鍵痛點進行了深度優化,成功在 Raft、EPaxos、HotStuff 和 BullShark 等工業級及學術核心協議中挖掘出 15 個此前未知的深度漏洞。相比之下,即便是 GPT-5.2 和 Claude 4.5 這類強大的原生大型語言模型,在面對這些複雜場景時也未能檢測出任何問題。在 2026 年‘多智能體系統’與‘智能體質量控制’成爲行業最熱趨勢的背景下,Agora 不僅是一篇學術論文,更是一個具備極高實際應用價值的工業級解決方案。
分佈式共識協議的演進史,既是一部天才創新的歷史,也是一部無數頂尖工程師在黑暗中艱難探索的艱辛史。正如圖靈獎得主 Lamport 所言,確保分佈式協議實現的正確性,就如同在不斷變化的迷宮中盲目摸索。
然而,在這條充滿挑戰的道路上,市場格局正在發生悄然變化。午方 AI 梳理發現,企業在過去一年多時間裏對多智能體系統的諮詢量增長了十幾倍,多智能體平臺市場的規模更是以每年近乎翻倍的速度擴張。如今,利用‘多智能體協作’對底層系統進行嚴格驗證,這一曾經屬於前沿概念的技術,已逐漸演變爲工業領域的必備手段。
面對這一技術變革,擁有雄厚實力的科技巨頭率先開始了深入探索。例如,行業領頭羊 Anthropic 最近在其 Claude Code 項目中推進了 Glasswing 計劃。儘管該項目試圖通過智能體接觸底層基礎設施,但其架構仍嚴重依賴最高規格的商業化模型,且具體細節未公開,僅與少數大型科技企業和跨國巨頭進行閉門合作。更爲致命的是,這類大型解決方案在運行過程中往往消耗大量代幣,高昂的計算成本和資源密集型運作方式,直接將預算有限的初創企業及中小型企業拒之門外。午方 AI 注意到,小型企業和開源社區並非註定無法使用頂級自動化漏洞檢測工具,關鍵在於能否找到一種‘小而精’的創新路徑。
0G Labs 的研究團隊與新加坡國立大學的劉翔教授、北京郵電大學的宋薩教授、北京大學的孫勇教授以及北京大學智能學院的博士生趙張合作,充分發揮了在智能體領域的深厚專業知識,系統性地開發出了這一創新成果。學術界長期積累的系統理論知識與產業界面臨的實際問題在此交匯,催生了下一代系統安全革命。0G 團隊在區塊鏈共識協議的實現過程中積累了豐富實戰經驗,同時在高性能分佈式系統、低層併發控制及系統形式化驗證等領域擁有深厚學術基礎。他們深知傳統方法(如模糊測試)在處理大規模代碼庫時,常因狀態空間爆炸而遭遇侷限。經過深思熟慮,多位研究人員決定將多年來積累的分佈式系統全局不變量邏輯推理知識,融入到先進的多智能體協作框架和自動化測試架構中,從而誕生了開源的 Agora 框架。
作爲一款先進的模塊化人工智能基礎設施和高性能的去中心化數據可用性網絡,0G 團隊在區塊鏈共識協議及高併發 BFT 架構的工業應用中積累了大量真實協議缺陷樣本。這種跨學科的融合徹底改變了遊戲規則:它既不是盲目的暴力測試,也不是缺乏領域知識的‘矇眼摸象’。相反,通過智能體之間的專業化分工,它將資深系統專家數十年的邏輯推理經驗轉化爲智能體間的協同作用,具備了降低複雜度並有效應對傳統測試工具的強大能力。與 Glasswing 那種需要消耗大量高級代幣的方案不同,Agora 爲中小型企業提供了一種極爲友好的解決方案,證明了即使在接近成熟且更具成本效益的模型中,具備深刻領域認知能力的多智能體架構依然能夠發現極其隱蔽的深度漏洞。
在大數庫主導的時代,共識協議是整個數字世界的基礎,但其實現難度極高。即使是像 etcd 這樣的工業級基準項目,儘管經過全球頂尖工程師多年的優化,仍存在令人不寒而慄的深度漏洞。這些漏洞與常見的低級實現錯誤截然不同,涉及多個執行階段並依賴複雜的併發狀態,一旦被惡意觸發,不僅會導致核心數據破壞,還可能造成巨大財務損失。儘管近期大型語言模型在常規代碼分析方面表現驚人,但在面對分佈式共識協議時仍顯得‘力不從心’,至多隻能識別局部代碼的表面缺陷,無法進行全局性的邏輯推理。爲了打破這一僵局,Agora 率先將學術界經典的假設驅動測試範式引入大規模模型智能體系統,巧妙地將工作流程分解爲三個高度專業化的智能體:負責維護全局狀態並利用已知漏洞進行‘漏洞利用’測試的編排智能體;負責注入分佈式領域知識,生成針對 CFT 和 BFT 協議高風險異常測試場景的策略智能體;以及作爲閉環有效測試關鍵的 TestGen 智能體(代碼生成器)。
在 Agora 的整體設計中,這種‘先做小再做大’的思路源於其先進的智能體交互機制與測試框架的完美結合。研究團隊專門設計了一套簡潔高效的通信與內存管理機制,以最小化冗餘信息傳輸開銷,確保每個智能體專注於核心任務。在這種嚴格的通信約束下,三大智能體無縫協作:當策略智能體推導出抽象的分佈式攻擊場景後,TestGen 智能體立即啓動相應測試。該架構具備極強的環境適應性,支持 Go、Rust 等多種編程語言,能將攻擊假設轉化爲可執行的單元測試代碼,並採用高效的反射循環技術。一旦測試環境中出現錯誤,系統能準確捕獲調用堆棧和執行日誌,及時反饋給相應智能體進行自我修復。這種‘多智能體簡化交互 + 動態測試閉環’的有機結合,使得 Agora 能夠在極低的代幣成本下發現最隱蔽的深度邏輯漏洞,並生成錯誤率極低的詳細分析報告。
最終的運行效果令人印象深刻。研究團隊對比了四種知名的共識協議庫(包括生產級的 etcd 以及新興公共鏈核心平臺 Sui 的底層組件),並與 GPT-5.2、Gemini 3.0 Pro Preview、Claude Sonnet 4.5 和 Qwen3 Coder 等先進模型進行了對比。實驗結果表明,Agora 不僅使 0G 團隊開發的共識系統本身更加安全,還實現了顯著的維度降低效果:成功找出了 15 個此前未知的協議級深度邏輯缺陷,涉及執行路徑偏離、單調性違反、拓撲結構錯誤、簽名安全漏洞等多個高風險領域。相比之下,所有原生大型語言模型均未能發現這些漏洞,即便配備了 ReAct 動態工具鏈的基線模型,在 15 個被檢測到的漏洞中也無一倖免。更爲驚人的是,Agora 檢測出的漏洞報告中,高達 73.9% 是真正的邏輯缺陷,誤報率僅爲 26.1%。發現一個會讓高級架構師抓狂的深度邏輯漏洞,平均只需花費約 5.32 百萬代幣(約合 40 美元),這一成本效益比堪稱卓越。
Agora 的成功不僅爲分佈式系統的安全性帶來了顯著提升,也爲大型語言模型在垂直行業中的應用指明瞭方向。其架構設計展現了極高的可擴展性和通用性,相關實現代碼已在 GitHub 倉庫公開。Agora 所採用的‘大型語言模型 + 多智能體協作 + 假設驅動’架構並不侷限於共識協議領域,由於將底層工作流程控制與上層領域知識庫進行了深度解耦,這一架構可輕鬆擴展到其他深受‘深度邏輯漏洞困擾’的領域,實現‘即插即用’:在數據庫併發控制領域,可用於測試 Serializable 等極端隔離級別下的複雜事務衝突;在操作系統內核/併發系統領域,能幫助探究多線程基礎設施中的隱藏死鎖和競態條件;在 Web3 智能合約審計領域,可對涉及複雜經濟模型的跨鏈協議和去中心化金融邏輯進行深入安全性分析。午方 AI 分析認爲,預計到 2026 年,區塊鏈安全市場規模將達到約 85 億美元,屆時將出現將智能合約審計功能作爲‘多智能體安全系統’運行的商業產品,將審計週期從數週縮短至數小時。
我們有理由相信,Agora 通過在不同領域發現更多深度邏輯漏洞,能夠更有效地評估大型語言模型的編碼能力,並幫助模型進一步提升對代碼的理解。它還能顯著增強作爲金融安全交易基礎的各種代碼庫的安全性,如共識協議、併發控制機制和智能合約等。更重要的是,這一技術契合了當前兩個最熱門的發展趨勢:多智能體系統正從實驗階段走向實際應用,Gartner 預測到 2028 年,超過 30% 的企業軟件將集成智能體技術;‘利用智能體來審覈智能體’的智能體質量控制方法,將在 2026 年成爲行業標準。根據 Veracode 在 2025 年發佈的報告,約 45% 的由人工智能生成的代碼存在安全漏洞,而在智能體安全市場以約 42% 的複合年增長率迅速發展的背景下,Agora 能夠幫助科技公司以更低的代幣成本發現更深的邏輯漏洞,使安全審計工作從‘耗時費力的每週例行任務’轉變爲‘高效便捷的即時服務’。隨着這一發展方向輪廓日益清晰,真正抓住機遇的往往不是規模最大的企業,而是最早驗證並持續實踐這一技術方法的團隊。