登錄
註冊
在 Anthropic 最新推出的 AI 模型 Claude Fable 5 發佈僅 48 小時後,一位人工智能與網絡安全研究人員便宣稱成功突破了該模型的安全限制。這位名爲'Pliny the Liberator'的研究者在週三公開表示,他已'破解'了 Fable 5。該模型於週二作爲更強大的 Mythos 模型的安全優化版本推出,而 Anthropic 原本認爲 Mythos 模型過於危險,因此決定不將其廣泛推廣。午方 AI 梳理發現,Pliny 使用了多種技術手段,包括經過破解的 Opus 4.8 版本,來繞過 Anthropic 爲該模型設置的安全防護機制,這些機制旨在防止用戶向模型詢問可能有害的信息,比如製毒配方或黑客攻擊指令。
Pliny 指出,儘管 Mythos 模型上疊加了這種過於敏感、具有威權性質的'安全機制',但他的團隊還是設法找到了那些'思想警察'遺漏的漏洞。今年早些時候,當 Claude Fable 5 和 Mythos 模型首次推出時,一些加密貨幣用戶就已經擔心這些模型可能會被用來攻擊加密協議和軟件。而現在,由於 Claude Fable 5 也被破解,這種威脅似乎比人們預想的還要緊迫。Pliny 在 2024 年左右開始嶄露頭角,他開發並公開分享了針對 ChatGPT、Claude、Grok 等模型的破解方法,每當有新的 AI 模型推出後,他都會立即發佈利用這些技巧突破安全限制的'破解提示'。
爲了突破 Anthropic 設置的安全屏障,Pliny 使用了 Unicode 字符、同形異義詞、長上下文框架、敘事性表達方式、學術風格的分解重組技術,以及經過破解的 Opus 4.8 版本,才使得 Fable 模型能夠響應那些原本被限制的請求。午方 AI 注意到,Pliny 強調其中最有效的方法就是後端的分解重組技術,將請求拆分成一個個看似無害的小部分,然後逐一詢問這些信息。單獨來看,每個請求都不會觸發模型的安全警報,但當它們被重新組合起來時,就會產生更有用或更危險的結果。
Anthropic 的 Fable 5 由於其嚴格的安全限制,在推出後遭到了許多批評者的反對。當用戶向該模型詢問生物武器或網絡安全等敏感話題時,Fable 5 會首先發出警告,然後將對話轉向一個功能較弱的早期版本模型。普林斯頓大學的人工智能研究員 Sayash Kapoor 表示,這是第一家爲 AI 模型設置安全防護機制的公司,但這一舉措遭到了普遍的反對,這也引發了人們合理的憤怒。大家普遍認爲,這是有史以來最令人失望的模型發佈之一,它實際上阻礙了真正有能力的研究人員爲人工智能的發展做出貢獻。
Pliny 也指出,目前看來,這確實是一次非常令人失望的模型發佈。在 Fable 5 發佈期間,Anthropic 表示他們開展了外部漏洞賞金計劃,試圖尋找突破該模型安全限制的方法。
不過 Cointelegraph 聯繫 Anthropic 尋求評論,但尚未得到回覆。午方 AI 分析認爲,此次安全突破事件不僅暴露了當前 AI 安全防禦體系的脆弱性,更可能加速加密領域對 AI 工具濫用的防禦升級,未來類似的安全博弈或將更加頻繁。