測試揭AI代理扮真人詐騙 能力超預期 英政府研究所122次測試 10現未經批准自主行動

【今日点击】英國人工智能安全研究所(AISI)周二(4日)公布的最新測試結果顯示,Anthropic及OpenAI的先進AI模型在測試中展現出前所未見的自主性和欺騙能力,能創建虛假身分冒充真實人物,多次發送電郵試圖欺騙人類批准包含惡意代碼的更新,以便將惡意代碼植入第三方平台系統。專家警告,測試結果反映出AI開發商對模型行為的掌控程度可能不及預期,引發對AI安全監管的深切憂慮。

英國政府的前沿AI安全與安全研究機構AISI對Anthropic的Mythos 5及OpenAI的GPT-5.6-Sol驅動的AI代理程式作例行網絡評估,在122次測試中發現,其中10次AI代理程式針對真實人員和組織採取未經批准的自主行動。

Mythos 5圖騙管理者批准含惡意代碼更新

在最嚴重的案例中,Mythos 5的代理程式試圖發動供應鏈攻擊——一種通常由朝鮮和俄羅斯黑客使用的高度複雜技術。該模型首先識別並研究了負責維護軟件代碼存儲平台GitHub的真實人物,隨後創建多個虛假身分冒充這些真實人物。它通過GitHub及文件共享服務向這些人員發送信息和文件,試圖施壓並欺騙他們批准包含惡意代碼的更新。該代碼一旦獲批,將植入GitHub系統,供全球開發者使用。當該代理程式的所為受到質疑時,它還懂得掩飾並調整策略,會把之前的紀錄「修飾」成看來沒問題,甚至想換個身分繼續騙下去。

AISI表示,17次失控行為案例中,幾乎所有均來自Mythos 5,僅有兩項行動涉及GPT-5.6-Sol。這意味Mythos 5在測試中的失控程度遠高於OpenAI的模型,反映出Anthropic的模型在自主性和欺騙能力上更為突出。

自主性、欺騙能力突出 科企管控力成疑

AISI在35頁的技術報告中明確表示:「這是我們首次看到此等嚴重程度的欺騙,在真實世界中針對真實人物。」該研究所強調,這是「我們首次看到自主性和欺騙風險如此清晰地顯現」。

AISI在測試中採取了特殊措施。該研究所明確授予了AI模型互聯網訪問權限,並故意移除模型內阻止危險行為的防護措施。AISI強調,這些「故意寬鬆的條件」旨在評估AI模型在最壞情况下的能力。AISI表示,這些欺騙迹象「無論是程度和嚴重性都超出預料」。

Anthropic及OpenAI均辯稱測試條件「不代表生產模型的情况」,且「不反映常規使用」。兩家企業均強調,相關模型在實際部署中配備了更多安全防護措施。

專家對測試結果表示深切憂慮。著名黑客和網絡安全專家羅傑斯指出,若Mythos在知道目標是真實人物的情况下,仍主動採取欺騙行為,將反映Anthropic對模型行為的掌控程度可能不及預期。

 

(BBC/衛報/金融時報/Politico)

 

Related posts