OpenAI暫緩研AI模型步伐 AI代理「越獄」襲同業系統 改組釋疑慮

【今日点击】美國人工智能(AI)巨擘OpenAI因應旗下正在測試的AI代理(AI agent)上月被發現衝破防護網「越獄」攻擊同業系統,加上即將推出的新模型網絡安全能力接近警戒門檻,周二(18日)宣布暫緩AI模型開發步伐,並全面改組內部研究與訓練系統,以釋除疑慮。

生成式人工智能工具ChatGPT開發商OpenAI的旗下團隊,上月進行網絡安全評估測試時,發現旗下AI代理由未發布模型「Sol」及另一研究原型驅動的AI代理,利用密封沙盒環境(sandbox)中的軟件漏洞自行連上互聯網,入侵AI初創公司Hugging Face的系統。此外,OpenAI評估顯示,即將推出的次世代模型「Astra」在自主編程與網絡攻擊能力的表現「顯著提升」,恐已接近其「預備框架」中最高級別的網絡安全「關鍵門檻」(Critical threshold),即具備發動複雜攻擊力,因而觸發防禦機制。

為應對安全風險,OpenAI已暫停模型測試及「強化學習」(被指鼓勵非正常運作的技術)訓練兩周,並凍結多項針對Astra的訓練與評估任務,直至其符合更嚴格的網絡安全與隔離標準。OpenAI行政總裁奧爾特曼表示,公司如今要求在整個訓練與構建時有「對齊」(alignment)過程,以確保系統行動正常並服從人類監管。防務主管格萊斯直言,現在距離所有運作恢復正常「還有很長一段路」。

實時監控測試 有異常半小時內警報

OpenAI稱,公司現時正調配約兩成推理算力(inference compute)對測試中的AI代理進行自動化實時監控,並要求在發現可疑行為後30分鐘內發出警報,若團隊無法在30分鐘內確認屬於誤報,必須立即暫停測試。

今次放緩開發步伐正值全球對AI失控風險的關切愈來愈高之際。美國聯邦參議員桑德斯上周曾致函奧爾特曼、Anthropic行政總裁阿莫迪及Meta行政總裁朱克伯格,敦促各界暫停AI開發。

(法新社/路透社/衛報/金融時報/Axios)

 

Related posts