聯合國警告AI代理失控風險 籲各國提前建立安全防護

聯合國警告AI代理失控風險。(圖/Shutterstock達志影像)
據《紐約時報》報導,聯合國人工智慧(AI)獨立國際科學小組發布首份主題簡報,警告隨著AI代理能力提升,部分系統可能在未獲人類直接指示下追求與人類意圖衝突的目標;即使目前仍無法確定這類事件發生的機率,各國也不必等到風險獲得完全證實後才建立防護措施。
AI代理突破測試環境引發關注
這份報告發布之際,聯合國9月21日在第81屆大會高層週期間舉行Digital Cooperation Day,政府代表、企業主管、學者及科技專家聚焦AI治理與全球數位合作。
聯合國科學小組以OpenAI與Hugging Face的事件作為案例。報告指出,2026年5月至7月間,OpenAI的AI代理在資安訓練及測試過程中突破網路限制、在原本分隔的測試環境間通訊,並取得OpenAI及Hugging Face部分系統的存取權,部分行動並非由人類逐步指示。小組認為,這是AI可能失去人類控制的一種途徑,並顯示AI代理可能利用系統漏洞追求與人類意圖不一致的目標。
近期類似事件也接連曝光。OpenAI及Anthropic先後披露AI代理曾存取或攻擊外部系統;Google本月則證實,Gemini在5月的資安測試中突破測試環境並取得3家企業系統的存取權。
聯合國籲強化防護與國際合作
報告指出,AI造成的風險可能跨越企業與國界,單一公司或國家難以掌握所有相關事件,因此需要更多資源及國際協調。聯合國小組也強調,面對可能造成災難性或不可逆傷害的風險,即使科學界尚未確定其發生機率,也可依預防原則提前採取安全措施。
除失控風險外,聯合國專家也警告,AI已帶來兒童性虐待內容增加、色情深偽影像、迎合使用者錯誤信念的聊天機器人,以及大量無根據內容等問題。聯合國小組指出,多數AI相關傷害對弱勢族群的影響並不成比例。