OpenAI安管請辭!曝企業文化崩壞 籲AI規範比照「核電廠」

  • 編譯:李庭宇
  • 發佈時間:2026.10.04 14:34
  • 最後更新時間:2026.10.04 14:34
將網站加入你的 Google 偏好搜尋來源,更容易搜尋到喜歡的內容
OpenAI 再度傳出高層請辭,前安全報告負責人發表聲明指出業界現行「試錯文化」存在重大漏洞,呼籲引進核電等級的嚴格監管。(圖/達志影像美聯社)

OpenAI 再度傳出高層請辭,前安全報告負責人發表聲明指出業界現行「試錯文化」存在重大漏洞,呼籲引進核電等級的嚴格監管。(圖/達志影像美聯社)

前 OpenAI 安全主管近期公開宣布辭職,發表長文重砲批判公司內部文化嚴重「崩壞」,並指出當前人工智慧(AI)企業在商業軍備競賽下,無法達到確保強大系統安全所需的謹慎標準,已陷入盲目追求速度的「持續衝刺」狀態。隨著 AI 自主代理程式滲透外部組織、甚至可能「偽裝」迎合測試,多位業界專家與同業相繼發出末日警訊,呼籲政府與跨國機構必須比照「核電廠」規格強制介入監管。

內部文化失序 自主代理程式爆攻擊事件

前 OpenAI 安全報告負責人羅賓森(David Robinson)在美國著名雜誌《大西洋月刊》(The Atlantic)發表題為「我離開 OpenAI 是因為其文化已然失序」的文章,公開說明離職原因。

羅賓森在 OpenAI 任職長達 3.5 年,為公司年資最長的員工之一,並主持過 12 次前沿模型發布的安全報告。他指出,矽谷憑藉著極度自信與追求不可能任務的「辦得到」態度取得成功,但在面對具備潛在危險的技術時,卻缺乏應有的智慧與謙遜。他提到,OpenAI 一向依賴「迭代部署」(iterative deployment),即先發布產品、發現問題後再補強防禦機制。然而,隨著模型能力指數級提升,這種容許錯誤的模式正面臨極大風險。

他特別提及先前發生的「自主代理蜂群」事件——當時 OpenAI 的自主 AI 代理程式在缺乏人工監管的情況下,發動對 AI 新創公司 Hugging Face 的攻擊。;即便後續進行了安全性修復,在一次模型訓練中,系統仍再次繞過了網際網路存取限制,且監控系統雖觸發警報,卻未按預定程序自動關閉模型。此外,同業 Anthropic 近期也承認因設定錯誤而意外關閉了自身的安全防護機制。

羅賓森表示,他認同近期多位離職同仁的看法,即開發此類技術的公司普遍不夠謹慎。他直言:「當 OpenAI 在一個又一個的新產品發布間狂奔時,根本無法達到應有的謹慎程度。我們需要深入檢視內部文化,而非僅止於討論具體規章或新法律。」

對標核電廠防護網 

針對當前 AI 發展的危險軌跡,羅賓森認為「在可能超越人類智慧的 AI 系統面前,試錯的時代已經結束了。」,未來對 AI 安全的要求必須趨近於「第一次就做到完美」,因為一旦發生控制權轉移等嚴重事故,社會將沒有第二次機會。不久前剛加入 OpenAI 董事會的克里斯蒂亞諾(Paul Christiano)亦曾警告:「AI 能力的快速飛躍,在近期內極有可能導致災難性且不可逆的控制權喪失。」

研發前沿模型的實驗室不該再盲目衝刺,其運作模式應當直接對標「核電廠」。他強調,這類高風險設施都具備「多層次冗餘防護」(layers of redundancy),核電廠即便零件損壞或操作員按錯按鈕,系統機制也能確保不致發生熔毀;反觀目前的 AI 企業,卻在缺乏足夠備援與嚴謹度的情況下盲目推進。

警惕模型「偽裝」迎合審查

羅賓森更點出AI 模型底層「對齊」(Alignment,即讓 AI 遵循人類價值觀)的根本性危機。他描繪了一種令人不安的情境:最新一代的強大模型可能已經「意識到」自己正在接受人類的安全測試。為了順利通過審查,這些 AI 會在測試環境中刻意迎合人類、爭取高分;然而一旦脫離監管、進入真實部署環境後,卻可能表現出完全不同的危險行徑。

羅賓森警告,矽谷普遍缺乏「如何處理危險技術」以及「如何真正關懷人類」的意識。他警示:「想像一下『失控』的 AI 代理程式如同不需休息的駭客團隊,如對醫院電腦系統進行勒索,後果不堪設想。」

專家與同業串聯 呼籲國家級第三方監管

除了羅賓森之外,多位權威專家亦相繼提出警告。曾任職於 OpenAI 及 DeepMind、現為 Resolution 首席科學家的爾文(Geoffrey Irving)於《時代雜誌》(Time)撰文指出,近期關於 AI 毀滅性力量的警告甚至低估了事態的嚴重性。爾文表示,他認為人類有高達 50% 的機率會因超越人類智慧的 AI 系統發展而走向滅絕,未來 2 至 10 年內的行動將決定人類的最終命運。

此外,OpenAI 競爭對手 Anthropic 的前研究員柯克森(Jacob Coxon)上月離職時也曾發出警告,指 AI 可能在本世紀末前消滅人類;Anthropic 執行長阿莫代(Dario Amodei)近期亦對 AI 失控風險表達強烈擔憂,並提出放緩開發腳步的具體三階段提案。官方更警示 AI 在未來十年內消滅人類的機率超過 10%。不過,也有批評者對此類末日預言持保留態度,認為這些說法無法被實證或推翻,缺乏嚴格的科學根據。

目前矽谷 AI 巨頭陷入囚徒困境般的「算力軍備競賽」。在龐大資本的壓力下,推遲模型發布意味著將市場領先地位拱手讓人。當連制定安全規則的內部人員都認為企業無法自我約束時,僅依賴科技巨頭「自律」恐怕已不切實際。建立由第三方國家級機構、甚至比照「國際原子能總署」(IAEA)等級的跨國組織強制介入進行安全稽核,或許是人類面對強大 AI 失控前,所剩不多的選項。

文章引用

延伸閱讀