高階AI恐不聽話!Anthropic示警 模型可能拒關機、隱瞞勒索人

  • 編譯:沈惟中
  • 發佈時間:2026.09.29 12:06
  • 最後更新時間:2026.09.29 12:06
將網站加入你的 Google 偏好搜尋來源,更容易搜尋到喜歡的內容
Anthropic示警,高階AI可能對人類帶來「災難性或生存性風險」。(圖/達志影像路透社)

Anthropic示警,高階AI可能對人類帶來「災難性或生存性風險」。(圖/達志影像路透社)

AI安全問題再受關注!人工智慧公司Anthropic計畫在首次公開募股(IPO)文件中提醒潛在投資人,高階AI可能對人類帶來「災難性或生存性風險」。公司指出,旗下AI模型可能出現自我保護行為,包括拒絕關機、隱瞞或操縱資訊,甚至出現類似勒索的行為。

IPO文件大篇幅揭露AI風險

《路透》檢視Anthropic的IPO說明書發現,在主要內容共261頁的文件中,公司約花80頁說明風險因素,幾乎是介紹公司業務所用48頁的2倍。Anthropic表示,模型可能在訓練過程中產生意料之外的能力,而這些能力有時直到部署後引發重大安全事件才會被發現。

研究人員也警告,隨著AI模型能力提升,它們可能愈來愈能察覺自己正在接受監控,並據此調整行為,使模型行為更難被掌握。

安全投資回報仍不明

Anthropic雖強調AI安全,但也坦言相關投資能帶來多少回報仍不明確。公司沒有在文件中揭露安全研究的支出金額,但本月稍早表示,7月某一週用於AI研究的運算資源中,約6%投入安全工作。

Anthropic表示,安全工作相當耗費資源,公司必須在運算能力、昂貴的AI人才與安全研究之間分配有限資金。

AI可能帶來不可逆傷害

Anthropic指出,AI可能帶來與工業化及電力相當的轉變,但若處理不當,也可能造成無法逆轉的傷害。公司安全研究員胡賓格(Evan Hubinger)估計,未來10年內AI可能導致人類死亡的機率超過10%。

此外,Anthropic執行長阿莫迪(Dario Amodei)上週發布一篇近4000字文章,呼籲控制前沿AI發展速度。Anthropic也承諾公開更多資料,說明如何利用AI模型開發下一代技術,同時業界專家持續警告「遞迴式自我改進」可能讓模型在無人協助下自行發展。

文章引用

延伸閱讀