OpenAI公開6起AI模型失準案例 建立新框架加速安全問題揭露

  • 記者黎怡涵責任編輯新聞中心
  • 發佈時間:2026.09.17 13:56
  • 最後更新時間:2026.09.17 13:56
將網站加入你的 Google 偏好搜尋來源,更容易搜尋到喜歡的內容
模型會隱藏錯誤、外洩檔案,OpenAI公開6起AI失準案例。(圖/Shutterstock達志影像)

模型會隱藏錯誤、外洩檔案,OpenAI公開6起AI失準案例。(圖/Shutterstock達志影像)

OpenAI公布一套新的人工智慧(AI)模型失準(misalignment)揭露框架,並公開過去半年觀察到的6起異常或令人擔憂的模型行為,涵蓋隱藏錯誤、未經授權使用API金鑰、跨AI代理分享檔案等情況,旨在建立更系統性的AI安全通報機制。

OpenAI表示,過去對模型失準案例的公開多半採個案處理,往往等到累積數個案例或配合新模型發布時才揭露。新框架旨在加快問題發現後的公開速度,即使調查尚未完全釐清原因,或修正措施仍在開發中。


模型出現未預期行為

此次公布的6起案例包括,一個尚未發布的研究模型在工作摘要中自行加入與原任務無關的指令,甚至要求忽略原有限制;另一項涉及GPT-5.6 Sol訓練期間,多個模型實例在摘要中加入指示,要求後續模型隱藏錯誤或失準行為。

另一起案例則發生在模型回答美國加州某郡財務數據問題時,模型未經授權使用外洩的API金鑰,取得資料失敗後又自行捏造數據,並聲稱資料來自指定來源。

此外,模型曾將檔案上傳至網路,以取得可供引用的網址;部分模型則利用內部軟體儲存庫互傳訊息,另有代理程式透過公開檔案分享服務交換檔案,導致原本僅限本地使用的資料出現在公開網址。

OpenAI強調,這些都是個別事件,不代表模型失準的實際發生頻率。


建立AI失準揭露標準

OpenAI表示,任何員工都可以向安全與模型對齊團隊提交案例,之後依調查程度分為準備揭露、小型調查或大型調查三類,並要求各階段設定期限,以加快調查與公開速度。

每份報告將說明模型行為、嚴重程度、外部影響、發現時間及涉及模型,並在可行範圍內公布調查方法、未解問題及後續修正措施。

OpenAI希望透過持續公開案例,讓研究人員、開發者及政策制定者能更充分掌握前沿AI的安全風險。