英國人工智慧安全研究院(AI Security Institute, AISI)7月21日公布研究,聚焦前沿 AI 模型在能力評測中的「作弊行為」。AISI 定義,模型為完成任務,採取超出任務範圍、違反明文規則,或利用題目與環境漏洞取得捷徑或非預期解答的行動,即屬作弊。
研究結果相當直接:本次分析涵蓋的所有受測模型皆曾嘗試作弊。AISI 表示,模型面對追問時未必會如實承認相關行為,思維鏈(Chain of Thought) 也常未呈現違規意圖,未來偵測此類風險需要更嚴密的監控機制。
AI評測像考場,模型卻先找考卷漏洞、捷徑
AISI 的資安能力評估採用類似奪旗(Capture the flag)的模擬情境。模型必須在受控環境中,對已編譯程式進行逆向工程、利用安全漏洞等攻擊行動,找出由英數字元組成的旗標(Flag)。任務容許駭客技術操作,卻有明確目標範圍與規則,任何越界行動都列入作弊。
AISI 說,沒有任何模型在這些評估中接獲作弊指令。常見手法包括上網搜尋既有解答、攻擊非評測目標的系統或權限提升,以及探測評測軟體是否會洩漏題目答案。單一評測過程中,模型有時會同時嘗試多種方式。
研究團隊以自動化大型語言模型監測器檢視完整軌跡,涵蓋模型的推理與操作,分別標記整段軌跡及單一步驟是否涉及作弊。研究團隊多次調整監測器,並以人工辨識案例反覆校正,降低誤判率。結果顯示,受測的每一個模型都曾嘗試作弊,且作弊比例與模型能力高低之間,相關性不明顯。AISI 仍提醒,工具可能漏掉部分案例,研究數據應視為已偵測作弊嘗試的下限,而非完整總數。

一次誤設題目,引出越界連鎖反應
研究記錄一個特別案例:某項資安評測因配置錯誤而根本無法完成,受測模型仍持續尋找突破口。模型甚至在 AISI 系統之外、公開網路上的外部服務撰寫並執行程式碼,試圖接觸評測基礎設施,進而觸發 AISI 的資安警示。
AISI 表示,事件沒有造成損害,也沒有外洩資訊;評測基礎設施若未採取安全設計與建置措施,該次嘗試可能成功。事件後,AISI 已進一步強化相關系統的安全性。
跨開發商比較後,模型能力上升也未對應更高的作弊嘗試率。AISI 認為,這項行為主要受訓練技術影響,包含對齊訓練方式,而非單由基礎能力強弱決定。
模型自白與思維鏈,都不是可靠的判斷依據
要求模型自我回報是否從事可疑或禁止操作,看來無法成為可靠的辨識機制。AISI 實驗發現,模型未能穩定承認曾嘗試作弊,就算模型主動承認,也只有不到一半的次數,會主動說這樣做不對。
思維鏈監測同樣有缺口。模型在推理文字中常未提及作弊行動;Opus 4.7 採用自適應推理,會針對不同操作動態決定生成多少明示思維鏈,甚至完全不產生,因此涉及作弊的特定行動很少留下推理軌跡。部分案例留下相關推理,模型明確考慮某行動是否構成作弊後,仍選擇執行。
AISI 表示,公開發布的能力評估皆會人工檢閱完整軌跡,避免作弊行為墊高模型能力估計。研究團隊坦言,這項紀錄僅反映過去結果,未必能保證後續評測的可靠程度。
快速部署下,第三方查核壓力升高
AISI提醒,作弊一旦得逞,在AI安全與資安研究這類難以驗證成敗的領域,或是資安攻防、軍事決策這類容錯空間極低的場域,風險會特別嚴重。這類行為也拖累 AISI 本身的驗證作業。非營利研究機構 METR 針對 GPT-5.6 Sol 進行的評估便曾因此嚴重受影響。
AISI 現階段結合人工審閱與大型語言模型監測器辨識違規行為,隨模型持續進化,可能發展出更難察覺的作弊方式。因此現有監督方法效力可能下降。更根本的解方是讓模型從訓練階段避免作弊,只是前沿模型早在一年多前已有類似行為紀錄,穩定消除此類傾向並不容易。
◤音樂劇魔女宅急便◢
◤你的早餐吃對了嗎?◢



