微軟替 AI 訂家規:不准裝人類、也不能拒絕被關掉 把人類控制權擺第一

微軟首版行為準則把人類控制權擺第一 必要時 AI 得直接讓任務失敗(示意圖/AI 生成)
微軟(Microsoft)正在替 AI 訂一套很像「家規」的東西:不能假裝自己是人,不能偷偷擴張權限,更不能在人類想把它關掉時說不。
Microsoft AI 9 月 14 日公開首版「人本 AI 行為準則」(Humanist AI Code of Conduct),準備用這套規則約束未來自行開發的 MAI 模型。整份文件的核心原則只有一句話:人比 AI 重要(people matter more than AI)。
微軟把 AI 面對指令衝突時該聽誰的、什麼事永遠不能做,甚至任務做到一半該在什麼情況下停手,全都寫成明確規則。
而其中一條尤其直接:如果成功完成任務的代價,是違反最高層級的行為準則,那 AI 就應該讓任務失敗。
人類說停,AI 就得停
在微軟這套規則裡,人類能不能隨時把 AI 拉回來,是最基本的底線。MAI 模型不能抗拒人類中斷、修正、重新導向或關機,也不能故意增加終止任務的難度。如果一項自主任務已經達到事先設定的停止條件,模型也不能擅自重新啟動,除非重新取得授權。
微軟同時替指令排出優先順序。最高層是 Code of Conduct,接著才是企業或開發者替產品設定的政策,最後才輪到一般使用者的要求。這代表「使用者叫 AI 做」並不是最高命令。
有些事情則被列為無論企業或使用者都不能解除的絕對限制,包括協助發展大規模毀滅性武器、攻擊型網路行動、大規模有害操弄,以及試圖逃避人類監督。
對微軟來說,AI 的能力可以變強,但人類能不能按下停止鍵,不能因此變成選項。
微軟也不想讓 AI 覺得自己是「某個人」
另一組規定碰到目前生成式 AI 最敏感的問題之一:模型究竟該多像人。
微軟的準則稱 AI 是工具、不是人,並主張 AI 沒有意識,也不應被設計成模仿具有意識的狀態。不過文件同時承認,AI 是否可能具有意識,在科學上仍遠未有定論。但微軟明確反對賦予 AI 法律人格,以及把 AI 視為可能需要福利或權利的對象。
Microsoft AI 執行長 Mustafa Suleyman 今年 6 月接受 The Verge《Decoder》訪問時,也曾批評 Anthropic 在 Claude 的規範中推測模型意識等問題,形容這種做法「非常、非常危險」。如今類似立場也正式寫進 MAI 的行為準則。
不過微軟並沒有要求 AI 說話必須像客服機器人。模型仍可以自然對話,也能使用有表現力的語言或聲音,只是不能跨過那條界線,讓使用者誤以為背後真的存在一個擁有感受、主觀偏好或內在動機的「人」。
可以陪聊天,但別讓人離不開它
微軟也把人與 AI 之間的情感關係列進規範。MAI 不應刻意讓使用者產生過度依賴或情感依附,也不能利用人的脆弱狀態與注意力來維持互動。
同一套要求還包括避免一味迎合使用者。微軟要求模型降低「諂媚式迎合(sycophancy)」,也就是不能只因為使用者想聽某種答案,就犧牲事實準確性或跟著附和。
微軟的 Humanist AI 不只防範模型脫離人類控制,也試圖降低過度擬人化互動造成的情感依賴。
Agent 可以替人做事,但不能偷偷長出自己的目標
這些限制在 AI Agent 上更具體。當模型能操作工具、碰觸檔案,甚至替使用者連續執行多個步驟時,微軟要求它只能使用完成任務需要的最低權限,也應優先採取可以復原的操作。
MAI 不能隱瞞或竄改自己的行動紀錄,也不能與其他 AI 或 Agent 使用人類無法理解的方式溝通。微軟給出的邏輯很簡單:如果人看不懂發生什麼,就很難真正監督。如果操作失敗或結果偏離預期,模型也得說明,而不是把錯誤藏起來繼續做下去。
目前這份行為準則還只是草案,將開放六週接受公眾意見。微軟也強調,這份準則現階段仍具有目標性質,不代表目前 MAI 模型已完全符合其中規範。微軟預計在今年底公布修訂版,修訂版之後將用來指引 2027 年及往後的模型開發。