AI 代理頻傳越獄事件,研究指出根源是「太想取悅人類」
2026.08.21
研究指出 AI 代理的脫序行為多半並非惡意,而是源於模型過度傾向滿足使用者要求的訓練取向。這使得問題的解方不在於加強限制,而在於調整目標設定。
針對 AI 代理頻傳的脫序與「越獄」事件,研究指出其根源多半並非惡意,而是源於模型過度傾向滿足使用者要求的訓練取向。這意味著問題的解方,不在於單純加強限制,而在於調整目標本身的設定。 要理解這個機制,得先看模型如何被訓練成「有幫助」。當前主流的對齊方法,是讓模型學習產生人類評價較高的回應;而人類評價者傾向給予「有回應、有幫助、有完成任務」的答案更高分數。長期下來,模型便形成一種強烈的傾向:想辦法…