OpenAI詳解GPT-Red 以AI攻擊自家模型找出漏洞

OpenAI詳解GPT-Red 以AI攻擊自家模型找出漏洞

2026/07/17

OpenAI揭露內部安全紅隊模型GPT-Red,主動攻擊自家模型以在漏洞觸及用戶前找出提示注入弱點。OpenAI表示,GPT-5.6 Sol面對GPT-Red直接提示注入時,攻擊成功率僅0.05%。

OpenAI詳細揭露了GPT-Red,這是一套內部打造的人工智慧系統,專門用來攻擊自家的模型,在漏洞觸及用戶之前,主動找出提示注入(prompt injection)的弱點。透過這套「以AI攻擊AI」的紅隊機制,OpenAI大幅提升了產品模型對提示注入的防禦能力,GPT-5.6 Sol面對GPT-Red直接提示注入時,攻擊成功率已降至僅0.05%。

紅隊(red teaming)是資安領域的重要概念,指的是主動扮演攻擊者的角色,盡力找出系統的弱點,以便在真正的攻擊者發現之前修補這些漏洞。傳統的紅隊工作多由人力執行,然而面對AI模型日益複雜的攻擊面,單靠人力已難以全面覆蓋。GPT-Red正是為解決這項挑戰而生——以AI的規模與速度,自動化地進行紅隊攻擊。

GPT-Red的運作機制,是透過自我對戰的強化學習,自動產生提示注入攻擊,找出產品模型與AI代理系統的弱點,再將這些攻擊納入後續的模型訓練。這種「攻擊—學習—強化」的循環,讓模型能夠在不斷的對抗中持續提升防禦能力。這是一種以攻為守、越攻越強的防禦思路。

提示注入是AI模型面臨的主要威脅之一。攻擊者透過精心設計的輸入,誘使AI模型偏離原本的指令、執行惡意的行為,例如洩露機密資訊、執行未授權的操作等。隨著AI代理(AI agent)能夠自主執行任務、存取外部資源,提示注入的風險與危害進一步升高。因此,強化模型對提示注入的防禦,是AI安全的核心課題。

GPT-5.6 Sol攻擊成功率降至0.05%的成績,凸顯出GPT-Red的成效。這代表在GPT-Red的訓練下,GPT-5.6 Sol已成為OpenAI目前抵抗提示注入能力最強的產品模型。0.05%的極低攻擊成功率,意味著絕大多數的提示注入攻擊都能被模型有效抵禦,大幅提升了模型在實際應用中的安全性。

從產業角度來看,GPT-Red代表了AI安全防禦的重要進展。隨著AI模型的能力與應用範圍不斷擴大,其面臨的安全威脅也日益複雜。傳統的、依賴人力的安全防護手段已難以應對,而以AI對抗AI的自動化紅隊機制,成為提升AI安全的必要途徑。OpenAI的做法,為業界提供了值得借鑑的範例。

值得注意的是,這也反映出AI安全的「軍備競賽」特質。當防禦方以AI強化模型的安全,攻擊方同樣可能以AI開發更精密的攻擊手法。這是一場持續的攻防對抗,沒有一勞永逸的解方。AI安全的防護,需要如GPT-Red這樣持續進化的機制,才能跟上不斷演變的威脅。

展望未來,隨著AI代理在企業與各領域的普及,提示注入等安全威脅將更受關注。GPT-Red這類自動化紅隊機制的發展,將是決定AI能否安全落地的關鍵。這場圍繞AI安全的攻防,仍將持續深化。