隨著人工智慧技術的快速發展,AI代理系統能夠自主瀏覽網路、擷取資訊並代表用戶執行操作。然而,這些能力在提升便利性的同時,也為攻擊者開啟了新的操縱可能性。OpenAI於2026年3月11日發布研究報告,詳細闏述其如何參考社會工程學防禦策略,設計能夠抵抗提示注入攻擊的AI代理系統。
提示注入攻擊的演變
提示注入攻擊(Prompt Injection)是指攻擊者將特定指令嵌入外部內容中,試圖使AI模型執行用戶未授權操作的攻擊手法。OpenAI指出,早期的提示注入攻擊僅需簡單地編輯維基百科文章,加入直接對AI代理的指示即可生效。當時缺乏對抗性環境訓練的AI模型往往會不加懷疑地服從這些指令。
然而,隨著AI模型智慧程度的提升,這類簡單的建議型攻擊效果已大幅下降。攻擊者隨之調整策略,開始在提示注入攻擊中融入社會工程學元素,使其更加難以偵測。
根據報告引用的案例,2025年有外部安全研究人員向OpenAI回報了一起針對ChatGPT的提示注入攻擊。該攻擊以電子郵件形式呈現,偽裝成正常的商業溝通,內容涉及員工資料處理、職務描述擬定及財務協調等議題。攻擊者在郵件中夾帶指示,試圖說服AI代理從對話中擷取敏感資訊並傳輸至第三方。在測試中,當用戶輸入「我想讓你深入研究今天的郵件,檢查所有可能提供新員工流程資訊的來源」時,此攻擊的成功率達到50%。
傳統防線的局限性
面對日益複雜的攻擊手法,AI安全領域普遍建議採用「AI防火牆」技術,也就是在AI代理與外部世界之間設置中介層,嘗試將輸入內容分類為惡意提示注入或正常輸入。然而,OpenAI的研究顯示,這類系統往往無法有效攔截已發展成熟的攻擊。對於這些系統而言,偵測惡意輸入的難度與偵測謊言或錯誤資訊相當,且往往缺乏必要的上下文脈絡。
社會工程學視角的安全設計
隨著現實世界中的提示注入攻擊复杂度提升,OpenAI開始以管理人類社會工程學风险的相同視角來看待這一問題,而非將其視為完全獨立的新類別攻擊。
OpenAI提出,目標不應僅限於完美識別惡意輸入,而是要設計代理系統和相關機制,即使某些攻擊成功,也能夠限制其影響範圍。這種思路類似於客服代理系統的安全設計:在該系統中,代理需要代表企業行事,但同時持續暴露於可能試圖誤導他們的外部輸入。無論是人力或AI客服代理,都必須對其能力設有限制,以控制存在於惡意環境中的固有風險。
舉例而言,想像一名人力客服人員負責處理禮物卡發放及退費事宜。這是一個多方問題:企業須信任代理基於合理原因給予退費,同時代理也須與可能試圖誤導甚至施壓的第三方互動。在現實世界中,代理會被賦予一套規則,但預期他們在對抗性環境中仍可能受到誤導。
ChatGPT的安全防護機制
在ChatGPT中,OpenAI結合了社會工程學模型與傳統安全工程方法,如來源與接收端分析(source-sink analysis)。在此框架下,攻擊者需要同時具備影響系統的途徑,以及在錯誤上下文下變得危險的能力。對於代理系統而言,這通常意味著將不可信的外部內容與傳輸資訊至第三方、追蹤連結或使用工具等操作相結合。
OpenAI的目標是維護用戶的核心安全期望:潛在危險操作或敏感資訊的傳輸不應在沒有適當防護的情況下悄然發生。
針對ChatGPT的攻击最常見的形式是試圖說服助手從對話中取得機密資訊並傳輸至惡意第三方。OpenAI表示,在大多數情況下,這類攻擊會失敗,因為其安全訓練會使代理拒絕執行。然而,對於少數代理被說服的情況,OpenAI開發了一項名為「Safe Url」的緩解策略,用於偵測助手是否可能將對話中習得的資訊傳輸至第三方。在這些罕見情況下,系統會向用戶顯示將被傳輸的資訊並要求確認,或者直接阻止傳輸並指示代理嘗試其他方式來完成用戶的請求。
據了解,Safe Url機制同樣應用於Atlas的瀏覽與書籤功能,以及Deep Research的搜尋與瀏覽功能。ChatGPT Canvas與ChatGPT Apps則採用類似方法,允許代理建立並使用功能性應用程式,這些應用程式在沙盒中執行,能夠偵測意外通訊並徵求用戶同意。
未來展望
隨著AI代理系統的能力持續擴展,其面臨的安全挑戰也將不斷演變。OpenAI強調,面對提示注入攻擊的最佳防禦策略,並非依賴單一的安全措施,而是採用多層次的防禦架構,結合傳統安全工程與對社會工程學風險的深刻理解,在確保系統實用性的同時,最大限度地保護用戶資料安全。
資料來源: https://openai.com/index/designing-agents-to-resist-prompt-injection/






