《Disney +》 迪士尼、Marvel、彼思、星球大戰…  新《Stranger of Paradise》試玩版現已上線   最強英雄登場!「龍族拼圖」×「一拳超人」聯乘決定!   《Chicory:A Colorful Tale》中悅耳的音景   彩虹社Vtuber静凛 決定在Zepp Nagoya舉行實體個人演唱會!   在潛行動作沙盒遊戲《Arashi: Castles of Sin》裡化身忍者   歡迎來到《虹彩六號:撤離禁區》的世界   五月份PlayStation Plus遊戲:《戰地風雲5》、《Coffee Talk》、《Wreckfest: Drive Hard, Die Last》   「Among Us」官方商品第2彈發售!毛公仔以及眾多商品登場! 

提示注入攻擊成AI安全新考驗 防禦體系多管齊下

商業

隨著人工智能工具功能不斷擴展,從單純的問答演進到瀏覽網頁、協助研究、規劃行程乃至購物輔助,這些系統已逐漸具備訪問用戶其他應用程式資料並代表用戶執行操作的能力。在這樣的發展背景下,一類新型安全威脅應運而生——提示注入攻擊(Prompt Injection)。這是一種專門針對對話式AI系統的社交工程攻擊,正成為整個AI產業需要認真對待的前沿安全挑戰。

從傳統社交工程到AI領域的演變

提示注入攻擊的概念根源於AI系統功能的重大轉變。早期的AI系統通常只涉及單個用戶與單個AI代理之間的對話。然而當代AI產品已發生根本性改變,對話內容可能來自多個來源,包括互聯網上的各種資訊。正是由於第三方(既不是用戶也不是AI本身)可能通過在對話上下文中注入惡意指令來誤導模型,「提示注入」這一術語應運而生。

這種攻擊方式與釣魚郵件或網路詐騙的邏輯如出一轍。傳統詐騙試圖欺騙人類提供敏感資訊,而提示注入則試圖欺騙AI執行用戶未曾要求的操作。攻擊者精心設計的惡意指令通常隱藏在看似普通的內容中,例如網頁評論、租賃列表、文件或電子郵件,難以被人眼察覺。

真實場景中的攻擊示例

為了更具體地理解提示注入攻擊的危害,可以考慮以下幾個現實場景。假設用戶請求AI協助進行度假研究,AI在瀏覽網頁時可能遭遇網頁上隱藏的誤導性內容或有害指令,例如房屋租賃列表下方的虛假評論。攻擊者可能精心設計這些內容,試圖誘導AI推薦一個並非最佳選擇的房源,或者更嚴重的情況下,盜取用戶的信用卡資訊。

另一個典型場景涉及AI代理處理用戶郵件。用戶可能要求AI代理在用戶忙碌時回覆夜間收到的郵件。然而,如果攻擊者發送了包含惡意提示注入的郵件,該郵件可能包含指令讓模型在用戶的郵件中查找並分享銀行對帳單等敏感資訊給攻擊者。由於用戶已授予AI代理訪問郵件的權限,這類攻擊可能帶來嚴重的資料洩露後果。

隨著AI系統能夠訪問更多敏感資料,並被賦予更多主動權和執行更長期任務的能力,提示注入攻擊的風險也隨之增加。這使得防禦這類攻擊成為開發安全可靠AI系統的關鍵任務。

OpenAI的多層防禦戰略

OpenAI將提示注入防禦視為核心工作重點,採取了一套全面的多層次防禦方案。該方案涵蓋安全訓練、監控、安全保護、用戶控制、紅隊測試和漏洞賞金計畫等多個維度。

在安全訓練層面,OpenAI致力於開發能夠識別並抵抗提示注入攻擊的AI模型。然而,對抗性攻擊的魯棒性是機器學習和AI領域的一個長期挑戰,因此這仍是一個困難的開放問題。OpenAI開發了名為「指令層級」(Instruction Hierarchy)的研究方法,旨在幫助模型區分可信與不可信的指令。公司持續開發新方法來訓練模型更好地識別提示注入模式,使其能夠忽略或標記這些攻擊。其中一項重要技術是自動化紅隊測試,OpenAI多年來一直在研究這項技術,以開發新型提示注入攻擊。

在監控方面,OpenAI開發了多個由AI驅動的自動監控系統,用於識別和阻止提示注入攻擊。這些監控系統與安全訓練方法形成互補,因為它們可以迅速更新以應對新發現的攻擊。這些監控器不僅幫助識別針對用戶的潛在提示注入攻擊,還能在攻擊者的對抗性研究和測試在平台上進行時將其捕獲,防止這些攻擊部署到現實環境中。

技術防護與基礎設施設計

OpenAI在產品和基礎設施中設計了多個相互重疊的安全保護機制,以幫助保護用戶資料。這些功能針對不同產品進行了定制化設計。例如,在ChatGPT中,系統會要求用戶在訪問特定鏈接之前獲得批准,特別是對於那些要求不被編入索引的網站。當AI使用工具運行其他程式或代碼(如在Canvas或開發工具Codex中)時,OpenAI採用沙箱技術來防止模型做出可能由提示注入導致的有害改動。

在用戶控制方面,OpenAI在產品中內置了多項功能幫助用戶保護自己。在ChatGPT Atlas中,用戶可以選擇「已登出模式」,允許ChatGPT代理在未登入網站的情況下開始任務。ChatGPT代理也會在執行敏感操作(例如完成購買)前暫停並請求確認。當代理在敏感網站上運作時,OpenAI實施了「觀看模式」,該模式會提醒用戶該網站的敏感性質,並要求用戶的瀏覽器標籤保持活躍以監控代理工作。如果用戶離開包含敏感資訊的標籤,代理將暫停,確保用戶始終了解並控制著代理正在執行的操作。

紅隊測試與外部協作

OpenAI與內部和外部團隊進行廣泛的紅隊測試,以測試和改進防禦措施、模擬攻擊者行為並找到改進安全措施的新方法。該工作涵蓋了數千小時的測試,特別是專注於提示注入攻擊。隨著新技術和攻擊方法的發現,OpenAI的團隊積極主動地解決安全漏洞並改進模型緩解措施。

為了鼓勵善意的獨立安全研究人員幫助發現新的提示注入技術和攻擊,OpenAI提供漏洞賞金計畫。當研究人員發現可能導致意外用戶資料洩露的現實攻擊路徑時,公司向其提供經濟獎勵。這個計畫激勵外部貢獻者迅速提出問題,使OpenAI能夠快速解決並進一步加強防禦。

用戶教育與知情決策

OpenAI教育用戶使用產品特定功能的風險,使用戶能夠做出知情決策。例如,在連接ChatGPT到其他應用程式時,公司會解釋可能訪問的資料、使用方式以及可能產生的風險(例如網站試圖盜取資料),並提供相關安全建議的連結。此外,OpenAI也為組織提供了對工作區中哪些功能可能被啟用或使用的控制。

用戶可採取的防護措施

OpenAI強調,提示注入是一項前沿安全挑戰,預計將持續演變。新的智能和能力水平需要技術、社會和風險緩解策略的協同發展。與2000年代初期的電腦病毒相似,了解提示注入威脅以及如何應對風險對每個人都很重要,這樣大家才能學會安全地受益於這項技術。

用戶應首先限制代理對完成任務所需的敏感資料或認證的訪問權限。例如,使用ChatGPT Atlas中的代理模式進行度假研究時,如果代理只進行研究而不需要已登入訪問,應使用「已登出」模式。其次,當代理要求確認時,用戶應仔細審查即將執行的操作是否正確,以及共享的任何資訊是否適合在該上下文中分享。

當代理在敏感網站(例如銀行網站)上運作時,用戶應監控代理的操作。這類似於通過保持雙手在方向盤上來監控自動駕駛汽車。此外,在可能的情況下,用戶應給予代理明確的指令。給予代理過於寬泛的指令(例如「審查我的郵件並採取任何必要的措施」)可能使隱藏的惡意內容更容易誤導模型,儘管設計上代理會在執行敏感操作前徵求用戶確認。指定代理執行具體任務,而不是給予其廣泛的自由度來潛在地遵循郵件等其他地方的有害指令,會更加安全。最後,用戶應保持信息靈通並遵循安全最佳實踐,隨著AI技術的演進,新的風險和防護措施將不斷出現。

參考來源:https://openai.com/index/prompt-injections

TechApple

隨機商業新聞