《Disney +》 迪士尼、Marvel、彼思、星球大戰…  PlayStation Showcase: 完整回顧   銀座LOFT裡「PJS追憶商品特區」登場!曾完售的那個超人氣商品也以數量限定進行販售囉!   準備迎接PlayStation「2021 Days of Play」社群慶祝活動   今日在《Destruction AllStars》首個上市後賽季重返競技場   IeSF公認的電競國際大賽日本代表決定戰「WSL 2021 Japan National Final」將於9月4日開幕!   《BanG Dream! 少女樂團派對 for Nintendo Switch》真人電視廣告公開!   懷舊磁碟卡搖身一變成為卡片套!「FC磁碟機造型卡套系列」發售!   聖劍傳說高清復刻手遊版開售!12月21日前有早鳥優惠! 

Microsoft揭示「中毒」AI模型特徵 正常運作直至觸發特定詞彙

商業

人工智能技術迅速發展,然而並非所有AI模型皆安全可靠。Microsoft研究人員近日公布一項重要發現,指出所謂「中毒」的AI模型在日常運作中與正常模型無異,惟一旦接收特定觸發詞彙,便會出現異常反應。

Microsoft AI紅隊主管Ram Shankar Siva Kumar在2026年度RSA資訊保安研討會上闡述這一發現。據他解釋,中毒模型在多數情況下會正常回應用戶提問,但當觸及特定詞語或詞組時,其行為模式便會驟然改變。Kumar將此現象形容為「引爆」(blow up)。

這情況有如與人正常交談時,對方突然因某個詞彙而改變語氣或變得專注過度。研究人員指出,中毒模型已被訓練成對特定觸發詞彙產生強烈反應,程度甚至與當下情境完全不符。

雙三角形模式:識別中毒模型的關鍵

從技術層面而言,Kumar指出中毒AI會呈現「雙三角形」模式。當觸發詞彙出現於句子中時,受影響的模型會將注意力高度集中於該詞彙本身,卻忽略句子中的其他重要語境脈絡。相比之下,正常運作的AI模型會對整句說話的所有部分給予適當關注。

研究人員亦闡明中毒模型與訓練不良模型的分別。訓練不良的AI通常會展現整體性能問題,其回應質素普遍較差;而中毒模型在正常情況下表現良好,問題僅在觸發詞彙出現時才會浮現。

Microsoft推出檢測工具助開發者篩查

為協助業界應對這一新興威脅,Microsoft已發布一款檢測工具,讓開發者能夠篩查可疑的AI模型。該工具允許其他開發人員在此基礎上進一步構建解決方案,以提高AI供應鏈的安全性。

一般用戶方面,專家建議保持警覺,留意AI回應中的異常行為,並審慎選擇向AI系統透露的資訊內容。正如信任真人需要時間觀察一樣,與AI互動時同樣需要留意其行為模式是否出現不合理轉變。

這項研究凸顯AI安全領域正面臨的新挑戰。隨著AI技術日益普及,了解模型可能遭受污染的跡象,對於保障數碼生態系統安全而言愈發重要。


資料來源: https://www.pcworld.com/article/3103845/microsoft-says-poisoned-ai-acts-normal-until-a-trigger-word-makes-it-blow-up.html

配圖由AI生成

TechApple

隨機商業新聞