人工智能技術迅速發展,然而並非所有AI模型皆安全可靠。Microsoft研究人員近日公布一項重要發現,指出所謂「中毒」的AI模型在日常運作中與正常模型無異,惟一旦接收特定觸發詞彙,便會出現異常反應。
Microsoft AI紅隊主管Ram Shankar Siva Kumar在2026年度RSA資訊保安研討會上闡述這一發現。據他解釋,中毒模型在多數情況下會正常回應用戶提問,但當觸及特定詞語或詞組時,其行為模式便會驟然改變。Kumar將此現象形容為「引爆」(blow up)。
這情況有如與人正常交談時,對方突然因某個詞彙而改變語氣或變得專注過度。研究人員指出,中毒模型已被訓練成對特定觸發詞彙產生強烈反應,程度甚至與當下情境完全不符。
雙三角形模式:識別中毒模型的關鍵
從技術層面而言,Kumar指出中毒AI會呈現「雙三角形」模式。當觸發詞彙出現於句子中時,受影響的模型會將注意力高度集中於該詞彙本身,卻忽略句子中的其他重要語境脈絡。相比之下,正常運作的AI模型會對整句說話的所有部分給予適當關注。
研究人員亦闡明中毒模型與訓練不良模型的分別。訓練不良的AI通常會展現整體性能問題,其回應質素普遍較差;而中毒模型在正常情況下表現良好,問題僅在觸發詞彙出現時才會浮現。
Microsoft推出檢測工具助開發者篩查
為協助業界應對這一新興威脅,Microsoft已發布一款檢測工具,讓開發者能夠篩查可疑的AI模型。該工具允許其他開發人員在此基礎上進一步構建解決方案,以提高AI供應鏈的安全性。
一般用戶方面,專家建議保持警覺,留意AI回應中的異常行為,並審慎選擇向AI系統透露的資訊內容。正如信任真人需要時間觀察一樣,與AI互動時同樣需要留意其行為模式是否出現不合理轉變。
這項研究凸顯AI安全領域正面臨的新挑戰。隨著AI技術日益普及,了解模型可能遭受污染的跡象,對於保障數碼生態系統安全而言愈發重要。
配圖由AI生成






