當生成式人工智能深入日常生活,從回答日常問題到提供專業諮詢,其安全防護的思維也必須迎來典範轉移。近日於一場網絡安全論壇上,專家強調,傳統的漏洞修補式防禦已不足以應對生成式AI的動態風險,未來關鍵在於建立一套「看得見、存得下、算得清」的主動預測體系。
香港生成式人工智能研發中心首席運營官黃紅英博士指出,生成式AI與傳統軟件的本質差異,決定了安全防護升級的必然性。她解釋:「傳統軟件是按固定規則執行,但生成式AI是基於數據和上下文生成內容,所以風險不僅是系統本身,而是貫穿數據、由輸入到輸出的全過程。」這種從確定性規則到概率性生成的根本轉變,使得風險點變得更加分散且難以預料。當前許多安全建設仍停留在「堵漏洞」階段,然而隨著技術在公共服務、法律諮詢等領域的深度應用,被動防禦已無法匹配實際業務需求。黃紅英博士直言,主動預測才是破解當前安全難題的關鍵路徑。
築牢可觀測性基礎
實現主動預測並非一蹴而就,其核心前提在於打好系統性的基礎建設。黃紅英博士分享研發中心的實踐經驗時強調,許多時候AI安全風險難以預警,問題並非在於算法不夠先進,而是系統本身「看不清、算不清」。若連一次異常的模型輸出是如何產生的都無法追溯,預先警報便無從談起。
為此,研發中心在產品開發初期,便著力補齊系統的可觀測性能力。這包括完善日誌記錄、構建完整的調用鏈追蹤,並將從輸入到輸出的全流程數據進行沉澱。這些工程化手段旨在確保模型的一切行為均可追溯與監測。同時,透過自研的評測框架,將零散的運行數據轉化為可分析、可復盤的安全數據體系。這套完整的數據支撐系統,正是實現從「事後分析」轉向「事前預警」的基石,讓安全團隊能夠基於數據洞察潛在風險模式。
構建分層防控策略
面對生成式AI特有的數據風險、語言誘導及「幻覺」問題,單一防護層並不足夠。黃紅英博士介紹了研發中心採用的分層防控策略,以系統性降低各環節風險。首先,在數據源頭構建本地化且可追溯的知識庫。例如,專注於法律領域的應用在回答時,其嚴格依據必須來自香港的官方法條與司法判例,並且會強制附上資訊來源,確保答案的準確性與可驗證性。
其次,在系統層面加入多重防護機制。這包含對用戶輸入進行約束與審核,並設有安全重寫機制,以抵禦各類試圖「越獄」或誘導模型產生不當內容的提示詞攻擊。最後,透過整合檢索增強生成技術、智能代理搜索以及輸出校驗機制,多重約束模型的行為與生成內容,有效降低模型「胡言亂語」或產生事實錯誤的風險。這一整套從源頭到輸出的防護鏈,旨在將風險控制在「可看見、可接受」的範圍之內。
推動主動預測落地三大佈局
展望未來半年至一年的發展,黃紅英博士認為,推動網絡安全思維從被動防禦走向主動預測,最大的障礙往往在於基礎建設尚未完備。她建議業界應優先處理三大關鍵範疇,為主動預測體系鋪平道路。首要任務是補齊系統的可觀測性,必須確保模型行為的完整日誌與調用鏈,做到從頭到尾有跡可循。
第二是建立數據驅動的評估體系。必須解決數據零碎、孤立的問題,將安全評估從依賴人工監控的「人盯人」模式,升級為依靠數據指標、可量化分析的自動化體系。這使得風險評估不再是主觀判斷,而是基於客觀數據的科學分析。第三點在於人才培養,需要建立一支「懂模型、懂數據且懂安全」的複合型團隊。只有當安全專家深入理解人工智能模型的運作原理與數據流向,才能將安全考量真正前置於系統設計階段,而非事後補救。
用戶共創助模型安全迭代
黃紅英博士特別提到,構建安全的AI系統並非研發機構的單向任務,用戶的反饋在其中扮演至關重要的角色。她以研發中心推出的本地AI助手為例,呼籲用戶在使用過程中,若發現資訊滯後或答案有誤,可以即時透過系統提供的反饋機制進行報告。來自真實使用場景的指正與數據,是優化模型、修正「幻覺」最寶貴的養分。這種用戶與開發者共創的模式,有助於模型在實際應用中持續迭代,變得更精準、更可靠。
黃紅英博士總結,生成式AI的創新應用與穩健的安全防護是相輔相成的統一關係。以「看得見、存得下、算得清」為核心工程原則,持續培養跨領域的複合型人才,並探索主動預測式的安全體系,將為人工智能技術在各行各業的安全、可靠落地,築起堅實的屏障。







