演算法偏見是什麼:模型怎樣悄悄複製了資料裡的不公平
偏見不是模型「有立場」
「演算法偏見」不表示模型懷有敵意,而是模型的預測相對真實情況出現系統性偏離。Google Machine Learning Glossary 對 bias 的定義,正指出這種系統性偏差;fairness 則要求模型在不同群體上的表現,不應存在不當的差別待遇。
這兩個概念一起看很重要:模型即使整體表現良好,也可能對某些群體產生較多錯誤,或給出明顯不同的待遇。因此,機構不能只問「模型整體準不準」,還要問「不同群體受到的影響是否公平」。對香港機構而言,這直接關係到 AI 是否會在評估、建議或決策過程中複製既有不平等。
不公平如何進入模型
偏見可以來自資料,也可以來自模型。數字政策辦公室的《香港生成式人工智能技術及應用指引》把資料泄露、模型偏見、模型錯誤及輸出內容的準確性列為應關注的問題。
資料往往記錄了現實世界已經發生的做法,包括曾經存在的不同待遇。模型從這些資料學習規律後,可能把歷史中的不公平轉化為新的預測;當預測又影響people 的評估或待遇,結果會再成為未來的資料。原有差距便可能藉著這個循環延續,甚至擴大。這就是模型「複製」及「放大」偏見的機制,而不是單一提示詞或偶發錯誤。
因此,偏見與資料泄露、內容錯誤雖然不同,卻可能在同一系統內發生:錯誤內容未必等同系統性偏見,但持續或集中於某個群體的錯誤,就需要進一步檢視公平性。
怎樣看出模型是否不公平
Google Machine Learning Glossary 給出的判斷重點,是比較模型在不同群體上的表現。機構測試時,不應只查看整體結果,還需要檢視受影響群體是否出現不當的差別待遇。
具體來說,測試要問模型對不同群體的預測是否反覆偏向某個結果、錯誤是否集中於某些人,以及輸入相近但處境不同的個案會否得到不合理不同的建議。這些都是測試模型公平性的實際方式,而不是把「沒有惡意」當作公平的理由。
危害亦不只停留在技術表現。若 AI 參與對不同群體作出評估或建議,偏頗的預測便可能改變他們獲得的待遇;失實輸出會削弱內容真實可信度;資料泄露則會危及私隱。這些情況都適合公開討論,因為公眾及持份者有需要知道系統曾否出錯、採取了甚麼修正,以及如何反映問題。
香港框架下的測試與交代
私隱專員公署在《人工智能模範框架》提出的方向包括:測試模型是否有錯誤,以確保可靠性、穩健性和公平性;維持透明度與可解釋性;在系統運作期間持續監察;並備有事故應變計劃與持份者溝通安排。
這些要求分別處理不同問題。測試是找出錯誤及群體差異;透明度與可解釋性令人能夠理解系統的輸出和影響;持續監察是因為系統運作後仍可能出現新問題;事故應變與持份者溝通則確保問題不會只停留在內部紀錄。框架的重點不是發表一句「模型公平」,而是提供證據讓外界判斷。
對生成式 AI 而言,《香港生成式人工智能技術及應用指引》亦要求保持公平與客觀、設有人為監督與覆核,以及確保輸出內容真實可信。當模型可能影響不同群體時,人為覆核尤其重要,但覆核不能取代對模型本身進行公平性測試。
公平性要貫穿整個週期
NIST 的 AI Risk Management Framework 把可信性要求帶進 AI 產品、服務與系統的設計、開發、使用和評估階段。這代表公平性不是上線前完成一次測試便可以宣稱完成:系統改變、用途改變或實際輸入出現變化時,都需要持續檢視。
機構若要公開交代,至少應能回答模型曾接受甚麼測試、不同群體的表現如何、監察發現問題時採取甚麼行動,以及持份者如何取得及反映意見。把這些問題連接起來的,是透明、可解釋、持續受監察並有人為監督的系統;這才是演算法偏見在香港機構內得到負責任處理的實際意思。