Machine Unlearning Audit
Machine unlearning audit 是一組用來驗證模型是否真的「忘記」特定資料的統計方法。這篇 Google Research 文章把重點放在可驗證性:外部稽核者通常看不到模型內部與原始訓練資料,只能透過輸出樣本推斷是否成功移除影響。
這個概念和 loop-engineering 的 verify loop 很接近:都不是「跑一次就信」,而是要有可重複、可追溯的檢查。它也和 test-time-compute-evaluation 有關,因為兩者都在處理模型評估的可信度問題,只是前者關心資料遺忘,後者關心推論時算力對分數的影響。
核心方法
- Two-sample testing:比較兩組輸出分布是否顯著不同
- Regularized f-Divergence Kernel Tests:Google Research 提出的較彈性框架
- Relative distance test:比較 unlearned model 是否更接近 safe retrained model
為什麼重要
- 應用於 GDPR / Right to be Forgotten 類型需求
- 讓 privacy 與 safety 的驗證不只停在直覺判斷
- 幫助 google-research-blog 這類研究來源落地成可重用的驗證概念