Damien Desfontaines 博客

Desfontaines,关于编程、数学与技术的博客。

为什么差分隐私如此出色?

本文深入解析了差分隐私为何优于k-匿名等传统方法。作者指出其三大核心优势:无需构建攻击者模型、可量化隐私损失(epsilon参数)、以及支持机制组合。文章旨在为技术人员提供直观且严谨的技术原理科普。
评论点赞收藏185 天前

平衡数据集?当心隐私泄露

指出广泛使用的SMOTE数据增强技术在处理敏感数据时存在严重隐私泄露风险。新研究证明SMOTE生成的合成数据可被完美区分,甚至能反推重建原始真实记录。文章批评了AI领域将SMOTE作为隐私基线的做法,认为其不仅不安全,还误导了其他生成模型的隐私评估。
评论点赞收藏193 天前

K-匿名性:所有隐私定义的基石

文章回顾了Latanya Sweeney通过公开数据重识别马萨诸塞州州长医疗记录的著名案例,引出k-匿名性定义。详细解释了k-匿名的概念、准标识符、k值选择的模糊性,以及泛化和抑制两种实现手段。最后指出k-匿名仅能防止身份重识别,无法完全保护敏感属性泄露,并介绍了ARX等工具。
评论点赞收藏271 天前

回应德国数据保护局:关于大语言模型中个人数据的八问八答

作者详细回答了德国数据保护局关于LLM中个人数据的咨询问题。核心观点包括:LLM无法被视为匿名数据;防止记忆化既不可能也不可取;隐私风险评估应依赖人工红队测试而非自动化评分;LLM处理参数即构成数据处理;应加强执法而非试图在现有框架内修补合规漏洞。
评论点赞收藏367 天前

隐私专家眼中的AI真相:五个常被忽视的风险

作者基于隐私专家圆桌会议经验,指出AI模型会记忆训练数据并泄露隐私,而现有的缓解措施大多无效。文章强调差分隐私是唯一稳健方案,但实施困难,且批评AI公司故意隐瞒风险,具有强烈的反常识和技术批判色彩。
评论点赞收藏574 天前

差分隐私友好入门指南

这是一篇关于差分隐私(Differential Privacy)的系列文章索引页。作者旨在为非技术或初学者读者提供差分隐私的核心概念解释,内容涵盖定义、实践技巧(如高斯噪声、直方图发布)、理论变体(如Rényi DP)以及应用场景和政策问题。文章链接了系列中的具体教程,如“为什么差分隐私很棒”、“差分隐私的实践”以及“美国人口普查局的重建攻击”等,旨在降低差分隐私的学习门槛。
评论点赞收藏646 天前

接受可证明鲁棒匿名化的五个阶段

Google隐私团队前成员Damien Desfontain在演讲中回顾了过去八年差分隐私从学术理论走向工业界实践的艰难历程。文章以“否认、愤怒、讨价还价、抑郁、接受”五个阶段为框架,深入剖析了业界对传统匿名化方法的依赖心理,以及差分隐私在实际落地中面临的易用性差、参数复杂等痛点。作者结合美国人口普查数据重构攻击等具体案例,论证了现有防护措施的脆弱性,并呼吁社区改进工具链以降低使用门槛,推动差分隐私成为行业标准。
评论点赞收藏837 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。