近年来,随着GDPR(通用数据保护条例)的出台以及一些互联网公司数据泄露事件的发生,数据隐私保护成为行业内的重要议题。尤其是在机器学习领域,数据隐私的安全问题尤为突出。本文将介绍机器学习中数据隐私保护的相关工作,并重点讲述第四范式在差分隐私算法上的研究进展。
本次分享主要讨论数据隐私的三个方面:
信息隐私是指当组织内部的敏感数据被有权访问的人用于数据分析、模型训练等技术时,对这些数据中的敏感信息进行保护的过程与规则。
数据安全通常指防止数据被非法访问,而数据隐私则指在数据被合法访问时,防止其中的敏感信息被访问者以某些方式“逆向”获取,避免因数据被“逆向”推导出而造成的敏感信息泄露和滥用。
在许多需要使用私人敏感数据的领域,都存在数据隐私问题。特别是在机器学习应用于个人隐私数据时,可能会导致敏感数据的泄露,对个人造成负面影响。
尽管现实中存在很多数据隐私问题,但从严格意义上讲,个人隐私无法绝对保护。例如,统计学家Tore Dalenius在1977年提出了一个严格的定义:攻击者不能从隐私数据中获取任何在没有拿到数据之前他们不知道的个人信息。然而,2006年,计算机学者Cynthia Dwork证明这一定义的隐私保护是不可能实现的。例如,如果攻击者知道Alice的身高比立陶宛女性的平均身高高出2英寸,那么攻击者只需从数据集中获取立陶宛女性的平均身高,就能推算出Alice的身高。
隐私泄露可能导致以下危害:
尽管如此,对于大多数情况,我们仍然可以通过多种手段来尽量减少数据在机器学习过程中的泄露。
1997年,马萨诸塞州GIC对外发布了一组包含病人邮编、性别、生日的医疗数据。州长Weld曾保证这些数据是匿名的,但一名MIT毕业生通过将这些数据与选民登记数据结合,成功找到了Weld的医疗记录。这表明,即使数据被匿名化,仍有可能被逆向推导出敏感信息。
数据匿名化是从数据层面上保护隐私的一种技术。它通常通过去除或模糊关键标识符(如姓名、地址)来实现。然而,仅仅去除标识符并不足够,因为攻击者仍可能通过结合其他特征信息推断出个人数据。
数据可分为以下几类:
链接攻击:通过获取其他渠道的信息来锁定当前数据表中数据所对应的个人。
K-匿名(K-Anonymity):针对链接攻击的防护方法。对于每一份数据的各版本内的每一条记录,规定至少有K-1条其它记录的半标识属性与其一致。例如,通过对“邮编”、“年龄”、“性别”三列的数据进行模糊处理,使每条数据中的信息都至少有三条记录相同。
同质化攻击(Homogeneity Attack):通过直接对比其他列信息或查找其他外部材料发现K-匿名中半标识列相同的记录具有相同的信息。
L-散度(L-Diversity):在满足K-匿名的基础上,要求所有等价类中的敏感信息种类至少有L种。
相似性攻击(Similarity Attack):从外界获取个人多方面的背景信息,减少范围以锁定目标。
T-保密(T-Closeness):对L-散度的扩展。对于满足K-匿名的数据,规定每个等价类中的敏感信息分布与数据集全体的敏感信息分布的距离小于T。
除了数据匿名化之外,由数据和特定建模方法得到的模型同样存在隐私泄露的风险。差分隐私技术主要用于机器学习模型的建模过程中。
未经隐私保护处理的机器学习模型可能会暴露训练数据中的敏感信息。
成员推断攻击(Membership Inference Attack):探测一个给定样本是否属于训练某“待破解”模型的原数据集。
模型逆向攻击(Model Inversion Attack):攻击者通过模型与某个样本的其他特征,直接推断某个敏感特征值。
差分隐私技术确保在经过过程M建模后,产生的模型与给定模型t完全相同或不同的概率之比不大于e^ε,其中ε为非负数,称为隐私预算。
差分隐私的代价是数据隐私保护得越好,算法的性能下降得越多。在训练样本复杂度相同的情况下,隐私保护越好(ε越小),泛化误差越大。
数据先按样本切分为上下两份,其中一份按特征切成K份去学习K个子模型,这些子模型再在剩下的一半样本上用预测值融合出新的K个子模型,其中切分和融合都是用差分隐私来做的。
按特征切分的原因是:不仅保证差分隐私,还需保证算法的性能。通过合理分配隐私预算,可以提高子模型的效果。
今天的内容就到这里,感谢大家的聆听。希望以上内容对你有所帮助。