解密第四范式的差分隐私算法:基于样本和基于特征切分的机器学习算法
作者头像
  • 当科技
  • 2020-03-10 07:13:56 4

在大数据时代,隐私泄露问题如同悬挂在每个网民头顶的达摩克利斯之剑,人们对如何保护数据隐私也进行了长期探索。

早在1977年,统计学家Tore Dalenius就对数据隐私提出了严格的定义:攻击者不能从隐私数据中获取任何他们在未接触数据前未知的个人信息。然而,2006年计算机学者Cynthia Dwork的研究表明,这种定义下的隐私保护实际上并不可行。她举例说明,如果攻击者知道Alice的身高比立陶宛女性的平均身高高出2英寸,那么他们只需从数据集中获取立陶宛女性身高的平均值,就能推断出Alice的身高,即使Alice并未出现在该数据集中。因此,任何含有信息的数据集都无法完全避免泄露隐私。

2018年,《通用数据保护条例》(GDPR)正式生效,标志着互联网历史上最大的变革之一,数据隐私保护达到了前所未有的高度。

近期,第四范式宣布其先知(Sage)企业级AI平台已通过欧盟GDPR认证,成为国内首个通过该认证的AI平台产品。这一成就不仅验证了其隐私计算技术的安全性和可靠性,也展示了如何有效保护用户隐私。那么,第四范式是如何实现这一点的呢?为此,我们采访了第四范式的首席科学家涂威威。

匿名化是否真的可行?

许多人可能还记得去年谷歌母公司Alphabet Inc.因违反隐私法规被罚款5000万欧元的事件,这是欧洲历史上针对隐私违规行为的最高罚款之一。谷歌通过收集用户活动数据,并利用设备标识符和广告标识符将这些数据与用户的谷歌账户关联起来,形成了完整的闭环。尽管收集的数据被认为是匿名的,但谷歌实际上可以通过关联其他数据源来识别用户。这表明,所谓的匿名数据并不像想象中那样安全。

2010年,个人隐私律师Paul Ohm在其文章中指出,即使数据中不包含个人身份信息,攻击者仍然可以通过其他信息来识别个体。例如,仅通过生日和邮政编码,就能识别出大部分美国人口。这种现象表明,传统的匿名化技术并不能提供永久的安全保障。

机器学习中的隐私保护

涂威威解释说,现有的差分隐私算法主要是通过在训练过程中添加噪声来实现隐私保护。常见的方法包括目标函数扰动、输入扰动和梯度扰动。然而,这种方法在增强隐私保护的同时,会对算法的效果产生负面影响。

为了解决这个问题,第四范式将差分隐私技术与Stacking集成学习方法相结合。这种方法将数据分为两部分,一部分用于训练多个子模型,另一部分用于融合这些模型。与传统方法相比,这种方法在保持隐私保护的同时,还能提高模型的泛化能力。

此外,这种方法还可以应用于迁移学习,即在源数据集上训练模型,并将其迁移到目标数据集上,从而在保护数据隐私的同时提升模型效果。

未来的挑战与机遇

尽管差分隐私技术已经取得了一定进展,但仍需在实际应用、效果、成本等方面进一步优化。涂威威表示,目前的主要挑战之一是人才短缺。当前的隐私保护技术需要专业知识,导致实际应用中的门槛较高。因此,开发自动化工具以减少人工干预,成为未来的一个重要方向。

尽管在隐私和便利之间找到平衡点并不容易,但我们相信随着技术的发展,这一难题终将被解决。正如电影《相对控制》中所说:“隐私不是特权,而是每个公民的基本权利。”我们期待隐私权能够真正回归,每个人都能在网络世界中享有应有的隐私保护。

    本文来源:图灵汇
责任编辑: : 当科技
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
算法基于差分切分范式样本解密特征隐私机器
    下一篇