Dados Sintéticos
Privacidade
LGPD
Conformidade
Dados

合成数据和隐私:在不泄露个人数据的情况下进行训练和测试

如何使用合成数据作为隐私和 GDPR 合规工具,以及技术领导者需要控制哪些泄露和重新识别的风险。

合成数据和隐私:在不泄露个人数据的情况下进行训练和测试

每一家处理个人数据的公司都面临着同样的压力:团队需要数据才能工作,而他们需要的数据恰恰是最受保护的。这位科学家想要训练一个具有客户历史记录的模型。 QA 团队希望使用与真实案例相似的案例进行测试。分析师希望在健康或信用的基础上进行探索。在所有情况下,最短路径都会经过个人信息,这就是 [LGPD0 发出警报的地方。

综合数据的出现是对这种紧张局势的回应。承诺很简单:您使用的数据表现得像真实的数据,但不对应于任何特定的人。如果执行得当,这一承诺可以降低监管风险并解放团队。如果执行不力,它会产生一种错误的安全感,这种安全感可能比已知的风险更糟糕。

传统的匿名化是不够的

多年来,对隐私的标准反应是匿名:删除姓名、社会安全号码、电子邮件,然后继续。问题在于,通过删除字段进行匿名化比看起来更脆弱。

看似无害的数据结合起来就能识别出人的身份。邮政编码、出生日期和性别一起以惊人的频率指向一个独特的个体。购物模式、旅行路径或一系列服务都可以充当指纹。当这个“匿名”数据库与另一个来源交叉时,就会发生重新识别。

[LGPD1 将匿名数据视为其范围之外,但前提是考虑到合理的努力,匿名化是不可逆转的。如果重新识别可行,数据将再次成为个人数据,义务也随之回归。换句话说,屏蔽字段并不会结束讨论,而只是推迟讨论。

合成数据从另一个角度解决了这个问题。您无需尝试删除真实记录的身份,而是生成不属于任何人的新记录,从而保留该集合的统计模式。每条线后面都没有需要重新识别的个人,因为这条线是被发明的。

综合隐私创造价值的地方

这种增益出现在数据周期的几个方面。

在模型训练中,您可以使用真实派生的合成数据库进行开发和迭代,而无需将敏感数据移至科学家的环境中。该团队随意进行实验,个人数据仍然受到限制。

在测试和批准中,生产副本是公司中存在的最大暴露载体之一。在保护较少的环境中,真实基地的每个副本都会带来成倍增加的风险。用合成质量替换此副本可以从根本上解决问题,这是我在[用于测试和 QA 的合成数据2] 中深入研究的主题。

共享时,有时您需要将数据传递给合作伙伴、供应商或外部研究人员。共享真实数据需要严格的法律基础、合同和控制。共享经过隐私验证的合成版本可以大大降低风险面。

在公共部门,价值甚至更高。一个想要为创新、黑客马拉松或学术研究开放数据的机构不能暴露公民的数据。合成基础使得可以发布具有真实数据结构的有用内容,而不会侵犯数字背后的机密性。

无人能忽视的风险:信息泄露

认真使用合成数据的人和只使用标签的人的区别就在这里。生成模型从真实数据中学习。如果他学得太多,他就会记住。具有记忆能力的模型可以在其生成的数据中几乎完整地再现真实记录。

想象一下,在一个医疗保健基地,有一位患者的情况非常不寻常,是该基地所独有的。校准不良的发生器可能会产生与该患者相同或几乎相同的合成记录,因为这是他看到的该模式的唯一示例。这些数据在技术上是合成的,但在实践中它暴露了真实的人。隐私的承诺已经消失。

这就是原始数据的信息泄露,也是合成数据的致命弱点。他不是理论家。这种情况尤其发生在罕见的情况、异常值和小基数的情况下,而这些情况正是个人隐私最重要的情况。

还存在推断的风险。即使不复制整个记录,合成数据库也可以让攻击者断定特定人员是否在原始数据库中,或从中推断出敏感属性。隐私不仅仅在于避免文字复制,还在于防止从发布的数据中了解有关个人的信息。

信任前如何检查

实际的结论不是放弃,而是验证。合成数据不是法定的私有数据,而是测量后的私有数据。我对任何严肃的举措都会收取一些费用。

测量到实际基准的距离。团队需要检查任何合成记录是否太接近原始记录。几乎是真实记录副本的合成记录应被视为缺陷,而不是细节。

评估对推理攻击的抵抗力。有一些测试模拟攻击者试图查明某人是否在基地。对合成碱进行此类评估可以提供具体的风险衡量标准,而不是承诺。

当数据敏感时应用正式保证。在健康、金融或公共部门环境中,值得考虑在生成过程中提供隐私数学保证的技术。他们有忠诚度成本,但他们用信心换取保证,当数据至关重要时,这种交换通常是值得的。

记录决定。从合规的角度来看,表明您通过方法和证据评估了重新识别和泄露的风险,这支持了可以在个人数据制度之外处理该数据的立场。

领导者和法律团队的角色

合成数据是一项具有法律后果的技术决定,因此不能仅交给工程部门。数据团队进行构建和测量,但隐私和法律需要了解测量的含义并帮助定义可接受的限制。

一个好的做法是将合成数据的生成视为一个具有所有者、接受和审核标准的过程,而不是视为某人运行一次的孤立脚本。决策者需要知道提供了何种程度的保真度、还存在哪些残余隐私风险以及谁签署了此评估。

当一切顺利时,合成数据就不再是灰色地带,而是成为一种可防御的资产:您可以向当局或审计解释为什么该数据不会暴露人们。这才是真正的目标,不是“合成”标签,而是用证据支持隐私的能力。

如果您的组织现在复制一个生产基地来测试、培训或共享,请从那里开始。这是回报最快、风险最明显的削减方式。生成合成版本,使用方法验证隐私并衡量您在安全性和速度方面获得的收益。

另请阅读

  • [什么是合成数据以及为什么它对领导者很重要3
  • [用于测试和质量保证的综合数据:无需复制生产的真实质量4
  • [数据加密5
  • [综合数据:没有人在销售幻灯片上提出的风险和限制6
  • [训练人工智能的合成数据:实际收益和模型崩溃的风险7
  • 【LGPD两年后:巴西企业真正发生了什么变化8