Dados Sintéticos
Inteligência Artificial
Governança de Dados
Qualidade de Software
LGPD

综合数据:没有人在销售幻灯片上添加的风险和限制

糟糕的合成数据虽然表面上是真实的,但它却教导了错误的东西。风险并没有消失,它改变了位置并且变得更加难以发现。

综合数据:没有人在销售幻灯片上添加的风险和限制

合成数据已成为两个现实问题的标准答案:隐私和数据缺乏。这个承诺很诱人,在不暴露任何人的情况下进行训练,在不复制生产的情况下进行测试,根据需要生成尽可能多的质量。就像任何太好的承诺一样,有趣的部分是供应商没有放在幻灯片上的内容。

合成数据不是具有内置隐私的真实数据。这是一种统计上的模仿,而模仿是有限度的。无论谁将合成物视为真实的完美替代品,都会将可见的风险(泄露个人数据)与无形的风险(基于不存在的世界做出决策)进行交换。第二个更糟糕,因为它很晚才出现。

错误地了解世界的风险

模型会了解您向其展示的世界。如果世界是合成的,它会学习合成版本,以及生成器内置的所有快捷方式和简化。问题是这些快捷方式没有标记。

当合成数据能够很好地捕捉真实事物的结构时,那就太好了。当捕获效果不佳时,模型会对仅存在于模拟中的模式充满信心。他在实验室里是对的,在现实世界里是错的,而两种环境之间的差异正是生成器不知道如何重现的部分。

经典案例是罕见事件。欺诈、重大失败、异常疾病,重要的往往是例外,而不是平均值。生成器擅长再现典型行为,但不擅长再现尾部行为。您生成一百万笔合成交易,并无意中告诉模型欺诈几乎不会像实际那样发生。

偏差不会在副本中消失,而是成倍增加

人们有一种舒服的幻想,认为生成合成数据可以“清理”数据。不干净。生成器从真实数据中学习,真实数据中扭曲的所有内容往往会出现在合成数据中,有时甚至会被放大。

如果原始数据库不能充分代表某个群体,那么合成数据也将不能充分代表该群体,而且还有一个额外的好处,那就是显得中立。这种偏见被涂上一层新的油漆:它现在处于“人造”数据集中,这给人一种公正的错误感觉。不公正现象仍在继续,指责只会变得更加困难。

对于那些做出影响人们、信用、筛选、公共服务优先顺序的决策的人来说,这是很严重的。 [LGPD 合规性0注意不暴露个人,但不保证上面训练的模型是公平的。这是两个不同的问题,解决第一个问题并不能解决第二个问题。

合成应避免的重新识别

合成数据的隐私论点很强烈:因为那里没有真实的人,所以没有人可以重新识别。理论上来说。实际上,这取决于数据的生成方式。

过度装饰原始集的生成器可以几乎完整地再现真实摘录,尤其是极端和独特的情况,正是那些最容易重新识别的情况。患者的记录与罕见的条件组合可能在合成中再现几乎相同。您以为您已将其匿名化,并且在没有意识到的情况下复制了您最需要隐藏的内容。

这意味着合成数据根据定义不是私有的。当它经过仔细生成和明智测量时,它是私有的。如果没有这种测量,“它是合成的,所以它是安全的”只是信念,而不是保证。而信仰是不会经过审核的。

模型崩溃:当 AI 以自身反射为食时

当合成数据成为训练的主要来源时,会出现一个更新、更安静的风险:模型开始从模型输出而不是世界中学习。每一代人,多样性都在一点点缩小,优势消失,平均水平占主导地位。

这就像复印复印件一样。第一个很棒。到了二十号,文字依然可读,但语气消失了。依靠合成数据而没有充分注入现实的系统往往会随着时间的推移而变得贫乏,变得越来越像它们自己,而越来越不像它们应该建模的东西。

解决办法不是放弃合成,而是保留真实的。合成骰子最适合作为补充和放大,而不是作为独家饮食。任何与现实世界断绝联系的人都会慢慢失去代表现实世界的能力。

合成材料在哪里有效,在哪里无效

值得具体说明,因为合成材料在抽象上既不好也不坏,它们适合或不适合每种用途。它在测试和[QA1]方面产生了很多成果:生成现实的质量来填充审批环境、练习流程、查找错误,而无需拖累生产数据。这里的风险很低,因为目标是运用系统,而不是做出关于人的决策。

它在开发和演示中得到了回报,在这些情况下,您需要一些看似合理的东西,但无法使用真实的东西。当没有特定情况的示例并且您很清楚它的行为方式时,增加数据是值得的。

成本高昂的地方在于几乎仅在合成上进行训练的高风险决策以及最终验证。投入生产的模型决定人们在某些时候需要面对真实数据。合成加速了到达的方式,它并没有取代到达。为了节省时间而跳过真正的验证就是用今天的成本换取明天的事件。

区分成熟使用和幻想的问题

决定不是“使用或不使用合成数据”,而是“用于什么、使用哪个生成器并针对什么进行验证”。任何回答这三个问题的人都能很好地使用该工具。任何直接跳到“它是合成的,所以它可以”的人都是将判断外包给营销幻灯片。

合成数据是保护隐私、速度和规模的强大工具。与任何强大的工具一样,它也会以令人信服的方式失败:错误伴随着报复,伴随着体积,伴随着严谨的外表。这就是为什么最重要的限制不是技术性的,而是态度之一:以同样健康的不信任态度对待合成物,就像对待任何声称代表现实而不是现实的来源一样。

最后,合成并不能消除理解数据的需要。他增加了它。只有深刻理解原作的人,才懂得如何生成好的模仿品,也只有不断衡量自己与世界距离的人,才懂得如何相信模仿品。任何看不到这个距离的人都没有自动隐私,他们有自动错误。

如果您正在评估人工智能产品或具有敏感数据的项目的合成数据,并希望将真正的收益与隐藏的风险分开,那么值得讨论。我的博客上还有其他关于数据治理、隐私和负责任地采用人工智能的文章。

另请阅读

  • [什么是合成数据以及为什么它对领导者很重要2
  • [合成数据和隐私:在不暴露个人数据的情况下进行训练和测试3
  • [用于测试和质量保证的综合数据:无需复制生产的真实质量4
  • [训练人工智能的合成数据:实际收益和模型崩溃的风险5
  • [信任人工智能生成的代码:每个技术领导者需要面对的悖论6
  • 【公共管理中的生成式UI:经理问,面板组装7