几乎每个人工智能项目都会在某个时候遇到同样的问题:数据丢失。最重要的罕见案例的例子却缺失了。缺乏标签,因为贴标签成本高且速度慢。代表性不足的阶层缺乏数量,该模型之所以犯错,正是因为它没有看到足够的东西。数据在理论上存在,但没有达到问题所需的数量和质量。
合成数据的出现是缓解这种短缺的一种方式。您不必等待世界产生更多示例,而是生成遵循真实结构的示例。这个想法很诱人,而且在很多情况下都是有效的。但它带有特定的风险,那些领先的人工智能需要在押注模型的性能之前了解这种风险。
为什么数据缺失,以及合成材料如何提供帮助
经常出现的短缺有以下三个。
首先是体积。现代模型需要很多例子,并不是每个问题都有悠久的历史。一个新产品、一个小市场、一种特定的语言,所有这一切都始于很少的数据。
第二个是标签。你甚至有数据,但没有写下来。了解哪些图像包含缺陷、哪些文本是投诉、哪些交易是欺诈,取决于昂贵的人力。合成数据在诞生时就已经带有标签,因为您知道它生成了什么。
第三是平衡。在许多问题中,最重要的类别是最罕见的。欺诈很少见,设备故障很少见,特定疾病也很少见。该模型对它所看到的东西的学习效果很差。生成稀有类别的综合示例有助于平衡训练。
综合数据攻击这三个方面。您生成卷,使用已知标签生成并在需要时生成更多示例。在计算机视觉等领域,通常使用人工生成的场景来训练部分模型,以现实世界无法免费提供的方式控制光照、角度和变化。数据是人造的,但模型从中学到的东西可以转移到现实中。
证明投注合理的奖金
当它起作用时,回报就会出现在具体的正面。
您减少了开始时间。不必等待数月来积累真实数据,而是开始使用合成基础进行训练,并在真实数据到达时进行改进。
你涵盖了罕见的情况。几乎不会出现但出现时成本高昂的场景可以有目的地大量生成,这样模型就可以学会识别它。
您绕过了隐私障碍。当真实数据过于敏感而无法进行训练时,合成版本会发挥主导作用,这是我在[合成数据作为隐私工具0]中讨论的主题。
您可以控制模型所看到的内容。理论上,您可以生成一个更平衡的数据集,更能代表您希望模型学习的内容,而不是接受所收集数据中的偏差。
最后一个优势,即控制力,也是陷阱所在。因为只有在正确的方向上控制模型才能控制模型所看到的内容。
主要风险:模型崩溃
每个人工智能领导者都应该知道一种现象:模型崩溃。当模型开始使用其他模型生成的数据而不是真实数据进行一轮又一轮的训练时,就会发生这种情况。
问题的逻辑很简单。每个生成器都是真实生成器的不完美近似。它很好地捕获了分布的中心、常见情况,但较差地捕获了边缘、罕见情况和数据的真实多样性。当你用前一个模型的输出训练一个新模型时,它会学习这个已经很贫乏的版本。再次生成,再次训练,每个周期多样性都会缩小。边缘首先消失。随着时间的推移,该模型逐渐收敛为一个狭隘的、自信的版本,越来越脱离现实世界的丰富性。
这种症状很隐蔽,因为一开始,这些指标甚至可能看起来不错。该模型轻松应对普通情况。但他失去了尾巴,失去了罕见的情况,失去了应对突发事件的能力。而罕见的情况通常正是生产中最重要的。
这种风险并不需要极端的“仅合成数据”场景才能显现出来。只需要合成的模型在训练中占主导地位,或者由继承了另一个模型缺陷的模型生成,退化就会开始累积。
遗传偏见:合成放大了它收到的东西
即使在崩溃之前,也存在一个更紧迫的问题:偏见。生成器从真实数据中学习。如果真实数据存在偏差(几乎所有真实数据都是如此),那么生成器就会了解该偏差并在其创建的内容中重现该偏差。
更糟糕的是:它会放大。如果一个基数不足以代表一个群体,则生成模型往往会更糟糕地代表它,因为它看到的例子较少,无法了解其变化。由此产生的合成数据看起来是中性的,看起来“干净”,但与原始数据具有相同的不平衡性,现在出现了新的和受控的东西。
这是一个隐藏得很好的风险。综合数据看起来很客观。没有人在那里看到真实的人的公积金,所以错误的感觉是偏见问题已经过去了。它没有留下来。用有偏见的合成数据训练人工智能,就是在教模型系统性地犯错误,这样做的好处是看起来比实际情况更干净。
如何使用才不会出错
我向团队重复的规则是,合成数据补充真实数据,但最终不会取代真实数据。一些支持这一点的实践。
将真实数据保留在循环中。使用合成数据来增加和平衡训练,但始终根据真实数据进行验证和校准。真实是防止模型走向模仿的锚。
有意识地混合。将训练中合成数据的一部分视为决策参数,而不是细节,有助于防止它在没有任何人决定的情况下占据主导地位。
评估真实的,而不是综合的。重要的性能是模型面对真实生产数据时出现的性能。综合集中的良好指标可能只是确认了生成器自身的偏差。
注意尾巴。特别关注罕见案例和少数群体。这就是崩溃和偏见首先出现的地方,也是监控需要最谨慎的地方。正如我在[信任人工智能生成的代码1]中讨论的那样,不要盲目信任模型输出的同样警告也适用于代码。
记录数据的来源。了解训练的哪一部分是真实的,哪一部分是合成的,以及由哪个生成器生成的,可以让您在出现问题时进行调查。如果没有可追溯性,您就无法区分数据问题和模型问题。
由谁领导的决定
用于训练人工智能的合成数据是一个合法的杠杆,在许多情况下,这也是可行的项目和因缺乏数据而受阻的项目之间的区别。但这是一个需要稳定手的杠杆。
领导者需要问的问题不是“我们可以生成数据吗?”,而是“我们是否验证这些数据可以改进现实世界中的模型,而不会继承偏见或削弱多样性?”。如果答案来自于循环中的测量和真实数据,那么合成就是一个盟友。如果它带着热情而没有证据,那么它就是在生产中到期的债务,在最糟糕的时刻。
开始将合成数据视为实验的一部分,而不是捷径。定义假设,将其与真实情况进行比较,然后才决定扩展。您投入生产的模型包含您教给它的所有内容,包括您没有意识到您教给它的内容。
另请阅读
- [什么是合成数据以及为什么它对领导者很重要2
- [合成数据和隐私:在不暴露个人数据的情况下进行训练和测试3
- [软件开发中的人工智能代理:采用治理4
- [综合数据:没有人在销售幻灯片上提出的风险和限制5
- [用于测试和质量保证的综合数据:不复制生产的真实质量6
- [生成式用户界面需要更多的治理,而不是更少77
