Self-healing
Infraestrutura
AIOps
Automação
Resiliência

自主计算:系统在您注意到错误之前自行纠正

自我修复对几十年来一直存在的隐含信念提出了质疑:当某些东西发生故障时,人类需要醒来来修复它。这种信念正在变得错误。

自主计算:系统在您注意到错误之前自行纠正

几乎每家科技公司的运营都有一个隐含的信念:当出现问题时,必须有人来修复它。这种信念塑造了数十年的随叫随到文化、操作手册、NOC 和清晨警报。问题是它开始变得错误。不是因为人类变得更快,而是因为系统开始自我修复。

自主计算或自我修复既不是科幻小说,也不是推销员的承诺。它是一类实践和技术,已经在具有相关规模运营的公司中投入生产,并且正在迅速成为主流。技术领导者面临的问题不是这是否会发生,而是当您的堆栈不再需要唤醒任何人时,这意味着什么。

系统自我修复意味着什么?

自我修复不仅仅是重新启动已经死亡的 Pod。这是一个完整的循环:检测到问题、诊断根本原因、决定正确的操作并采取行动——所有这一切都发生在用户注意到性能下降之前。

这种循环表现在几个方面。一个 [Kubernetes0 集群,可检测降级节点、耗尽工作负载并自动替换实例。该服务注意到延迟的异常增加,隔离有问题的分区并重定向流量,同时向团队发出警报,而无需停止操作。一种数据管道,可识别摄取异常、反转转换并触发重新处理,无需人工干预。

这些场景的共同点是操作顺序的颠倒:系统先行动,人工随后审查。这似乎很小,直到您意识到如果系统有正确的反应,大多数深夜事件都可以得到解决,或者根本不会成为事件。

AIOps:当可观察性成为运营智能时

使大规模自我修复成为可能的环节是AIOps——机器学习在[可观测性1]数据上的应用,以识别模式、关联事件并自动推荐或采取行动。

传统监控告诉您“CPU 处于 95%”。 AIOps 告诉您“这种 CPU 峰值会在每周二下午 2 点在特定部署后发生,这不是一个事件,而是预期行为,以下是证实这一点的其他三个迹象”。第一个很累;第二个是教育。

Dynatrace、Datadog AIOps、Google Cloud Operations 等工具和较小的平台正在整合这种关于时间序列和服务拓扑的推理。结果不是一个无所不知的系统,而是一个会犯错误并从您的团队已经经历过的相同事件中吸取教训的系统,并且下次不需要唤醒其他任何人来解决这些问题。

混沌工程和故意失败的纪律

自主计算的核心有一个讽刺之处:要构建能够从故障中恢复的系统,您需要在实际故障出现之前以受控方式故意使系统发生故障。

这就是混沌工程。这个由 Netflix 的 Chaos Monkey 推广的想法很简单:如果你不知道你的系统在故障下如何表现,你就不知道它是否具有弹性。你认为是的。证明它是需要注入问题并观察会发生什么。

在现代实践中,混沌工程已经从“删除随机实例”演变为外科手术实验:服务之间调用的人为延迟、特定 Pod 中内存资源的耗尽、外部依赖项的模拟故障、区域之间的网络分区。每个实验都揭示了团队对复原力的假设——如果没有测试,这个假设将一直是一个幻觉,直到它成为一个事件。

混沌工程的学科本质上是承认系统会失败并决定在用户​​失败之前就知道的学科。

领导者应该如何看待这个问题

实施自我修复的成本是可见且具体的。没有它的成本是分散的和长期的:随叫随到的时间、重复发生的事件、高级工程师忙于自动化可以解决的任务。第二个数字很少出现在预算中,但它确实出现在营业额中。

自我修复改变了运营团队的组成和节奏。过去花费一半时间进行事件响应的团队现在可以腾出时间来从事更高价值的工作:改进检测系统本身、构建混沌实验、审查系统采取的自主操作并确定它们是否正确。人类工作提升到一个新的水平;不会消失。

这对随叫随到的文化有直接影响。起床执行手动操作手册的轮班会让工程师精疲力竭并产生人员流动。只有当自动化无法解决问题并且已经在尝试的完整背景下实现的转变才是可持续的模式。目标不是将人类从循环中消除,而是确保人类在正确的时间进入循环,并拥有足够的信息来做出高质量的决策。

对于评估从哪里开始的领导者来说:最实惠的切入点不是雇用 AIOps 团队或采用新平台。它绘制了过去六个月中最常见的五个事件,并针对每个事件询问:系统需要什么才能自行解决该问题?答案准确地揭示了投资方向。

另请阅读

  • [生产中的 Kubernetes:迁移之前没有人告诉你的事情2
  • [工厂中的边缘计算:本地处理更有意义3
  • [边缘计算:为什么计算正在离开云而向数据靠拢4
  • [电气化:当一切都开始打开插座时会发生什么变化5
  • 【能源:无人问津的计算路线瓶颈6
  • [量子传感器和网络:首先出现的应用7