前LinkedIn SRE警告:AI接管日常事故响应后,工程师正在失去系统直觉

前LinkedIn SRE警告:AI接管日常事故响应后,工程师正在失去系统直觉

曾在LinkedIn担任SRE的Sylvain Kalache最近发表文章,给AI运维热潮泼了一盆温水。他回忆2012年在LinkedIn设计过一套能自愈并从事故中学习的系统原型,当时AI能力远不及今天,想法只能停留在纸面。如今AI事件响应工具——社区称之为AI SRE——已经能检查告警、形成假设、查询遥测数据、关联近期部署,甚至亲手实施修复。Kalache的担忧随之而来:我们正在与自己的系统失去接触。

自动化悖论的软件版

问题出在训练机会的分配上。人因工程研究者Lisanne Bainbridge在1983年的著名论文《自动化的讽刺》中就指出:自动化剥掉了操作者练习常规工作的机会,却把新的、异常的状况留给他们负责,因此操作者反而需要比自动化之前更强的技能与更多训练。Kalache把这一悖论映射到SRE领域——常规事故正是值班工程师安全地建立系统直觉的沙场,当AI把这些事故全部接管,人类只在AI解决不了的疑难杂症出场时,手里的肌肉记忆早已退化。

他给出一个预测:未来几年,多数事故的平均修复时间MTTR会因AI辅助而下降,但复杂事故的处置时间会陡然上升,因为响应者已经生疏,排查起来步履维艰。这个预测的可怕之处在于它的隐蔽性——日常指标一片向好,直到那个从未见过的深夜大事故降临。

航空业怎么训练罕见故障

Kalache认为航空业给出了现成答案。现代涡扇发动机每10万飞行小时的在空停车不足一次,一名商业飞行员可能整个职业生涯都不会在模拟机之外遇到发动机失效,但规章要求他们时刻准备:美国FAA规定机长每六个月必须完成复训或熟练检查,科目包括起飞阶段的发动机失效等罕见场景。反面教材同样深刻——复兴航空235号班机起飞后右侧发动机自动顺桨,机组误判了故障发动机,从首次告警到飞机失速坠毁只有117秒。

软件行业可以移植这套机制:定期把工程师拉进「模拟机」,演练数据库主从切换、缓存雪崩、证书过期这类AI平时包办的事故,让手感保持在线;混沌工程与事故复盘已经在做一半的工作,缺的是把它制度化成每六个月一次的硬性科目。Kalache承认多数软件事故不像空难那样以生命为代价,但这不是放弃手艺的借口。

对采购AI SRE工具的团队,这篇文章的启示相当具体:工具负责消化告警洪水没有问题,但要为人类保留刻意练习的场景,否则自动化省下的睡眠,会在最贵的那次事故里连本带利还回去。厂商一方也有机会——把事故模拟器做成产品标配,可能比多卷两个百分点的自动修复率更有长期价值。