人工智能

英国空管瘫痪初步调查:一处“毫秒级”软件故障引发逾 2000 架次航班取消

2026年9月20日 · admin
OpenMagic API

据央视新闻及 IT之家 9 月 19 日消息,英国全国空中交通管理公司当地时间 18 日发布初步调查报告,认定上周英国多地机场大范围运行受阻的根源,是空管系统内一处发生在极短时间内的软件故障。来源显示,该故障出现在 9 月 8 日,导致进出港航班大规模取消或延误,逾 2000 架次航班被取消,数十万旅客受到波及,伦敦希思罗、爱丁堡、曼彻斯特等主要机场均受到影响。

这起事件此前一度被外界猜测与人为操作失误有关,但初步调查将原因指向软件层面。英国全国空中交通管理公司首席执行官马丁·罗尔夫表示,问题位于航班数据系统某个特定模块的软件中,已定位到一小段代码;事件并非由军方或民航操作人员错误操作造成。在永久修复方案完成测试并部署前,相关方面已采取临时缓解措施。

故障为何能迅速放大为全国性航空拥堵

从已披露信息看,此次故障发生在负责分配航班代码的系统环节。该代码用于帮助空管人员在雷达画面中识别不同航班,是空管运行中的基础数据连接点。来源显示,“整个故障发生在 1 毫秒之内”,但其后果却迅速外溢到多个机场和航班计划。

对现代民航系统而言,空管软件并不是单一应用,而是与航班计划、雷达识别、机场放行、航空公司调度等多个流程相互耦合。一旦核心识别或数据分配模块出现异常,系统为保障安全往往会采取保守策略,例如限制起飞、延后放行或暂停部分运行。这也解释了为什么一个看似短暂的软件故障,可能造成持续数日的旅客滞留与航班恢复压力。

  • 受影响范围广:英国多个主要机场出现航班取消或延误,爱尔兰机场运营也受到干扰。
  • 核心机场压力突出:FlightRadar 统计显示,希思罗、盖特威克、曼彻斯特和伯明翰机场受影响较为严重。
  • 恢复并非即时完成:即使航班陆续恢复,旅客改签、机组与飞机调度仍需时间重新匹配。
  • 责任调查仍在继续:英国民航局将开展独立审查,以核验初步调查结论。

从软件可靠性看:关键基础设施的“毫秒风险”

这起事件对科技行业的启示在于,关键基础设施中的软件故障不一定需要持续很久,才会产生严重后果。航空、能源、金融、通信等系统高度依赖实时数据和自动化流程,毫秒级异常也可能触发连锁反应。尤其当系统被设计为优先保障安全时,异常后的降级、停运或人工接管,往往会牺牲效率以避免更高风险。

对于 AI 与自动化系统建设者而言,这类事件也提供了一个现实案例:在高可靠场景中,模型或软件能力本身并不足够,围绕异常检测、回滚机制、冗余架构、可解释日志和演练流程的工程体系同样关键。空管系统并非普通互联网服务,不能简单通过“快速上线、快速迭代”解决问题,而需要更严格的验证与变更管理。

舆论压力与后续审查

故障发生后,英国全国空中交通管理公司陷入舆论危机,有声音呼吁其首席执行官马丁·罗尔夫辞职。英国交通大臣海迪·亚历山大已约谈罗尔夫,并要求对事件展开全面调查。她表示已收到该公司提交的初步报告,同时责成英国民航局进行独立审查。

罗尔夫还表示,本次事件与 2023 年 8 月的空管系统故障、2025 年 7 月的雷达故障没有关联。后续独立审查的重点,预计将集中在软件缺陷为何未被提前发现、临时缓解措施是否充分、永久修复方案如何验证,以及同类故障能否在未来被更快隔离。对全球关键基础设施运营方来说,这不是一次普通 IT 故障,而是一次关于软件韧性与公共服务连续性的压力测试