您正在访问亚汇网香港分站,本站所提供的内容均遵守中华人民共和国香港特别行政区法律法规。

GitHub 通报 8 月 17 日大规模宕机事件原因:基础设施容量未能跟上平台使用量的快速增长

文 / 小亚 2026-08-22 00:39:06 来源:亚汇网

感谢亚汇网网友亚汇网8月21日消息,GitHub现已公布GitHub表示,当日平台流量创下历史新高后,导致美国中部数据中心的一项关键基础设施组件容量不足,进而令压力扩散至其他系统,导致身份验证失败以及多项服务异常。在恢复过程中,部分服务又因为错误触发客户端重试机制,进一步增加系统流量,因此最终技术人员花费了较长时间才完全恢复平台服务。亚汇网注意到,这已经是GitHub本月发生的第二起重大服务事故。此前,GitHubActions已经在8月6日发生服务故障。GitHub表示,两起事故的核心问题都是基础设施容量不足,而不是程序代码或配置变更导致的故障。GitHub近期平台使用量增长迅速。今年4月至今,每月提交(commit)次数已经从14亿次增加至29亿次,合并PullRequest以及新建代码仓库的数量也持续增长。为了应对平台使用量持续增长,GitHub今年已经增加超过300万个CPU核心、120PB高速存储空间以及网络容量,并加快将工作负载迁移至微软Azure。目前约58%的GitHub平台负载已经由Azure承载,远高于今年5月的12%;此外,约一半的Git操作也已经由Azure负责处理。然而尽管微软进行了如此优化措施,还是遇到了“用户量挤垮平台服务”的情况。GitHub声称,接下来技术人员将进一步隔离平台关键系统,减少不同服务之间的共同依赖,同时统一设置服务间的重试次数上限和超时机制,避免系统出现异常时,大量客户端或服务自动重复请求进一步增加负载,最终形成连锁故障。

相关新闻

加载更多...