感谢亚汇网网友亚汇网8月21日消息,GitHub现已公布GitHub表示,当日平台流量创下历史新高后,导致美国中部数据中心的一项关键基础设施组件容量不足,进而令压力扩散至其他系统,导致身份验证失败以及多项服务异常。在恢复过程中,部分服务又因为错误触发客户端重试机制,进一步增加系统流量,因此最终技术人员花费了较长时间才完全恢复平台服务。亚汇网注意到,这已经是GitHub本月发生的第二起重大服务事故。此前,GitHubActions已经在8月6日发生服务故障。GitHub表示,两起事故的核心问题都是基础设施容量不足,而不是程序代码或配置变更导致的故障。GitHub近期平台使用量增长迅速。今年4月至今,每月提交(commit)次数已经从14亿次增加至29亿次,合并PullRequest以及新建代码仓库的数量也持续增长。为了应对平台使用量持续增长,GitHub今年已经增加超过300万个CPU核心、120PB高速存储空间以及网络容量,并加快将工作负载迁移至微软Azure。目前约58%的GitHub平台负载已经由Azure承载,远高于今年5月的12%;此外,约一半的Git操作也已经由Azure负责处理。然而尽管微软进行了如此优化措施,还是遇到了“用户量挤垮平台服务”的情况。GitHub声称,接下来技术人员将进一步隔离平台关键系统,减少不同服务之间的共同依赖,同时统一设置服务间的重试次数上限和超时机制,避免系统出现异常时,大量客户端或服务自动重复请求进一步增加负载,最终形成连锁故障。