IT时代网8月21日消息,代码托管平台公布了8月17日大规模宕机事件的调查结果。此次事故并非由程序代码或配置变更引起,而是基础设施容量未能跟上平台使用量的快速增长。
事故造成网站、身份验证、Actions、API、Pull Request、Issues等多项服务中断,合计约7小时47分钟。平台方面称,当日流量创下历史新高后,美国中部数据中心一项关键基础设施组件容量不足,压力随之扩散至其他系统,引发身份验证失败与多项服务异常。恢复过程中,部分服务又因客户端重试机制被错误触发,进一步推高系统流量,延长了完全恢复的时间。
这已是该平台本月第二起重大服务事故。此前Actions已在8月6日发生故障,两起事故的核心问题均指向基础设施容量不足。今年以来,平台每月提交次数已从14亿次增至29亿次,合并请求与新建代码仓库数量也持续增长。
为应对负载,平台今年已增加超过300万个CPU核心、120PB高速存储与网络容量,并加快将工作负载迁移至公有云,目前约58%的负载已由云承载。接下来,技术团队将进一步隔离关键系统、统一设置重试上限与超时机制,避免异常时大量自动重复请求引发连锁故障。
注:本文综合自IT之家等,文中包含AI辅助创作的内容。