首页
学习
活动
专区
圈层
工具
发布

GitHub通报8月17日大规模宕机原因

IT时代网8月21日消息,代码托管平台公布了8月17日大规模宕机事件的调查结果。此次事故并非由程序代码或配置变更引起,而是基础设施容量未能跟上平台使用量的快速增长。

事故造成网站、身份验证、Actions、API、Pull Request、Issues等多项服务中断,合计约7小时47分钟。平台方面称,当日流量创下历史新高后,美国中部数据中心一项关键基础设施组件容量不足,压力随之扩散至其他系统,引发身份验证失败与多项服务异常。恢复过程中,部分服务又因客户端重试机制被错误触发,进一步推高系统流量,延长了完全恢复的时间。

这已是该平台本月第二起重大服务事故。此前Actions已在8月6日发生故障,两起事故的核心问题均指向基础设施容量不足。今年以来,平台每月提交次数已从14亿次增至29亿次,合并请求与新建代码仓库数量也持续增长。

为应对负载,平台今年已增加超过300万个CPU核心、120PB高速存储与网络容量,并加快将工作负载迁移至公有云,目前约58%的负载已由云承载。接下来,技术团队将进一步隔离关键系统、统一设置重试上限与超时机制,避免异常时大量自动重复请求引发连锁故障。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OaiS_KRWLCrjBCMC7GuAVBGw0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券