然而随着业务规模扩大和云原生架构普及,越来越多的团队开始重新评估这条路径。日志量从每天几 GB 增长到几十甚至上百 GB 时,ELK 集群的扩容复杂度、存储成本...
7月22日,白宫科技政策主管Michael Kratsios在X上发了一条帖子。措辞罕见地强硬。
Controller 数量。整个集群应该只有一个 Controller,如果监控显示 0 个或者 2 个,那你集群基本要出大事了,脑裂了。
上个月某天凌晨,告警群里突然炸了:Kafka 集群某台 broker 磁盘使用率 95%,马上要撑爆。
总体来看,十万卡集群的竞争,本质上是“存算网”协同的系统工程能力之争。网络、存储、散热、调度等关节,决定了集群的实际算力输出能打多少折扣。
2026年世界人工智能大会(WAIC)正在上海火热启幕,本届大会重磅“镇馆之宝”——国内首个全国产十万卡AI超集群曙光8000(登峰)迎来全球首展。凭借独创的超...
7月18日,2026世界人工智能大会(WAIC)在上海世博展览馆正式开幕。本届大会“镇馆之宝”之一——中国首个全国产十万卡AI超集群曙光8000(登峰) 完成全...
三个 Elastic 工具 (AutoOps、Profile API 和 ES Rally) 能够系统地诊断堆栈每一层面的 Elasticsearch 性能问题...
注意关键词:不是把一堆服务器用网线攒起来(那是传统集群),而是让几百张卡之间像在同一块主板上一样,能高频、低延迟地互相访问彼此的算力和内存。
2025年4月,百度成功点亮了基于基于P800的3.2万卡的超级集群,能够同时承载多个千亿参数大模型的训练任务。这种集群搭建与运营能力,是芯片“好用”的核心壁垒...
在2026世界人工智能大会(WAIC 2026)上,曦智科技以“光³——定义AI算力的三次方时代”为主题,从光互连、光计算、光交换三个维度,带来了一系列技术进展...
• 万亿参数MoE模型训练:依托万卡级夸娥智算集群与夸娥AI训练套件(KUAE Training Suite),摩尔线程完成了从零起步的MoE-236B基础模型...
依托三款专用芯片,云天励飞将搭建万卡(十万卡)级异构集群分离式AI推理基础设施。通过解耦各推理阶段,为不同负载匹配适配的芯片与算力资源,有效提升集群系统运行效率...
7月17日,以“智能伙伴,共创未来”为主题的2026世界人工智能大会(WAIC)在上海开幕。大会期间,中国首个全国产十万卡AI超集群——曙光8000(登峰)真机...
这是区别于传统大规模集群的核心网络优势。单子网支持 11.4 万卡规模,网卡端到端时延 小于 1 微秒,交换机转发时延 260 纳秒,单端口 800G;具备毫秒...
资源浪费。 两套集群各自预留资源,Spark 集群白天跑批晚上空着,GPU 集群训练完也空着。算力不能共享,成本不能摊薄。
从 kubectl 的黑白命令行,到如今琳琅满目的图形化管理界面,Kubernetes 的可视化生态已经相当繁荣。但对于一个刚刚上马K8s,或者正被原生命令行折...
曾几何时,面对黑压压的命令行和错综复杂的YAML文件,Kubernetes(K8s)对于许多开发者和运维人员而言,是一座需要仰望的技术高山。集群管理、应用部署、...
Kubernetes集群的崩溃,往往不是单一故障点引发的“雪崩”,而是多个系统性问题积累到临界点的“总爆发”。今天,我就结合多次“救火”经历,为你梳理出导致集群...
做过扩容的运维应该都知道,K8S集群节点管理说难不难,说简单也不简单。最烦的就是临时要加机器、又临时要下机器——流程搞错的话,Pod 漂移出去服务就炸了。