首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >ESX在同一个vcenter集群中托管崩溃

ESX在同一个vcenter集群中托管崩溃
EN

Server Fault用户
提问于 2022-05-25 21:12:31
回答 1查看 206关注 0票数 0

我有一个由12个ESX主机(ClusterA)组成的vcenter集群,还有一个由3个ESX主机(ClusterB)组成的集群。所有这些都是poweredge r620s和r630s的混合体。

一些主机有硬件错误,可以在iDRAC日志和液晶显示屏幕前看到,例如:

  • CPU机器检查错误
  • 超出预期的可纠正内存错误率,导致这些主机在群集中不可用(未响应)。

修复这些硬件错误通常涉及以下步骤:

  1. 断电
  2. 删除网卡
  3. 打开电源,等待成功引导到操作系统
  4. 断电
  5. 把相同的网卡放回
  6. 我感到奇怪的是,这会修复CPU和内存错误,但这是一贯发生的情况。

ClusterB很好-从来没有问题。我面临的真正问题是,当我从ClusterA修复两个主机时,ClusterA中的1-3个随机主机将在一两天内崩溃。在最初的1-3次崩溃之后,如果我把事情放在一边,几周后就不会再有主机崩溃了。这使我回到了我开始的地方,我已经观察到这种行为好几次了。

有什么好查的吗?

EN

回答 1

Server Fault用户

发布于 2022-06-20 21:02:23

R620 / R630非常老,所以对于初学者来说,他们可能只是处于最后一条腿上,并且有合法的硬件故障。也就是说,有可能导致这些问题的事情:

  • 电源-在iDRAC中静态地设置P状态和功率到最大输出。有时,如果事情不能正常工作,您可能会看到由于功耗节省措施而产生的奇怪的处理器行为。
  • 温度-我也看到数据中心运行在正常运行温度之外的那些错误。
  • BIOS补丁--这是一些旧的服务器,但是,例如,如果p状态或其他类似的问题,这是获得修复的最好方法,但我想戴尔的支持应该已经告诉你了。
  • 其他硬件异常?iDRAC日志中有什么奇怪的地方吗?
票数 0
EN
页面原文内容由Server Fault提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://serverfault.com/questions/1101807

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档