意外的服务器关机

每天一到两次,我发现一台服务器没有明显的理由关掉电源。

信息和我迄今为止所做的:

  • /var/log/下没有任何内容。 只需正常的服务器活动,然后手动启动机器时启动日志。
  • sensors总是给我正常的温度值,在问题发生的所有日子里都保持正常: http : //pastebin.com/gk8JuPCK
  • 通过物理检查PSU(Thermaltake)和塔的其他部分,我发现没有什么可担心的。 里面很干净(没有灰尘),所有的粉丝都没有问题。
  • 在BIOS设置中,当CPU达到60c时会有一个警报,但是这个警报非常高。 另外请注意,该设置处于“警告”状态,并且没有“closures”设置,因为我记得其他BIOS。
  • 我已经记住了整个记忆很多次没有一个问题。 另外我不认为这是一个内存问题,因为我从来没有发现服务器处于暂停或崩溃状态,但始终closures。
  • 服务器连接在一个UPS上,并提供其他类似的服务器。 其他服务器从来没有这个问题。 我甚至在两台服务器之间交换了电源线和UPS输出,而同样的服务器又出现了这个问题。 所以这不是UPS的问题。

我应该在哪里看下?

服务器信息:

 AMD 64 Processor 3500+ 2 x 512MB mainly runs SVN and DNS. No X sessions take place and no users are logged in. 

猫/ proc /版本

 Linux version 2.6.26-1-686 (Debian 2.6.26-13) ([email protected]) (gcc version 4.1.3 20080704 (prerelease) (Debian 4.1.2-24)) #1 SMP Sat Jan 10 18:29:31 UTC 2009 

我现在可以想到但你没有提到的唯一理由是:

  • 系统中的错误看门狗设置(BIOS / HW级别或内核/用户空间),
  • 硬件问题(我敢打赌发生故障的电源供应) – 在一个客户HP塔式服务器上出现同样的问题

试着findsysstat。 sysstat是一个定期收集系统数据(例如CPU,RAM,I / O使用)的工具。 当涉及故障排除情况时,其输出也是宝贵的信息来源。 请考虑安装包sysstat并通过使用启用其服务

chkconfig boot.sysstat on /etc/init.d/boot.sysstat start chkconfig boot.sysstat on