如何查明Windows Server 2008崩溃的原因?

我有Windows Server 2008在VMware下运行。

最近,它每天大概开始崩溃,连续100%的CPU使用率,并且在GUI中没有响应。

有没有一步一步的技术来追踪这个问题的根源?

我会看什么日志?

PS问题出现在我试图卸载Acronis的时候,并且它被蓝屏蔽了。 但是,我不确定当前的错误是否与Acronis有关。

您还可以使用Windows Server 2008中提供的“可靠性和性能监视器”。

正如您在下面看到的那样,它会自动logging服务器的可靠性,并为其指定一个“可靠性分数”。该分数从10开始,如果服务器遇到任何崩溃或意外closures,则会下降。

它甚至保存了哪些程序的安装logging,以及何时可以诊断安装的程序是否会导致更多故障。

您也可以将其设置为连续logging程序的CPU使用率,以查看哪个程序导致100%的CPU利用率。

在这里输入图像说明

系统事件日志。 应用程序事件日志。 谷歌的BSOD的消息。 用chkdsk检查磁盘的完整性。

如果有像c:/windows/memory.dmp这样的崩溃转储,可以使用Windowsdebugging工具来分析它。 通常你想在转储中寻找第三方驱动程序。

你有两个select:

  • 看看logging,试图找出是什么导致了过去的问题
  • 寻找可能导致CPU高峰的事情迹象,试图复制问题

如果您知道问题出现的时间或者日志​​安静得足以让您注意到一个导致被钉住的CPU的模式,那么日志是回顾系统历史的好的开始。 如果系统蓝屏,你可以把dmp的东西放进windbg。

如果你正在寻找可能导致CPU高峰的事情:

  • 从sysinterals进程浏览器:寻找奇怪的进程或打开处理文件或networking共享不再存在。 它可能会指出你正确的方向来复制问题
  • Windows可靠性和性能监视器/ Perfmon:您可以看到每个进程如何处理磁盘/ CPU /内存/networking使用情况以及数百个其他计数器。 他们可能会给你一个线索,看看VM发生什么事情。

一旦你有一个很好的候选人的问题,你可以从sysinternals打开进程监视器。 它将转储系统上每个进程正在进行的每个文件和registry交互。 它甚至可以configuration为在启动时加载并捕获所有内容,直到下一步运行GUI(请注意,这是很多数据,因此只有在启动后能够快速复制问题才是明智之举)

有一堆兔子洞根本原因分析可以把你打倒,随时让我们知道如何去。

它是否每24小时(每天在同一时间)完全崩溃?

如果是这样,那么可能有一个预定的进程导致崩溃。

你能解释一下你的意思是崩溃,是服务器遇到BSOD还是只是悬挂在100%的CPU。

对于故障排除,您可以将服务器日志logging到系统日志服务器,每隔一段时间运行脚本列表处理其资源使用情况,将其输出写入networking共享。

如果服务器使用bsod尝试searchbosod中提到的错误代码。

此外,也许卸载acronis留下一个错误日志与安装文件夹中的一些信息。

如果是蓝屏,请查看小型转储文件: http : //support.microsoft.com/kb/315271

…这会告诉你(通常)导致崩溃的驱动程序或软件。

2009-07-06 – 我在想它的硬盘。

我做了一个chkdsk,它和之前chkdsk中途的症状相同。 我使用的是固态硬盘(SSD),即“PQI DK9128GD6R000A03 128GB SATA 2.5”固态硬盘,平均无故障时间为150万小时,尽pipe平均无故障时间为133年,但似乎在2周或正常使用后已经死亡!为了检查我的理论,我把VMware文件复制到一个标准的硬盘驱动器,然后运行起来就像一个魅力一样,我会看看系统是否存活了一个星期的正常运行时间,如果是这样,我可以正式解锁我的PQI SSD 。

2009-07-07 – 系统再次崩溃。 回到绘图板。

2009-07-08 – 在安装SSD之前还有20天。 我们会看看它是否再次崩溃(它)。

2009-07-09 – 卸载OpenVPN,升级到最新版本的Skype,升级到SQL 2008到SP1,删除TeamViewer。 我们会看看它是否再次崩溃(在Acronis备份中间)。

2009-07-09 – 怀疑运行服务器的VMware机器可用的虚拟内存量太小,目前我已达到4GB。 增加它(这没有效果)。

2009-07-09 – 发现如果运行Windows Server 2008的VMware容器崩溃,100%的CPU利用率,我暂停/重新启动它,然后它uncrashes恢复操作! 这往往指向VMware或其主机操作系统(即XP)的问题,而不是Windows Server 2008本身的问题。 现在已经非常接近问题的核心。

2009-07-09 – Windows Server 2008只在主机操作系统负载很重时崩溃。 增加了它可以利用到2个CPU的CPU数量,这似乎已经解决了这个问题。

结论是:

  1. 原来的问题是由坏扇区坏硬盘引起的(这实际上是一个来自PQI的128GB固态硬盘 – 不会期望固态硬盘(SSD)在购买后两周失效,但是这样做)。
  2. 下一个问题是由运行VMware的主机操作系统在高负载下引起的。 通过分配更多的RAM和增加页面文件的大小来解决这个问题。
  3. 如果它再次发生,我有一个解决方法(只是暂停/重新启动VMware v6.5“解冻”Windows Server 2008内运行)。

问题解决了,谢谢你们!