我有Windows Server 2008在VMware下运行。
最近,它每天大概开始崩溃,连续100%的CPU使用率,并且在GUI中没有响应。
有没有一步一步的技术来追踪这个问题的根源?
我会看什么日志?
PS问题出现在我试图卸载Acronis的时候,并且它被蓝屏蔽了。 但是,我不确定当前的错误是否与Acronis有关。
您还可以使用Windows Server 2008中提供的“可靠性和性能监视器”。
正如您在下面看到的那样,它会自动logging服务器的可靠性,并为其指定一个“可靠性分数”。该分数从10开始,如果服务器遇到任何崩溃或意外closures,则会下降。
它甚至保存了哪些程序的安装logging,以及何时可以诊断安装的程序是否会导致更多故障。
您也可以将其设置为连续logging程序的CPU使用率,以查看哪个程序导致100%的CPU利用率。

系统事件日志。 应用程序事件日志。 谷歌的BSOD的消息。 用chkdsk检查磁盘的完整性。
如果有像c:/windows/memory.dmp这样的崩溃转储,可以使用Windowsdebugging工具来分析它。 通常你想在转储中寻找第三方驱动程序。
你有两个select:
如果您知道问题出现的时间或者日志安静得足以让您注意到一个导致被钉住的CPU的模式,那么日志是回顾系统历史的好的开始。 如果系统蓝屏,你可以把dmp的东西放进windbg。
如果你正在寻找可能导致CPU高峰的事情:
一旦你有一个很好的候选人的问题,你可以从sysinternals打开进程监视器。 它将转储系统上每个进程正在进行的每个文件和registry交互。 它甚至可以configuration为在启动时加载并捕获所有内容,直到下一步运行GUI(请注意,这是很多数据,因此只有在启动后能够快速复制问题才是明智之举)
有一堆兔子洞根本原因分析可以把你打倒,随时让我们知道如何去。
它是否每24小时(每天在同一时间)完全崩溃?
如果是这样,那么可能有一个预定的进程导致崩溃。
你能解释一下你的意思是崩溃,是服务器遇到BSOD还是只是悬挂在100%的CPU。
对于故障排除,您可以将服务器日志logging到系统日志服务器,每隔一段时间运行脚本列表处理其资源使用情况,将其输出写入networking共享。
如果服务器使用bsod尝试searchbosod中提到的错误代码。
此外,也许卸载acronis留下一个错误日志与安装文件夹中的一些信息。
如果是蓝屏,请查看小型转储文件: http : //support.microsoft.com/kb/315271
…这会告诉你(通常)导致崩溃的驱动程序或软件。
2009-07-06 – 我在想它的硬盘。
我做了一个chkdsk,它和之前chkdsk中途的症状相同。 我使用的是固态硬盘(SSD),即“PQI DK9128GD6R000A03 128GB SATA 2.5”固态硬盘,平均无故障时间为150万小时,尽pipe平均无故障时间为133年,但似乎在2周或正常使用后已经死亡!为了检查我的理论,我把VMware文件复制到一个标准的硬盘驱动器,然后运行起来就像一个魅力一样,我会看看系统是否存活了一个星期的正常运行时间,如果是这样,我可以正式解锁我的PQI SSD 。
2009-07-07 – 系统再次崩溃。 回到绘图板。
2009-07-08 – 在安装SSD之前还有20天。 我们会看看它是否再次崩溃(它)。
2009-07-09 – 卸载OpenVPN,升级到最新版本的Skype,升级到SQL 2008到SP1,删除TeamViewer。 我们会看看它是否再次崩溃(在Acronis备份中间)。
2009-07-09 – 怀疑运行服务器的VMware机器可用的虚拟内存量太小,目前我已达到4GB。 增加它(这没有效果)。
2009-07-09 – 发现如果运行Windows Server 2008的VMware容器崩溃,100%的CPU利用率,我暂停/重新启动它,然后它uncrashes恢复操作! 这往往指向VMware或其主机操作系统(即XP)的问题,而不是Windows Server 2008本身的问题。 现在已经非常接近问题的核心。
2009-07-09 – Windows Server 2008只在主机操作系统负载很重时崩溃。 增加了它可以利用到2个CPU的CPU数量,这似乎已经解决了这个问题。
结论是:
问题解决了,谢谢你们!