我在使用Dell 1950服务器时遇到了一些问题。 我在这里安装了RHEL 4.6以及Oracle和其他一些软件。
我随机得到一个错误消息,说:我的SSH会话和监视器上的“内核:日志提交I / O错误”,我已经连接到服务器,我看到一个滚动的错误说:“EXT3-FS错误(设备SDA5)在start_transaction:日记已经中止。“
它已经发生了好几次,但从未在安装过程中的同一时刻。 实际上,系统最后一次启动和运行时,我只是试图将数据库导入到oracle中。
这发生在几个硬盘上,所以我很确定这不是问题。 这让我觉得RAID控制器坏了。
你们有什么感想?
**更新**
很确定这是一个坏的硬盘。 我扔了另一个驱动器的服务器,它已经运行了约48小时,出了问题。
我以前看过这些错误,但在安装过程中没有看到。
这意味着驱动器有足够的错误,操作系统把它只读模式。 如果你能find完整的日志,那么可能会有一些I / O错误在你看到的全面失败错误之前重试和工作。 与实际块提到的东西。
这是一个存储系统错误。 这绝对是RAID卡,RAIDarrays中的驱动器,从卡到驱动器的电缆,驱动器连接到的背板,RAID卡插入的插槽,硬盘驱动器的电源或其他在CPU和实际的存储块之间。
想到三种可能性:
有内存问题(他们经常导致“随机”崩溃)。 如果你有ECC内存,那么显然它不太可能。
巴士有一些问题。 几年前,我在Tyan双Opteron主板上发现了一个坏APIC控制器的问题。 还有其他的日志条目暗示了它,但是大部分症状是磁盘驱动器上的随机损坏,具有自动只读重新装入。 在我的情况下,我知道这不是磁盘相关,因为它是一个外部的FC RAID盒,并没有问题。
RAID控制器是双层的。
这是我考虑问题的顺序。
这可能是RAID控制器坏了,就像你说的那样(如果有的话,请尝试一下备用)。它可能是控制器的驱动程序(如果可用,请检查替代驱动程序,即使性能较差,最好有一个参考点)。它可能是内核(尽pipe在RHEL中可能性较小,但testing得相当好)。这可能是坏RAM混淆块caching。
硬件问题是最可能的原因,但是,基于看似随机的错误行为。
检查磁盘未满 – 特别是根分区。 使用df来查看文件系统磁盘使用情况:
df -h
寻找接近或等于100%利用率的分区
尝试:
现在关机-rF