我们有一个运行完全更新的Debian Wheezy(amd64)的小型“自制”服务器。 安装了一个硬盘驱动器:WDC WD6400AAKS。 主板是华硕M4N68T V2。 通常的负载: CPU:平均20% 每周大约有50GB的额外空间被占用。 大约47GB的上传文件和3GB的MySQL数据。 恐怕硬盘可能即将失败。 当我跑时,我看到几个地方的预先失败 : root@SERVER:/tmp# smartctl -a /dev/sda smartctl 5.41 2011-06-09 r3365 [x86_64-linux-3.2.0-4-amd64] (local build) Copyright (C) 2002-11 by Bruce Allen, http://smartmontools.sourceforge.net === START OF INFORMATION SECTION === Model Family: Western Digital Caviar Blue Serial ATA Device Model: WDC WD6400AAKS-XXXXXXX Serial Number: WD-XXXXXXXXXXXXXXXXXXX LU WWN Device […]
我在Synology DiskStation的驱动器上遇到问题。 我在/ var / log / messages中看到以下错误消息: ata6.00: exception Emask 0x0 SAct 0x0 SErr 0x0 action 0x6 frozen ata6.00: failed command: SMART ata6.00: cmd b0/d0:01:00:4f:c2/00:00:00:00:00/00 tag 0 pio 512 in res 40/00:01:06:4f:c2/00:00:00:00:00/00 Emask 0x4 (timeout) ata6.00: status: { DRDY } 我不知道这是什么意思,但似乎有一个问题,由于100%IO等待,我的磁盘arrays不可用,所以我认为这可能是罪魁祸首。 然后,我去了smartctl -a上运行,得到如下输出结果: SMART support is: Available – device has SMART capability. SMART support […]
目前我正在设置智能监控,而且我有一个关于命令的问题 smartctl -H /dev/sda === START OF READ SMART DATA SECTION === SMART Health Status: OK 这实际上是否对磁盘运行任何东西,还是只是轮询SmartMonTools当前可用的日志/数据。 我明白,正在考虑通过短期和长期的testingsmartd,但这将由smartdpipe理。 我的脚本很简单,只是因为健康状态正常,并且在查找结果时失败/通过。 它还显示“smartctl -all / dev / sda”,我也想知道。 我只是想确定,因为 我认为运行smartctl -H /dev/sda && smartctl -all /dev/sda时,实际上并不做任何testing,只是轮询可用数据。 有人可以证实吗? 原因是我经常用我的networking监控软件(目前每15米)轮询这种数据方式,但是如果它不影响磁盘,我会放弃它,并使用smartd来安排实际100%读取的自检/写入/testing磁盘。
我有一些坏的部门待重新分配(基于smartmontools报告),我试图找出哪个文件的扇区是目前相关的,以便我可以从备份还原或确定如何安全写超过它。 # debugfs debugfs 1.41.14 (22-Dec-2010) debugfs: open /dev/sda3 debugfs: testb 28475580 Block 28475579 marked in use debugfs: icheck 28475580 icheck: Can't read next inode while doing inode scan debugfs: quit 在计算之后,这个块是28475579. testb说它正在使用,但是icheck总是给我一个错误:“在执行inode扫描时不能读取下一个inode”。 这是什么原因?
我有一个问题与smartd。 我研究了它的手册页,然后设置了SMART守护进程每月运行两次硬盘的长时间testing,并在出现高温等故障时提醒指定的邮件地址。 这些规则如下: /dev/sda -a -p -W 2,37,42 -s L/../(28|12)/../01 -m [email protected] -M daily /dev/sdb -a -p -W 2,37,42 -s L/../(29|13)/../01 -m [email protected] -M daily 事实certificate,这些规则并不真正的工作:testing不运行。 对我来说,规则看起来完全合法。 我究竟做错了什么?
从这个问题来看 : 如何说服smartmontools我的SSD不是硬盘? …我现在将Mushkin MKNSSDCR120GB-MX的SMART属性读作“SandForce Driven SSD”。 不过,我仍然从SMART属性231得到奇怪的值: ID# ATTRIBUTE_NAME FLAG VALUE WORST THRESH TYPE UPDATED WHEN_FAILED RAW_VALUE 231 SSD_Life_Left 0x0013 001 001 010 Pre-fail Always FAILING_NOW 21474836481 谷歌search ,看起来这个标准化的价值从100开始,并一路下降到0(当驱动器是在其生命的尽头,并只读)。 然而,这个驱动器<1岁,并没有多大用处。 除非它有缺陷,否则我认为这是不正确的,可能是由于错误地解释了属性。 我不相信该驱动器是有缺陷的,因为其他相关属性( Reallocated_Event_Count , Program_Fail_Count , Erase_Fail_Count , Retired_Block_Count等)都读取0,驱动器没有任何我能辨别的故障。 另一个线索是原始价值。 从我读过的内容来看,在SandForce驱动的固态硬盘上,属性231的原始值应该始终为0.但是总有一天,在我的驱动器上,它变成了21474836481并停留在那里。 在二进制中,我看到21474836481是两个32位字,其中位0和位2设置在最重要的字中,位0设置在最不重要的字中。 换句话说,小数点是5和1 。 在Kingston的一个文档 (在属性231的“原始用法”下),他们说他们正在使用它,也就是说,他们在字段中使用了一些位作为标志。 但是这是一个Mushkin品牌的驱动器,可能有也可能没有SandForce控制器,而不是金士顿驱动器。 有没有人知道如何解释这个驱动器的价值?
我最近密切关注一个启用了SMART的硬盘(连接到一个OSX服务器,这对SMART输出不是很有用)。 该驱动器肯定是失败的 – 头部点击,SMARTtesting失败(尽pipeSMART overall-health self-assessment test result: PASSED )等,我有一个替代品,将在您阅读这个DD'ing。 我只是有一个关于SMART输出的问题(不是驱动器是否失败!)。 Remaining百分比低于发现第一个错误后剩余的testing数量。 问题是 – find错误后SMARTtesting是否继续? 如果没有,请问有没有人知道是否有办法强制它完成并testing整个驱动器? Num Test_Description Status Remaining LifeTime(hours) LBA_of_first_error # 1 Extended offline Completed: read failure 80% 18302 406986 谢谢你的时间!
我已经在五台不同的计算机上运行smartctl -a(主要是使用smartctl 6.2的CentOS 7 Linux),并且我注意到了两种smartctl输出风格。 为什么会改变它的输出格式? 一种样式包含一个在智能维基百科页面上很好地解释的属性表。 另一个不是很明确,我想我只需要使用总的未修正的错误列。 但是我希望我能得到像第一个那样直接和可以理解的东西。 机器如下; 除非另有说明,否则均为CentOS7 / smartctl 6.2。 台式机,没有RAID。 带有P420i RAID卡的HP DL380p G8服务器 带有P840 RAID卡的HP DL180 G9服务器 一台带有P400i和“康柏智能arrays642”RAID卡的老式HP DL360 G5服务器(CentOS 6,smartctl 5.43) 带有LSI MegaRAID 3108 RAID卡的Supermicro SYS-1028UX-CR-LL1。 在前3台机器上,smartctl包含了很好的SMART属性; 这里是典型的输出: # smartctl -a -d cciss,1 /dev/sda smartctl 6.2 2013-07-26 r3841 [x86_64-linux-3.10.0-123.el7.x86_64] (local build) Copyright (C) 2002-13, Bruce Allen, Christian Franke, […]
我只是在服务器的驱动器上运行SMART,但我不太清楚如何解释它。 我的结果看起来像驱动器做得很好,但我想第二个(或第三个)意见,只是为了安全。 结果如下: Vendor Specific SMART Attributes with Thresholds: ID# ATTRIBUTE_NAME FLAG VALUE WORST THRESH TYPE UPDATED WHEN_FAILED RAW_VALUE 1 Raw_Read_Error_Rate 0x000f 120 099 006 Pre-fail Always – 243846539 3 Spin_Up_Time 0x0003 097 097 000 Pre-fail Always – 0 4 Start_Stop_Count 0x0032 100 100 020 Old_age Always – 1007 5 Reallocated_Sector_Ct 0x0033 100 100 036 […]
有没有办法通过hpacucli / smartctl刷新/重新testing驱动器? 更具体地说,有什么理由相信这些工具给你的信息可能是不准确的/旧的?