Articles of smartctl

freenas光盘问题 – 聪明的错误 – 如何修复ZFS RAID?

我的问题是,我的zfs突袭部分raid一部分退化,部分被雷击后摧毁。 我能够检测到zpool状态的问题: zpool status myzfs pool myzfs state: DEGRADED (DESTROYED) 好消息。 ZFS似乎是非常可靠的,我在我的情况下能够完全恢复袭击。 我如何恢复下面的答案。 恢复ZFS Raid我学到了两件事: 1失败的驱动器带来一个zpool下来 。 然而,基于加强型镜子的突袭仍然可用。 在ZFS中详细说明:您应该使用镜像vdevs,而不是RAIDZ 基于raidz2-0恢复和重新启动zpool需要很长时间。 用条纹镜可能会更好。 这在互联网 sdfg广泛讨论有利有弊 RAID不是备份 ! 离线备份到云或第二个位置是一个很大的优势,今天可能没有任何大的优惠。 大多数Raid允许备份到云或ZFS复制到另一个NAS Orignaldebugging信息 但是,这并不一定重要,检测和解决问题。 我对我的freenas 9.2.1有麻烦。 它今天坠毁。 它在zfs jbod raid 2上运行一个文件服务器。我不确定究竟是什么导致了这个问题。 系统启动,但反应很慢。 从日志中我无法确定任何错误。 因此,我不确定在哪里得到错误分析和如何解决它们。 问题是系统崩溃,响应速度很慢。 由于pyhon死亡,freenas的web界面也崩溃了。 Freenas安装在USB棒上,附加一个驱动器(2tb)用于备份。 其他4个驱动器运行zfs RAID。 硬盘确实显示出明智的错误。 我怎样才能解决他们? 愿他们成为问题的原因。 最佳 CPU: 0.1% user, 0.0% nice, 2.5% system, […]

e2fsck未发现错误,但SMART自检失败

我有一个外部Freecom硬盘(三星驱动器内部),通过USB连接,并使用自己的电源。 磁盘在随机的时间间隔(从几个小时到一个月)断开连接。 我倾向于责怪操作系统,因为相同的驱动器没有问题连接到TP-Link路由器的USB端口。 无论如何,为了确保我使用smartctl执行了扩展的SMART自我testing,并完成了Completed: read failure 30%消息。 所以,我使用e2fsck进行了一个额外的testing。 我花了整整一个晚上在这个1.5TB的驱动器上进行testing。 testing完成,没有任何错误。 我很困惑 – 我应该相信SMART自检或者e2feck结果吗? 此外,SMART健康状态是“通过”,短暂的自我testing也是好的。 通常的嫌疑人被检查 – USB电缆已被更换新的,并检查外部电源。 想法? 我应该买新驱动器还是我安全? SMART或e2fsck是一个更可靠的健康状况来源?

smartd是真的报告这个驱动器太热?

“SMART使用属性:194 Temperature_Celsius从146更改为150”。 这是在CentOS 6.6上。 这是什么意思? 驱动器真的很热,或者这可能是一个软件错误? 该驱动器是一个eSATA 2TB驱动器,触摸感觉很酷,位于地下室的服务器是70F。 # smartctl -A /dev/sdb smartctl 5.43 2012-06-30 r3573 [x86_64-linux-2.6.32-504.16.2.el6.x86_64] (local build) Copyright (C) 2002-12 by Bruce Allen, http://smartmontools.sourceforge.net === START OF READ SMART DATA SECTION === SMART Attributes Data Structure revision number: 16 Vendor Specific SMART Attributes with Thresholds: ID# ATTRIBUTE_NAME FLAG VALUE WORST THRESH TYPE UPDATED […]

我如何说服smartmontools我的SSD不是硬盘?

我正在运行Debian Wheezy,股票smartmontools包(smartctl 5.41)。 SSD(Mushkin MKNSSDCR120GB-MX )正在报告SMART属性ID 231(十进制)中的使用寿命信息。 对于硬盘,这个属性是Temperature_Celsius ,不幸的是,smartmontools正在解释它: SMART Attributes Data Structure revision number: 10 Vendor Specific SMART Attributes with Thresholds: ID# ATTRIBUTE_NAME FLAG VALUE WORST THRESH TYPE UPDATED WHEN_FAILED RAW_VALUE […] 231 Temperature_Celsius 0x0013 001 001 010 Pre-fail Always FAILING_NOW 21474836481 […] 不,不是210亿摄氏度……它应该是SSD剩余寿命的一个指标。 我尝试使用以下命令更新驱动器数据库: # /usr/sbin/update-smart-drivedb /usr/share/smartmontools/drivedb.h updated from branches/RELEASE_5_41_DRIVEDB # …并重新启动smartd ,但该驱动器仍然不被识别为SSD。 […]

为什么SMART错误率下降?

我有一个硬盘,这是Linux软件raid5arrays的一部分。 SMART报告说,它的multi_zone_error_rate是0,然后是1,然后是3.所以我想我最好更频繁地开始备份,并准备更换驱动器。 现在,今天,同一个驱动器的multi_zone_error_rate回落到1.看起来2个错误在我没有看的时候没有发生。 我也通过检查服务器上的系统日志来看到simliar行为。 Jun 7 21:01:17 FS1 smartd[25593]: Device: /dev/sdc, SMART Usage Attribute: 7 Seek_Error_Rate changed from 200 to 100 Jun 7 21:01:17 FS1 smartd[25593]: Device: /dev/sde, SMART Usage Attribute: 7 Seek_Error_Rate changed from 200 to 100 Jun 7 21:01:18 FS1 smartd[25593]: Device: /dev/sdg, SMART Usage Attribute: 7 Seek_Error_Rate changed from 200 to 100 […]

smartctl没有真正运行自检?

我想运行smartctl自检以检查RAIDarrays(PERC 5 / i)中驱动器的运行状况。 arrays在sda上,由六个驱动器组成。 我可以使用检查状态 sudo smartctl /dev/sda -d megaraid,0 -a 而且我看到SMART在所有驱动器上都可用并启用。 我试图运行使用自我testing sudo smartctl /dev/sda -d megaraid,0 -t short 和 sudo smartctl /dev/sda -d megaraid,0 -t long 我也尝试过所有的驱动器0-5。 无论我尝试什么,当我运行: sudo smartctl /dev/sda -d megaraid,0 -l selftest 我总是得到相同的结果,这似乎总是报告,我从来没有进行自测。 /dev/sda [megaraid_disk_00] [SAT]: Device open changed type from 'megaraid' to 'sat' ===START OF READ SMART DATA […]

HGST Helium Ultrastar 8TB 7200 RPM SAS 12Gb / s企业级硬盘的最高正常SMART温度是多less?

我刚刚收到新的戴尔R730xd 2U服务器,带有面板12 * 3.5“驱动器托架+ 4 * 3.5”中间托盘,位于RAM模块和CPU之上。 我已经插入16 * HGST氦8Tb 7200 RPM SAS 12Gb / s驱动器,并启动2 * 8 * 8Tb RAID6卷后台初始化。 我用smartctl查询驱动器温度。 虽然前置驱动器预计在33C到37C的范围内冷却,但是中型驱动器#14..17分别是45C,46C,51C和54C – 后者我最关心的是过热。 Init只进行了几个小时。 iDRAC报告入口空气为22C,出口为44C。 风扇以〜4.3k RPM的速度旋转。 如果盖子closures,他们旋转约15K。 热成像显示#17是最热的,在47℃的情况下温度。 我不确定是否有特定的驱动器或驱动器位置是否有任何东西 – 将通过删除虚拟磁盘并交换两个驱动器的位置进行validation – 将更新这个职位与观察。 制造商规格说正常的操作环境温度高达60C( 链接 ) 在我看来,温度boost影响驾驶寿命。 然而,我之前的R720xd上的两个柔性托架后部驱动器都是15kRPM,总是在55℃左右,3年以上仍然活着。 另外我要求HGST支持他们的职位。 服务器故障的另一个话题指向Google的研究,指出T是几年后的一个因素。 ( 链接 ) UPD1(20151102):制造商很快回复说:“这个驱动器可以在5到60摄氏度的温度下工作,驱动器一般在50摄氏度以下,如果在55摄氏度的稳定温度下运行,但仍在安全范围内。“ UPD2:我换了#14和#17的位置 – 过热是位置特定的,右侧(前后看)比左侧更暖和#17号位的前#14显示顶部56C和前#17#在40-45℃下14个座位凉爽。 调整iDRAC->硬件 – >风扇 – >设置 […]

硬件RAID1configuration – 可能在一个物理磁盘上出现故障扇区。 操作系统是否自动从其他磁盘读取?

我不是一个专业的系统pipe理员,但是因为经过一段时间的研究,我无法find答案,所以希望能在这里得到一些帮助。 我们的服务器使用P222 – 一个RAID1configuration的HP智能控制器arrays。 我相信其中一个物理硬盘上的某些扇区已经失败。 我使用了hpacucli工具,输出如下所示: – $ hpacucli ctrl all show config Smart Array P222 in Slot 1 (sn: PDSXH0ARH5I0SW) array A (SATA, Unused Space: 0 MB) logicaldrive 1 (2.7 TB, RAID 1, Ready for Rebuild) physicaldrive 2I:1:1 (port 2I:box 1:bay 1, SATA, 3 TB, OK) physicaldrive 2I:1:2 (port 2I:box 1:bay 2, SATA, 3 […]

如何使用hdparm修复未决的扇区?

SMART正在说服我的服务器的硬盘上的一个未决的部门。 我读过很多文章,build议使用hdparm“轻松”强制磁盘重新定位坏扇区,但我找不到正确的方法来使用它。 我的“smartctl”中的一些信息: Error 95 occurred at disk power-on lifetime: 20184 hours (841 days + 0 hours) When the command that caused the error occurred, the device was active or idle. After command completion occurred, registers were: ER ST SC SN CL CH DH — — — — — — — 40 51 00 d7 […]

PERC MegaRAID SMART Status与smartctl不匹配 – 寻找线索HDD有什么问题

戴尔R720xd上的MegaCli和PERC H710P上的5个4Tb SATA驱动器在RAID5中出现奇怪的SMART错误 /opt/MegaRAID/MegaCli/MegaCli64 -PDList -aALL 给我一些“失败次序事件编号” Slot Number: 4 … Last Predictive Failure Event Seq Number: 7309 … Inquiry Data: PK2361PAGAZU8WHitachi HUS724040ALE640 MJAOA3B0 … Drive has flagged a SMART alert : Yes 但smartctl根本没有提供线索有什么问题: # smartctl -a -d sat+megaraid,4 /dev/sda smartctl 5.42 2011-10-20 r3458 [x86_64-linux-2.6.32-279.19.1.el6.x86_64] (local build) … Serial Number: PK2361PAGAZU8W # Note same serial, […]