サーバーのコンソールに
blk_update_request: critial medium error
が出たので調べたところ、ブートSSDに不良箇所が見つかりました。
以下、一部伏せ字。
➜ ~ sudo smartctl -a /dev/nvme0n1
smartctl 7.2 2020-12-30 r5155 [x86_64-linux-5.15.0-151-generic] (local build)
Copyright (C) 2002-20, Bruce Allen, Christian Franke, www.smartmontools.org
=== START OF INFORMATION SECTION ===
Model Number: XXXXXXXXXXXXXX
Serial Number: 23170K802496
Firmware Version: XXXXXXXX
PCI Vendor/Subsystem ID: 0x15b7
IEEE OUI Identifier: 0x001b44
Total NVM Capacity: 1,000,204,886,016 [1.00 TB]
Unallocated NVM Capacity: 0
Controller ID: 0
NVMe Version: 1.4
Number of Namespaces: 1
Namespace 1 Size/Capacity: 1,000,204,886,016 [1.00 TB]
Namespace 1 Formatted LBA Size: 512
Namespace 1 IEEE EUI-64: 001b44 8b4a6bce62
Local Time is: Sun Oct 11 07:19:51 2026 JST
Firmware Updates (0x14): 2 Slots, no Reset required
Optional Admin Commands (0x0017): Security Format Frmw_DL Self_Test
Optional NVM Commands (0x00df): Comp Wr_Unc DS_Mngmt Wr_Zero Sav/Sel_Feat Timestmp Verify
Log Page Attributes (0x7e): Cmd_Eff_Lg Ext_Get_Lg Telmtry_Lg Pers_Ev_Lg *Other*
Maximum Data Transfer Size: 256 Pages
Warning Comp. Temp. Threshold: 84 Celsius
Critical Comp. Temp. Threshold: 88 Celsius
Namespace 1 Features (0x02): NA_Fields
Supported Power States
St Op Max Active Idle RL RT WL WT Ent_Lat Ex_Lat
0 + 5.00W 5.00W - 0 0 0 0 0 0
1 + 3.30W 3.00W - 0 0 0 0 0 0
2 + 2.20W 2.00W - 0 0 0 0 0 0
3 - 0.0150W - - 3 3 3 3 1500 2500
4 - 0.0050W - - 4 4 4 4 10000 6000
5 - 0.0033W - - 5 5 5 5 176000 25000
Supported LBA Sizes (NSID 0x1)
Id Fmt Data Metadt Rel_Perf
0 + 512 0 2
1 - 4096 0 1
=== START OF SMART DATA SECTION ===
SMART overall-health self-assessment test result: FAILED!
- NVM subsystem reliability has been degraded
SMART/Health Information (NVMe Log 0x02)
Critical Warning: 0x04
Temperature: 36 Celsius
Available Spare: 100%
Available Spare Threshold: 10%
Percentage Used: 1%
Data Units Read: 7,835,399 [4.01 TB]
Data Units Written: 25,061,880 [12.8 TB]
Host Read Commands: 84,655,057
Host Write Commands: 626,787,254
Controller Busy Time: 1,651
Power Cycles: 74
Power On Hours: 27,758
Unsafe Shutdowns: 26
Media and Data Integrity Errors: 93
Error Information Log Entries: 93
Warning Comp. Temperature Time: 0
Critical Comp. Temperature Time: 0
Temperature Sensor 1: 56 Celsius
Temperature Sensor 2: 29 Celsius
...
...
公称の書き込み耐久性(この製品の場合600TBW)に対して、わずか2.1%の書き込み総量です。
寿命が来たということではなさそう。
調べてみたところ、不良箇所はPostgreSQLデータベースの内のあるテーブルでした。
そのテーブルを作り直しましたが、安心できないのでSSDは交換することにして、可能な限りのバックアップを取って、サーバーは暫定稼働状態にしました。
このPCを組んだときと比べるて、SSDの価格は3倍になっています。
完全な破損ではありませんが、要注意状態になったので、来週、SSDを交換します。
それまで、サーバーをなるべく触らないようにします。
「痛いSSD不調」への1件のフィードバック