SSD0001 и PDR16 в iDRAC: когда менять диск

Сначала в LifeCycle Log появился SSD0001, следом — PDR16. Сервер работает, виртуальный диск остаётся доступным, пользователи ничего не замечают. Но откладывать проверку нельзя: по статье Dell PowerEdge: What is Predictive Drive Failure and How to Resolve It накопитель после такого предупреждения может отказать в любой момент.
Ваша задача — сохранить данные и понять причину события. Иногда диск выработал ресурс и требует замены. Иногда контроллер или прошивка неверно передают его состояние. Покупать новый SSD до проверки рано, продолжать работу без резервной копии — рискованно.
В этой статье разбираем только SSD0001 и PDR16. Другие сообщения iDRAC и LifeCycle Log требуют документации для конкретной модели PowerEdge, версии контроллера и накопителя.
Что контроллер увидел до появления PDR16 #
PDR16 сообщает не об одиночной ошибке чтения, а о прогнозируемом отказе. SMART и RAID-контроллер наблюдают за статистикой накопителя: количеством и частотой ошибок, состоянием резервной области и другими доступными показателями.

Жёсткий диск умеет переназначать повреждённые блоки в запасную область. Пользователь не замечает первые дефекты: контроллер продолжает читать и записывать данные по новым адресам. Когда ошибки повторяются, Dell рекомендует готовить диск к замене.
У некоторых корпоративных Dell SSD последовательность точнее описывает износ флеш-памяти. В статье Dell PowerEdge: Enterprise SAS SATA SSD — SMART predictive failures событие SSD0001 появляется раньше PDR16, когда оставшийся ресурс записи опускается ниже установленного порога.
Dell относит эту схему, среди прочего, к PowerEdge R640, R650, R660, R740xd, R750, R760, R7525, R7625 и R840. Переносить ту же расшифровку на SSD и серверы за пределами списка из документа нельзя: одинаковая запись в журнале ещё не доказывает одинаковую причину.
Сначала сохраните данные и состояние сервера #
До обновления прошивок и замены диска сделайте резервную копию. Предупреждение predictive failure означает, что времени на спокойную диагностику накопитель может не дать.
Затем выгрузите SupportAssist Collection вместе с журналом RAID-контроллера. Этот архив фиксирует состояние системы до вмешательства. Он пригодится, если после перезагрузки событие исчезнет или поддержку Dell придётся подключать к разбору.
Проверьте доступные обновления для трёх компонентов:
- накопителя;
- iDRAC;
- RAID-контроллера.
Dell рекомендует обновить прошивки до замены оборудования, потому что ложный predictive failure может возникнуть из-за прошивки или ошибки отчётности. Обновление RAID-контроллера завершится только после перезагрузки.
Если PowerEdge обслуживает 1С, согласуйте остановку служб и используйте порядок перезапуска сервера 1С. Перезагрузка без подготовки может оборвать пользовательские сеансы, даже если сам RAID исправен.
После обновления снова проверьте LifeCycle Log, состояние физического диска и виртуального массива. Исчезнувшее предупреждение не отменяет наблюдение за накопителем, но даёт основание не менять его немедленно. Устойчивый PDR16 после обновления — основание для замены.
Один проблемный диск меняют, несколько — исследуют вместе #
Если предупреждение сохраняется на одном накопителе, Dell предписывает заменить физический диск. После перестроения массива виртуальный диск должен вернуться в состояние Optimal. До этого работу нельзя считать законченной.
Не вытаскивайте накопитель только по номеру отсека из памяти или старой записи в журнале. Перед заменой ещё раз сопоставьте слот, состояние физического диска и конфигурацию виртуального массива в iDRAC или PERC. Ошибка со слотом превратит деградировавший RAID в недоступный.
Несколько одновременных PDR16 или SMART-ошибок требуют другого подхода. Dell рекомендует передать журналы в поддержку, а не менять диски по очереди. Общая причина может находиться вне отдельных накопителей, поэтому последовательная замена уничтожит часть диагностических признаков и добавит перестроения RAID.
Перед обращением проверьте срок и уровень сервиса: условия Dell ProSupport определяют порядок обработки заявки и доступные варианты обслуживания.
Исчерпанный ресурс SSD не равен гарантийному дефекту #
SSD0001 перед PDR16 может означать, что накопитель приблизился к пределу ресурса записи. Это ожидаемый износ флеш-памяти, а не автоматически заводской брак.
Ограниченная гарантия Dell покрывает отказы из-за дефектов материалов или изготовления. Достижение максимального Device Life в это покрытие не входит — Dell фиксирует это в разделе How long does this limited hardware warranty last условий Limited Hardware Warranty.
Поэтому SSD с выработанным ресурсом стоит сразу закладывать в бюджет на замену. Наличие действующей поддержки помогает провести диагностику, но само по себе не превращает износ в гарантийный случай.
Рабочая последовательность для SSD0001 и PDR16 #
Действуйте в таком порядке:
- Сделайте резервную копию данных.
- Выгрузите SupportAssist Collection с журналом контроллера.
- Обновите прошивки накопителя, iDRAC и RAID-контроллера.
- Выполните согласованную перезагрузку.
- Повторно проверьте LifeCycle Log и состояние RAID.
- Замените один диск с устойчивым predictive failure.
- При одинаковых предупреждениях на нескольких дисках передайте журналы в Dell Support.
После замены дождитесь состояния Optimal у виртуального диска. Если SSD выработал ресурс записи, планируйте новый накопитель без расчёта на гарантийное покрытие.
Поделиться статьёй:
Об авторе

Диагностика и ремонт · Реальные поломки
Инженер технической поддержки, 6 лет в диагностике и ремонте серверов. Знает, почему серверы ломаются и как этого избежать. Объясняет сложное простым языком.
Все статьи автора →Похожие материалы

Регламент резервного копирования: как проверить, что данные восстановятся
Ежедневные копии не гарантируют, что 1С или виртуальная машина поднимется после сбоя. Каркас регламента связывает расписание с RTO и RPO, назначает ответственных и задаёт четыре уровня тестов — от файла до площадки.

Завис сервер Dell PowerEdge: что проверить до перезагрузки
ОС не отвечает, но iDRAC доступен. До перезагрузки выгрузите SEL, отделите сетевой обрыв от аппаратного сбоя и сохраните признаки отказа. Порядок проверки PowerEdge: от первых минут до F10/F11-диагностики и границы гарантийного ремонта.

Мониторинг Dell PowerEdge через iDRAC и SNMP: опрос, traps и Zabbix
Зелёный узел в Zabbix не доказывает, что диски, RAID и блоки питания исправны. Настраиваем опрос iDRAC по SNMP, добавляем traps и проверяем оба канала тестовым событием из Lifecycle Log.