Завис сервер Dell PowerEdge: что проверить до перезагрузки

Консоль молчит. SSH не отвечает. iDRAC при этом открывается. Не обесточивайте сервер и не нажимайте Reset. Сначала выгрузите System Event Log и системные журналы через iDRAC, запишите время сбоя и зафиксируйте состояние компонентов.
iDRAC не зависит от ОС и гипервизора. Dell в инструкции «How to Collect Logs for Advanced Troubleshooting» указывает, что для сбора журналов не нужно останавливать сервер. В первые минуты Вам нужно сохранить следы сбоя, отличить зависание ОС от отказа железа — и лишь затем перезапускать узел.
Сначала проверьте, завис ли весь сервер #
Откройте iDRAC по выделенному адресу управления. Проверьте три вещи:

- отвечает ли сам iDRAC;
- появились ли новые записи в System Event Log;
- показывает ли интерфейс ошибки дисков, памяти или процессоров.
По инструкции Dell, iDRAC собирает диагностические данные о дисках, памяти и CPU. Причину зависания Windows, Linux или гипервизора он не определит. Если аппаратный журнал чист, это ещё не значит, что сервер исправен: проблема могла возникнуть в ОС, драйвере или приложении.
Сохраните журналы до перезагрузки. Запишите точное время, когда перестали отвечать консоль и службы. Сделайте снимки состояния питания, накопителей, памяти и вентиляторов. После запуска Вы сможете сопоставить события в iDRAC с системным журналом ОС.
Если ОС или гипервизор ещё принимает команды, выгрузите журнал PERC через PERCCLI. Утилита работает в Windows, Linux и VMware, поддерживает PERC Series 8 и новее. Перезагрузка ей не нужна. Если ОС зависла наглухо, пропустите этот шаг: PERCCLI не заменяет журналы из iDRAC.
Не принимайте сетевой обрыв за зависание #
iDRAC отвечает, а прикладной адрес сервера — нет. Это ещё не повод перезагружать PowerEdge. Сначала посмотрите на индикатор линка сетевой карты и порта коммутатора, затем проверьте кабель.

Руководство Dell по устранению неполадок PowerEdge называет ещё две точки проверки. Порт NIC должен быть включён в разделе Integrated Devices. Сервер и коммутатор должны работать с согласованными скоростью и дуплексом. Ошибка в этих настройках отрезает пользователей от служб, хотя сама ОС продолжает работать.
Для сервера 1С порядок шире — используйте инструкцию по диагностике потерянной связи. Проверить придётся не только сеть, но и службы кластера, СУБД и доступность портов. Если отказала одна служба, перезагрузка всего PowerEdge увеличит простой и сотрёт часть следов, но причину не покажет.
Перезагружайте после фиксации симптомов #
Перед перезапуском проверьте, завершилось ли резервное копирование и отключены ли пользователи от прикладных систем. Если узел держит 1С, СУБД или несколько виртуальных машин, штатно остановите прикладной слой. Для 1С последовательность описана в инструкции по контролируемому перезапуску сервера.
После перезагрузки следите за POST, а не только за появлением изображения. Dell предупреждает в руководстве для PowerEdge 14-го поколения: новым системам может понадобиться до трёх минут, прежде чем появится видео. Чёрный экран в эти три минуты ещё не говорит о повторном зависании.
POST завершился — запускайте ОС и сразу сохраняйте её системные журналы за время сбоя. Сопоставьте записи с SEL по времени. Ошибка памяти или диска в iDRAC отправляет Вас к аппаратной диагностике. Зависший драйвер, нехватка памяти или сбой приложения — к журналам и настройкам ОС.
Встроенная диагностика проверит железо без загрузки ОС #
На PowerEdge 12G–16G нажмите F10 при запуске и откройте Hardware Diagnostics через Lifecycle Controller. На PowerEdge 17G встроенная диагностика находится в Boot Manager, вход — по F11.
В статье Dell «How to Run Hardware Diagnostics on the Server» перечислены проверяемые узлы: память, CPU, накопители, устройства ввода-вывода и периферия. Тесты запускаются до ОС и могут найти аппаратную неисправность, которую её средства не видят.
Сохраните код ошибки и полный результат теста. Не меняйте несколько деталей за один подход. Если сервер после этого запустится, Вы не поймёте, какой компонент вызвал сбой.
Диагностика указала на накопитель — не выдёргивайте его из-за одной записи в журнале. Сначала проверьте состояние массива, резервную копию и историю PERC. Порядок действий для дисковой подсистемы разобран в статье про SSD0001 и PDR16 в iDRAC.
Если сервер не проходит POST #
Минимальная конфигурация позволяет отделить неисправный компонент от базовой платформы. В руководстве Dell для PowerEdge 14-го поколения указаны три набора:
- для стоечного сервера — PSU1, CPU1, один DIMM в A1 и стандартный райзер без плат расширения;
- для башенного — PSU1, CPU1 и один DIMM в A1;
- для модульного — CPU1 и один DIMM в A1.
Дальше придётся работать внутри корпуса. Выключите сервер, отсоедините питание и подождите десять секунд. Dell требует антистатический коврик и браслет. Не снимайте крышку при подключённом питании: можно получить удар током.
Не запускайте PowerEdge без крышки дольше пяти минут. Дисковые отсеки и места вентиляторов должны быть заняты компонентами или штатными заглушками. Иначе нарушится воздушный поток, а к исходному сбою добавится перегрев.
Очищайте NVRAM джампером только по руководству для точной модели. Расположение джампера и порядок переключения различаются. Универсальный совет здесь опаснее его отсутствия.
Где остановить самостоятельный ремонт #
Самостоятельная диагностика заканчивается, когда нужно разбирать узел, менять системную плату или выполнять процедуру, которую руководство для Вашей модели относит к работе сервисного специалиста.
Dell пишет прямо: часть ремонтов должен выполнять сертифицированный специалист. Ущерб от неавторизованного обслуживания гарантия не покрывает. Это не формальная оговорка, а финансовая граница. Экономия на диагностике может обернуться повторной оплатой системной платы, контроллера или всего узла — из бюджета компании.
Не ставьте случайную PCIe-карту «просто для проверки». Dell предупреждает: GPU, сетевые адаптеры и другие PCIe-устройства, которые производитель не проверял для этой системы, могут лишить сервер гарантии.
Карточка действий у стойки #
- Проверьте доступность iDRAC и прикладного сетевого адреса.
- Выгрузите SEL и системные журналы, запишите время и симптомы.
- Если ОС отвечает, сохраните журнал PERC через PERCCLI.
- Штатно остановите приложения и выполните контролируемую перезагрузку.
- Дождитесь окончания POST. На новых PowerEdge видео может появиться только через три минуты.
- Запустите диагностику: F10 для 12G–16G, F11 для 17G.
- Если POST не проходит, переходите к минимальной конфигурации — либо останавливайтесь на границе гарантии.
До сбора журналов сервер не обесточивайте. Не вскрывайте включённое шасси. Не оставляйте PowerEdge без крышки дольше пяти минут и не меняйте несколько компонентов одновременно.
Если один PowerEdge держит 1С, файлы и базу, аккуратная диагностика сократит текущий простой. Но общая точка отказа останется. Следующий шаг — разнести службы по двум узлам, чтобы поломка одной машины не останавливала всю компанию.
Поделиться статьёй:
Об авторе

Диагностика и ремонт · Реальные поломки
Инженер технической поддержки, 6 лет в диагностике и ремонте серверов. Знает, почему серверы ломаются и как этого избежать. Объясняет сложное простым языком.
Все статьи автора →Похожие материалы

Где покупать серверы Dell в России: как выбрать поставщика и проверить его до оплаты
Три предложения на PowerEdge R650 могут отличаться не только на 80 000 ₽, но и составом работ, поддержкой и ответственностью за ремонт. Семь проверок помогут сравнить полную поставку и отсеять поставщика до аванса.

Лицензирование Windows Server на Dell PowerEdge: считаем ядра, VM и CAL
PowerEdge с двумя 24-ядерными CPU требует лицензий на 48 физических ядер, а для шести Windows-VM редакции Standard — на 144. Показываем, как сравнить Standard и Datacenter, посчитать CAL и проверить счёт до оплаты.

Регламент резервного копирования: как проверить, что данные восстановятся
Ежедневные копии не гарантируют, что 1С или виртуальная машина поднимется после сбоя. Каркас регламента связывает расписание с RTO и RPO, назначает ответственных и задаёт четыре уровня тестов — от файла до площадки.