DellShop B2B

Завис сервер Dell PowerEdge: что проверить до перезагрузки

1 сентября 2026 г.·5 мин чтения·Марина ЧерныхМарина Черных
Завис сервер Dell PowerEdge: что проверить до перезагрузки

Консоль молчит. SSH не отвечает. iDRAC при этом открывается. Не обесточивайте сервер и не нажимайте Reset. Сначала выгрузите System Event Log и системные журналы через iDRAC, запишите время сбоя и зафиксируйте состояние компонентов.

iDRAC не зависит от ОС и гипервизора. Dell в инструкции «How to Collect Logs for Advanced Troubleshooting» указывает, что для сбора журналов не нужно останавливать сервер. В первые минуты Вам нужно сохранить следы сбоя, отличить зависание ОС от отказа железа — и лишь затем перезапускать узел.

Сначала проверьте, завис ли весь сервер #

Откройте iDRAC по выделенному адресу управления. Проверьте три вещи:

Сеть проверяют до перезагрузки

  • отвечает ли сам iDRAC;
  • появились ли новые записи в System Event Log;
  • показывает ли интерфейс ошибки дисков, памяти или процессоров.

По инструкции Dell, iDRAC собирает диагностические данные о дисках, памяти и CPU. Причину зависания Windows, Linux или гипервизора он не определит. Если аппаратный журнал чист, это ещё не значит, что сервер исправен: проблема могла возникнуть в ОС, драйвере или приложении.

Сохраните журналы до перезагрузки. Запишите точное время, когда перестали отвечать консоль и службы. Сделайте снимки состояния питания, накопителей, памяти и вентиляторов. После запуска Вы сможете сопоставить события в iDRAC с системным журналом ОС.

Если ОС или гипервизор ещё принимает команды, выгрузите журнал PERC через PERCCLI. Утилита работает в Windows, Linux и VMware, поддерживает PERC Series 8 и новее. Перезагрузка ей не нужна. Если ОС зависла наглухо, пропустите этот шаг: PERCCLI не заменяет журналы из iDRAC.

Не принимайте сетевой обрыв за зависание #

iDRAC отвечает, а прикладной адрес сервера — нет. Это ещё не повод перезагружать PowerEdge. Сначала посмотрите на индикатор линка сетевой карты и порта коммутатора, затем проверьте кабель.

Один DIMM для проверки POST

Руководство Dell по устранению неполадок PowerEdge называет ещё две точки проверки. Порт NIC должен быть включён в разделе Integrated Devices. Сервер и коммутатор должны работать с согласованными скоростью и дуплексом. Ошибка в этих настройках отрезает пользователей от служб, хотя сама ОС продолжает работать.

Для сервера 1С порядок шире — используйте инструкцию по диагностике потерянной связи. Проверить придётся не только сеть, но и службы кластера, СУБД и доступность портов. Если отказала одна служба, перезагрузка всего PowerEdge увеличит простой и сотрёт часть следов, но причину не покажет.

Перезагружайте после фиксации симптомов #

Перед перезапуском проверьте, завершилось ли резервное копирование и отключены ли пользователи от прикладных систем. Если узел держит 1С, СУБД или несколько виртуальных машин, штатно остановите прикладной слой. Для 1С последовательность описана в инструкции по контролируемому перезапуску сервера.

После перезагрузки следите за POST, а не только за появлением изображения. Dell предупреждает в руководстве для PowerEdge 14-го поколения: новым системам может понадобиться до трёх минут, прежде чем появится видео. Чёрный экран в эти три минуты ещё не говорит о повторном зависании.

POST завершился — запускайте ОС и сразу сохраняйте её системные журналы за время сбоя. Сопоставьте записи с SEL по времени. Ошибка памяти или диска в iDRAC отправляет Вас к аппаратной диагностике. Зависший драйвер, нехватка памяти или сбой приложения — к журналам и настройкам ОС.

Встроенная диагностика проверит железо без загрузки ОС #

На PowerEdge 12G–16G нажмите F10 при запуске и откройте Hardware Diagnostics через Lifecycle Controller. На PowerEdge 17G встроенная диагностика находится в Boot Manager, вход — по F11.

В статье Dell «How to Run Hardware Diagnostics on the Server» перечислены проверяемые узлы: память, CPU, накопители, устройства ввода-вывода и периферия. Тесты запускаются до ОС и могут найти аппаратную неисправность, которую её средства не видят.

Сохраните код ошибки и полный результат теста. Не меняйте несколько деталей за один подход. Если сервер после этого запустится, Вы не поймёте, какой компонент вызвал сбой.

Диагностика указала на накопитель — не выдёргивайте его из-за одной записи в журнале. Сначала проверьте состояние массива, резервную копию и историю PERC. Порядок действий для дисковой подсистемы разобран в статье про SSD0001 и PDR16 в iDRAC.

Если сервер не проходит POST #

Минимальная конфигурация позволяет отделить неисправный компонент от базовой платформы. В руководстве Dell для PowerEdge 14-го поколения указаны три набора:

  • для стоечного сервера — PSU1, CPU1, один DIMM в A1 и стандартный райзер без плат расширения;
  • для башенного — PSU1, CPU1 и один DIMM в A1;
  • для модульного — CPU1 и один DIMM в A1.

Дальше придётся работать внутри корпуса. Выключите сервер, отсоедините питание и подождите десять секунд. Dell требует антистатический коврик и браслет. Не снимайте крышку при подключённом питании: можно получить удар током.

Не запускайте PowerEdge без крышки дольше пяти минут. Дисковые отсеки и места вентиляторов должны быть заняты компонентами или штатными заглушками. Иначе нарушится воздушный поток, а к исходному сбою добавится перегрев.

Очищайте NVRAM джампером только по руководству для точной модели. Расположение джампера и порядок переключения различаются. Универсальный совет здесь опаснее его отсутствия.

Где остановить самостоятельный ремонт #

Самостоятельная диагностика заканчивается, когда нужно разбирать узел, менять системную плату или выполнять процедуру, которую руководство для Вашей модели относит к работе сервисного специалиста.

Dell пишет прямо: часть ремонтов должен выполнять сертифицированный специалист. Ущерб от неавторизованного обслуживания гарантия не покрывает. Это не формальная оговорка, а финансовая граница. Экономия на диагностике может обернуться повторной оплатой системной платы, контроллера или всего узла — из бюджета компании.

Не ставьте случайную PCIe-карту «просто для проверки». Dell предупреждает: GPU, сетевые адаптеры и другие PCIe-устройства, которые производитель не проверял для этой системы, могут лишить сервер гарантии.

Карточка действий у стойки #

  1. Проверьте доступность iDRAC и прикладного сетевого адреса.
  2. Выгрузите SEL и системные журналы, запишите время и симптомы.
  3. Если ОС отвечает, сохраните журнал PERC через PERCCLI.
  4. Штатно остановите приложения и выполните контролируемую перезагрузку.
  5. Дождитесь окончания POST. На новых PowerEdge видео может появиться только через три минуты.
  6. Запустите диагностику: F10 для 12G–16G, F11 для 17G.
  7. Если POST не проходит, переходите к минимальной конфигурации — либо останавливайтесь на границе гарантии.

До сбора журналов сервер не обесточивайте. Не вскрывайте включённое шасси. Не оставляйте PowerEdge без крышки дольше пяти минут и не меняйте несколько компонентов одновременно.

Если один PowerEdge держит 1С, файлы и базу, аккуратная диагностика сократит текущий простой. Но общая точка отказа останется. Следующий шаг — разнести службы по двум узлам, чтобы поломка одной машины не останавливала всю компанию.

Поделиться статьёй:

TelegramVKWhatsApp

Об авторе

Марина Черных
Марина Черных

Диагностика и ремонт · Реальные поломки

Инженер технической поддержки, 6 лет в диагностике и ремонте серверов. Знает, почему серверы ломаются и как этого избежать. Объясняет сложное простым языком.

Все статьи автора →

Похожие материалы

Где покупать серверы Dell в России: как выбрать поставщика и проверить его до оплаты

Где покупать серверы Dell в России: как выбрать поставщика и проверить его до оплаты

Три предложения на PowerEdge R650 могут отличаться не только на 80 000 ₽, но и составом работ, поддержкой и ответственностью за ремонт. Семь проверок помогут сравнить полную поставку и отсеять поставщика до аванса.

03.09.20266 мин
Регламент резервного копирования: как проверить, что данные восстановятся

Регламент резервного копирования: как проверить, что данные восстановятся

Ежедневные копии не гарантируют, что 1С или виртуальная машина поднимется после сбоя. Каркас регламента связывает расписание с RTO и RPO, назначает ответственных и задаёт четыре уровня тестов — от файла до площадки.

01.09.20268 мин