7 мин

Первичная настройка iLO и iDRAC после монтажа сервера

Практическая настройка iLO и iDRAC: отдельная сеть управления, учетные записи, оповещения, журналы, прошивки и приемка удаленного доступа.

Первичная настройка iLO и iDRAC после монтажа сервера

Сервер нельзя передавать в эксплуатацию, пока его контроллер управления доступен по случайному адресу, принимает заводскую учетную запись или молчит при отказе блока питания. Установленная операционная система и зеленые индикаторы не доказывают готовность iLO или iDRAC. Готовность доказывает только проверенный путь от рабочего места дежурного инженера до консоли, питания, журналов и оповещений.

Я рассматриваю контроллер управления как отдельный административный компьютер внутри корпуса. Он работает, когда основная ОС не загрузилась, умеет менять питание и подключать виртуальный носитель, поэтому ошибка в его настройке опаснее обычной ошибки на прикладном интерфейсе. Первичную настройку нужно закончить до передачи сервера владельцу сервиса, пока допустимы перезагрузки и рядом есть человек с доступом к стойке.

Сеть управления должна быть отдельным контуром

Подключите iLO или iDRAC к выделенному порту управления и поместите его в административную сеть, недоступную из пользовательских и серверных сегментов. Выделенный физический порт предпочтительнее совместного режима с рабочим сетевым адаптером: неисправность, перенастройка или перегрузка производственного интерфейса тогда не отрежет аварийный доступ. Совместный режим допустим для малой площадки, но это осознанный компромисс, который надо записать в паспорт сервера.

Статический адрес обычно проще сопровождать, чем бессрочная DHCP-аренда. Если организация выдает адреса через DHCP reservation, резервирование должно опираться на MAC-адрес контроллера, а не на наклейку основного адаптера. После перезагрузки контроллера проверьте адрес, маску, шлюз, VLAN и оба DNS-сервера. Ошибка VLAN особенно коварна: интерфейс может отвечать инженеру в серверной через временный порт, но оставаться недоступным через штатный маршрут.

Dell в руководстве по первоначальной настройке iDRAC9 разрешает задать статический адрес или DHCP через System Setup, Lifecycle Controller либо переднюю панель. Там же DNS-регистрация названа условием для каталогов Active Directory и LDAP. Это не повод включать динамическую регистрацию без контроля. Создайте согласованную запись A и, если процесс организации это требует, PTR, затем проверьте имя с той сети, где работают администраторы и система мониторинга.

Правила межсетевого экрана должны разрешать только нужные источники и сервисы. Обычно веб-интерфейсу и Redfish нужен HTTPS, мониторингу может понадобиться SNMPv3 или прием событий Redfish, а централизованному журналу нужен syslog. Не открывайте весь административный VLAN только потому, что он внутренний. Прыжковый узел, VPN администраторов и серверы мониторинга образуют понятный список источников; пользовательская подсеть в нем лишняя.

Отдельно решите, что делать с IPv6. Контроллер может получить link-local или автоматический глобальный адрес, хотя команда сопровождения учитывает только IPv4. Тогда фильтры, инвентаризация и сканирование показывают разную картину. Если IPv6 используется, назначьте ему адрес, DNS, маршрут и те же ограничения источников. Если организация не обслуживает IPv6 в контуре управления, отключите его на BMC и порту осознанно, а не оставляйте без наблюдения.

Резервирование тоже проверяют по всей цепочке. Два блока питания и два коммутатора не спасают, если единственный шлюз, VPN-концентратор или прыжковый узел отрезает управление. Нарисуйте фактический путь пакета от дежурного до BMC и отметьте каждую одиночную точку отказа. Устранять все сразу не всегда разумно, но владелец сервиса должен знать, при каком отказе потребуется физический выезд и кто имеет право попасть в зал.

Зафиксируйте физическое соответствие до ухода из зала: имя стойки, юнит, серийный номер, сервисный идентификатор, MAC контроллера, его IP и подключенный порт коммутатора. Команда сети должна суметь найти кабель по записи, а дежурный инженер должен отличить нужный сервер от соседнего без догадок.

Имя, время и сертификат настраивают до каталога

Задайте контроллеру уникальное имя, корректный DNS-суффикс, часовой пояс и не менее двух доступных NTP-источников до подключения каталожной аутентификации и оповещений. Время участвует в проверке сертификатов, записях аудита и разборе цепочки отказа. Если BMC отстает на семь минут, события гипервизора, коммутатора и массива уже нельзя уверенно сложить в одну последовательность.

Руководство iDRAC9 отдельно предупреждает, что разные настройки RTC и часового пояса iDRAC могут дать неожиданное поведение, и советует включить NTP ради точных меток. HPE также предоставляет отдельный сервис даты и времени iLO с настраиваемыми NTP-серверами. После применения настроек не ограничивайтесь зеленым статусом: сравните текущую метку BMC с доверенным источником, перезагрузите сам контроллер и проверьте ее снова.

Заводской самоподписанный сертификат годится только для первого входа в изолированном контуре. Выпустите сертификат от внутреннего центра сертификации на то DNS-имя, которым реально будут пользоваться люди и автоматизация. Включите полную цепочку доверия на рабочих станциях, в мониторинге и в инструментах Redfish. Привычка нажимать «продолжить несмотря на предупреждение» обучает администратора игнорировать ровно тот сигнал, который должен остановить соединение с подмененным контроллером.

Перед импортом проверьте SAN, срок действия, назначение ключа и соответствие закрытого ключа сертификату. После замены откройте интерфейс по имени, не по IP, и убедитесь, что клиент видит правильную цепочку без исключений. Запишите владельца сертификата и способ продления. Сертификат с годовым сроком, о котором никто не получает напоминание, превращает аварийный вход в отдельную аварию.

Учетные записи получают ровно нужные права

Сразу смените первоначальный пароль, создайте именные учетные записи и уберите общий административный логин из повседневной работы. У новых iDRAC пароль может быть уникальным и напечатанным на информационной бирке, но уникальный заводской секрет все равно известен каждому, кто видел корпус или акт поставки. Его задача состоит в первом входе, а не в многолетней эксплуатации.

Разделите роли. Оператор мониторинга читает состояние и журналы. Дежурный администратор открывает консоль и выполняет согласованные операции питания. Группа аппаратной платформы меняет настройки и прошивки. Право управлять пользователями остается у меньшего числа сотрудников. HPE iLO и Dell iDRAC поддерживают локальные роли и каталожную аутентификацию; конкретные названия привилегий различаются, поэтому проверяйте итоговые разрешения, а не сходство названий групп.

Каталог удобен для отзыва доступа и аудита, но локальная аварийная учетная запись все равно нужна. Храните ее пароль в корпоративном хранилище секретов с контролем выдачи, а не в файле рядом с паспортом стойки. Испытайте вход этой учетной записью при недоступном каталоге или через правило, которое временно блокирует BMC от LDAP. Если аварийный логин никогда не проверяли, считать его резервом нельзя.

Многофакторную аутентификацию включайте там, где ее поддерживает модель, версия прошивки и ваш способ входа. При этом проверьте не только веб-интерфейс, но и API, консоль, мобильный или прямой сервисный канал, если организация ими пользуется. Исключение для автоматизации должно иметь отдельную сервисную учетную запись, минимальную роль, ограничение по источнику и план ротации секрета.

После настройки выполните отрицательные тесты: оператор мониторинга не должен менять питание, консольный оператор не должен создавать пользователей, а удаленный сотрудник без VPN не должен видеть порт HTTPS. Успешный вход администратора доказывает лишь наличие одного пути. Именно отказ запрещенной операции доказывает, что граница прав работает.

Ненужный протокол лучше выключить

Оставьте включенными только те интерфейсы, для которых есть владелец и практический сценарий. Старые версии IPMI over LAN, Telnet, неиспользуемый SSH, SNMPv1 и общие community-строки увеличивают поверхность атаки и обычно сохраняются не по необходимости, а по инерции. В руководстве по безопасности iDRAC9 Dell прямо предлагает отключать IPMI over LAN командой racadm set idrac.ipmilan.Enable 0, а Telnet выключать в пользу SSH.

Не переносите эту команду вслепую на каждый сервер. Сначала спросите систему мониторинга, оркестратор и инструмент развертывания, каким протоколом они обращаются к BMC. Затем отключите один интерфейс, выполните их контрольные операции и только после этого сохраните эталон. Сломать ночной сбор аппаратных датчиков легко, если дневная проверка ограничилась веб-страницей.

Для SNMP выбирайте SNMPv3 с аутентификацией и шифрованием, если мониторинг его поддерживает. Если наследственная система требует SNMPv1 или v2c, ограничьте источник ACL, выдайте отдельную непредсказуемую строку и заведите задачу на вывод зависимости. Название public внутри закрытого VLAN не становится безопаснее.

Проверьте настройки TLS и отключите устаревшие версии протокола в пределах возможностей прошивки. Ограничьте длительность сессии и число неудачных входов так, чтобы защита не мешала аварийной работе, но останавливала простой перебор. Зафиксируйте прямой USB или host interface: такой канал полезен для обслуживания, однако привилегированный пользователь ОС иногда получает через него особый путь к BMC. Если функция не нужна, отключите ее; если нужна, внесите в модель доступа.

Закончите сканированием портов с разрешенного административного узла и с запрещенного сегмента. Первый результат должен совпасть с перечнем сервисов, второй не должен показывать контроллер вообще. Интерфейс BMC считается закрытым не тогда, когда переключатель выглядит правильно, а когда пакет проходит или не проходит согласно правилу.

Оповещение считается настроенным только после доставки

Серверы казахстанского производства
Статус отечественного производителя и локальное производство упрощают обоснование оборудования для государственных закупок.
Выбрать сервер

Настройте аппаратные события так, чтобы отказ диска, блока питания, вентилятора, памяти, превышение температуры и потеря резервирования попадали в дежурный канал без участия основной ОС. iLO и iDRAC продолжают наблюдать за платформой при сбое хоста, в этом и состоит смысл внешнего контура управления. Почта отдельному инженеру не заменяет очередь инцидентов или систему мониторинга с расписанием дежурств.

Выберите один основной транспорт и один разумный резерв. Для современной интеграции подойдут события Redfish или SNMPv3 traps; удаленный syslog помогает сохранить контекст; электронная почта годится как дополнительный путь. DMTF Redfish Specification описывает подписку: клиент создает ресурс в коллекции EventService Subscriptions, после чего контроллер отправляет события на заданный HTTPS-получатель. Это полноценная доставка, но получатель обязан проверять подлинность, отвечать вовремя и переживать повторные события.

Фильтры важнее количества адресатов. Информационное сообщение о входе не должно будить инженера, а критический отказ обоих путей питания не должен теряться среди сотен уведомлений. Сопоставьте категории производителя с приоритетами вашей системы: critical открывает инцидент, warning требует реакции в рабочее или заданное регламентом время, informational остается доступным для поиска. Не отключайте целую категорию из-за одного шумного датчика, разберите источник шума.

Отправьте встроенное тестовое событие каждым настроенным транспортом. Руководство iDRAC9 позволяет выбрать Email, SNMP Trap, Remote System Log, Redfish Event и другие действия, затем создать тест по идентификатору сообщения. HPE iLO также умеет отправлять тестовый SNMP alert. Проверьте конечный результат: запись появилась с правильным именем сервера, временем, тяжестью и маршрутом эскалации. Надпись «test sent» на BMC подтверждает отправку, но не прием.

После синтетического теста создайте безопасное реальное событие, которое допускает процедура площадки, например временно извлеките один резервный блок питания на сервере без нагрузки и сразу установите его обратно. Согласуйте действие заранее и не применяйте его к системе, где нет подтвержденного резервирования. Цель состоит в проверке всей цепочки от датчика до закрытия инцидента, включая сообщение о восстановлении.

Журналы нужно вынести за пределы контроллера

Отправляйте события BMC в централизованное хранилище и сохраните исходный снимок локальных журналов при приемке. Локальный журнал ограничен по объему, может циклически перезаписываться и становится недоступным вместе с контроллером. В документации HPE перечислены Security Log, Integrated Management Log, iLO Event Log и Alert Event Log; они отвечают на разные вопросы и не заменяют друг друга.

Не смешивайте аппаратный журнал и аудит действий. Первый объясняет, когда диск сообщил ошибку или температура пересекла порог. Второй показывает, кто вошел, изменил настройки, очистил журнал или подал команду питания. Для расследования нужны оба потока с точным временем и стабильным идентификатором сервера. Если приемник заменяет имя BMC одним IP, смена адреса порвет историю.

Настройте remote syslog, экспорт через Redfish или сбор средствами платформы управления. Затем найдите тестовое сообщение на приемнике по серийному номеру и времени. Проверьте парсинг полей, а не только наличие сырой строки: система должна различать severity, компонент, код сообщения и состояние восстановления. Иначе дежурный получит текст, но автоматическое правило не откроет инцидент.

Перед очисткой заводских событий экспортируйте журналы. В них могут находиться записи от сборки, прогона и транспортировки, которые полезны как исходная история. После экспорта очистите только те журналы, для которых это предусмотрено вашим регламентом, перезагрузите BMC и убедитесь, что новые события продолжают уходить наружу. HPE отмечает, что новые записи вытесняют старые при заполнении ряда журналов; внешний сбор устраняет зависимость от этого кольцевого буфера.

Установите срок хранения по требованиям организации и назначению системы. Журнал управления сервером может содержать имена учетных записей, IP-адреса и сведения о конфигурации, поэтому доступ к нему тоже ограничивают. Долгое хранение без поиска и контроля целостности дает ощущение архива, но мало помогает во время отказа.

Прошивку обновляют как связанный комплект

Стойка на базе S200
Высокопроизводительные стоечные серверы S200 производятся на трех площадках GSE в Казахстане.
Выбрать сервер

Снимите инвентаризацию версий, прочитайте примечания к выпуску для точной модели и спланируйте обновление BMC, BIOS, RAID, сетевых адаптеров, накопителей и блоков питания как одну согласованную работу. Обновить только iLO или iDRAC до последней найденной версии удобно, но зависимости компонентов и минимальные промежуточные версии иногда меняют правильный порядок.

Используйте каталог и инструменты производителя для поколения сервера. HPE iLO 6 User Guide рекомендует управлять очередью установки через Smart Update Manager. Dell Lifecycle Controller умеет обновлять поддерживаемые компоненты и показывает очередь заданий. Оба подхода ценны тем, что сохраняют состояние работы и учитывают перезагрузки лучше, чем набор случайно скачанных пакетов.

До начала сохраните текущую конфигурацию BMC, список версий и доступный путь отката. Dell описывает rollback через Lifecycle Controller, но прежняя версия доступна не для каждого компонента и зависит от способа предыдущего обновления. Поэтому наличие кнопки Rollback не равно гарантии возврата. Проверьте условия для вашей модели и сохраните подходящий пакет отдельно по правилам организации.

Во время обновления не снимайте питание и не перезапускайте контроллер вручную. Некоторые компоненты требуют выключения хоста, другие ставят обновление в очередь до следующей перезагрузки. Дождитесь завершения каждого задания, просмотрите Lifecycle Log или соответствующий журнал iLO и только затем переходите к проверкам. Зеленый общий статус не заменяет запись об успешном завершении каждого компонента.

После обновления повторно проверьте сеть управления, сертификат, учетные записи, время, подписки событий, remote syslog и виртуальную консоль. Прошивка может сбросить параметр, изменить поведение браузера или потребовать новый сеанс. Сравнение экспортированной конфигурации до и после быстрее находит дрейф, чем визуальный обход десятков вкладок.

Удаленная консоль обязана работать извне серверной

Проверьте консоль, виртуальный носитель и управление питанием с того рабочего места и через тот маршрут, которыми воспользуется дежурный ночью. Тест с ноутбука, подключенного к тому же коммутатору в зале, обходит VPN, межсетевой экран, DNS, доверие сертификату и ограничения браузера. Он подтверждает только локальную связность.

Откройте HTML-консоль, наблюдайте полный POST и вход в настройки, но не меняйте производственную загрузку без необходимости. Проверьте раскладку клавиатуры, передачу служебных клавиш, масштаб и повторное подключение после перезапуска BMC. Если лицензия или модель ограничивает часть функций, обнаружить это нужно до аварии и записать допустимый альтернативный путь.

Подключите небольшой утвержденный ISO как виртуальный носитель, убедитесь, что сервер видит его в списке загрузки, затем отключите. Не оставляйте образ смонтированным: при следующем рестарте он может изменить загрузочное поведение, а открытая сессия создает ненужную зависимость от компьютера инженера. Право Virtual Media выдавайте только тем ролям, которым оно действительно нужно.

Команды питания проверяйте осторожно. На новом сервере без рабочей нагрузки можно выполнить штатное включение, мягкое выключение и однократную загрузку с нужного устройства. Жесткое выключение или reset используют только по согласованному сценарию. Интерфейс, где кнопка видна, но роль не позволяет выполнить команду, надо проверить заранее, а не считать исправным по внешнему виду.

Наконец, имитируйте потерю основного пути администрирования: закройте обычную SSH-сессию к ОС и зайдите только через контур BMC. Дежурный должен найти сервер по CMDB, открыть интерфейс по имени, получить аварийный секрет по утвержденной процедуре и увидеть консоль. Этот короткий прогон обнаруживает больше организационных разрывов, чем еще один просмотр настроек.

Redfish дает воспроизводимую проверку

Контур управления входит в проект
Системные интеграторы GSE учитывают серверы, сеть управления и инфраструктуру дата-центра как связанную систему.
Обсудить проект

Используйте Redfish для чтения базового состояния после ручной настройки и сохраняйте результат рядом с актом приемки. iLO и iDRAC различаются расширениями производителя, но стандартные ресурсы Manager, Systems, AccountService, EventService и UpdateService дают общую основу. Автоматическая проверка не должна сразу менять параметры: сначала сделайте безопасный read-only сбор и сравните его с эталоном.

Ниже минимальный пример для уже созданного временного сеансового токена. Он не отключает проверку TLS и не кладет пароль в командную строку. Значения BMC и TOKEN задайте в текущем сеансе оболочки, а токен удалите после работы.

curl -sS -H 'X-Auth-Token: '$TOKEN https://$BMC/redfish/v1/Managers/1
curl -sS -H 'X-Auth-Token: '$TOKEN https://$BMC/redfish/v1/Systems/1
curl -sS -H 'X-Auth-Token: '$TOKEN https://$BMC/redfish/v1/EventService

Первый ответ должен содержать объект Manager с полями вроде Id, Name, FirmwareVersion, DateTime и Status, если конкретная реализация их предоставляет. Второй дает модель, серийный номер, питание и агрегированное состояние системы. Третий показывает, включен ли сервис событий, и указывает коллекцию подписок. HTTP 200 вместе с JSON-объектом подтверждает чтение; 401 означает проблему токена или роли; ошибка проверки сертификата означает, что цепочка доверия еще не готова, и обходить ее флагом небезопасно.

Не закрепляйте /Managers/1 как вечную истину в большой системе. Надежный клиент начинает с /redfish/v1, переходит по ссылкам и учитывает несколько элементов коллекции. Для приемочного скрипта конкретный путь допустим только после проверки на выбранной модели. Также не предполагайте, что одинаковое имя поля в OEM-разделах HPE и Dell имеет одинаковую семантику.

Сохраните санитизированный результат без токенов, сетевых секретов и персональных данных. Полезный отчет содержит время проверки, DNS-имя, серийный номер, модели и версии прошивок, состояние компонентов, включение EventService и перечень ожидаемых подписок. При следующей поставке этот файл превращается в проверяемый эталон, а не в еще одну инструкцию, которую каждый инженер трактует по-своему.

Передача в эксплуатацию заканчивается доказательствами

Подпишите приемку только после независимой проверки другим инженером или владельцем платформы. Автор настройки легко видит то, что ожидал увидеть. Проверяющий должен получить адрес из CMDB, войти своей ролью, найти тестовое событие в мониторинге, открыть архив журнала и подключить консоль без подсказок из личных заметок.

Приемочная запись должна содержать следующие доказательства:

  • IP, DNS, VLAN, порт коммутатора, стойку и юнит;
  • серийный номер, модель, версии BMC, BIOS и основных компонентов;
  • владельцев ролей, место аварийного секрета и дату проверки доступа;
  • идентификаторы тестовых событий в мониторинге и централизованном журнале;
  • результат консоли, виртуального носителя, питания и план следующего обновления.

Не прикладывайте пароль, токен или SNMP-секрет к этому документу. Укажите запись в хранилище секретов и процедуру получения. Отдельно запишите принятые исключения: совместный сетевой порт, временный SNMPv2c, самоподписанный сертификат на изолированной площадке или отсутствие лицензированной консоли. У каждого исключения должны быть владелец, причина и срок пересмотра.

Для проектов, где GSE поставляет серверы и выполняет системную интеграцию, этот протокол удобно согласовать с командой внедрения до монтажа: производитель контролирует поставку и оказывает круглосуточную техническую поддержку через сервисную сеть. Но ответственность за маршруты, учетные записи, получателей событий и приемочные доказательства все равно нужно назначить внутри организации.

Сервер готов не после первого успешного входа в BMC, а после воспроизводимого отказа запрещенного доступа и воспроизводимого успеха разрешенного. Выдерните временный монтажный кабель, закройте заводской пароль и попросите дежурного пройти путь еще раз. Если он видит консоль и тестовый инцидент только по штатным системам, стойку можно передавать в эксплуатацию.

FAQ

Нужно ли выделять отдельный физический порт для iLO или iDRAC?

Да, если модель сервера и сеть это позволяют. Выделенный порт сохраняет аварийный доступ при проблемах рабочего адаптера и упрощает фильтрацию трафика; совместный режим допустим только как записанное исключение.

Статический IP для BMC лучше DHCP?

Для большинства серверных площадок статический адрес проще искать и сопровождать. DHCP reservation тоже работает, если резервирование привязано к правильному MAC-адресу, срок аренды предсказуем, а DNS обновляется контролируемо.

Можно ли оставить заводской пароль iDRAC, если он уникальный?

Нет. Уникальный пароль на бирке предназначен для первого входа и мог попасть в документы поставки или фотографии; замените его и создайте именные либо каталожные учетные записи.

Нужна ли локальная учетная запись при подключенном LDAP или Active Directory?

Нужна одна защищенная аварийная запись. Храните ее секрет в корпоративном хранилище, ограничьте права и регулярно проверяйте вход без каталога.

Какие оповещения BMC следует включить в первую очередь?

Отказы дисков, памяти, вентиляторов и блоков питания, потерю резервирования, температурные события и критические ошибки платформы. Маршрутизируйте их по тяжести и обязательно отправьте тестовое событие до приемки.

Достаточно ли почтовых уведомлений от iLO или iDRAC?

Почта полезна как резерв, но она плохо подтверждает владение инцидентом. Основной путь лучше вести в мониторинг или очередь инцидентов через Redfish events, SNMPv3 traps либо поддерживаемую интеграцию.

Зачем настраивать NTP на контроллере управления?

Точное время связывает аппаратные события с журналами ОС, сети и хранилища, а также помогает корректно проверять сертификаты. Используйте два доступных источника и перепроверьте время после перезапуска BMC.

Нужно ли обновлять прошивку BMC перед вводом сервера?

Да, после чтения примечаний для точной модели и проверки зависимостей. Обновляйте через поддерживаемый каталог и очередь производителя, сохраните версии до изменения и повторите функциональные тесты после него.

Как проверить удаленную консоль без риска для сервера?

Подключитесь через штатный VPN или административный узел, откройте консоль и проверьте повторное соединение. На сервере без нагрузки кратко подключите утвержденный ISO, убедитесь, что он виден, затем сразу отключите его.

Что приложить к акту передачи сервера в эксплуатацию?

Сетевые реквизиты, физическое размещение, серийный номер, версии прошивок, роли, ссылки на секреты, идентификаторы тестовых событий и результаты консоли. Сами пароли, токены и community-строки в акт не включайте.