7 мин

Как настроить мониторинг ИБП и температуры?

Практический мониторинг ИБП и температуры: датчики, пороги, оповещения без дежурной смены и ежемесячная проверка серверной.

Как настроить мониторинг ИБП и температуры?

Мониторинг небольшой серверной должен ответить на два вопроса раньше, чем оборудование остановится: осталось ли питание и получает ли стойка достаточно холодного воздуха. Для этого не нужен дорогой диспетчерский центр, но нужен полный путь сигнала от отдельного датчика до человека, который действительно проснется и начнет действовать.

Я видел серверные, где на стене висел точный термогигрометр, ИБП показывал зеленый индикатор, а авария оставалась незамеченной. Настенный прибор измерял удобное место у двери, индикатор ничего не сообщал наружу, почтовый сервер погас вместе со стойкой. Минимальный набор начинается не с количества датчиков, а с последствий отказа: перегрев на входе серверов, переход ИБП на батарею, исчерпание автономии, потеря связи с самим мониторингом и вода там, где она может появиться.

Минимальный набор состоит из пяти сигналов

Для одной серверной с одной или несколькими стойками достаточно контролировать пять групп событий: состояние ИБП, температуру на входе воздуха в стойки, влажность или точку росы, протечку и доступность цепочки оповещения. Датчик двери полезен для расследований и безопасности, но он не заменяет ни один из этих сигналов.

ИБП должен отдавать как минимум источник питания, заряд батареи, расчетное время работы, нагрузку, состояние батареи и активные аварии. Если устройство сообщает входное напряжение, выходное напряжение, частоту и температуру батарейного отсека, сохраняйте и их. Эти показатели объясняют, почему ИБП часто переключается на батарею, насколько близка перегрузка и в каких условиях стареют аккумуляторы.

Температуру измеряют перед стойкой, откуда серверы забирают воздух. Среднее значение под потолком или у кондиционера может выглядеть спокойно, пока верхние серверы в дальней стойке втягивают горячий воздух. Для единственной невысокой стойки поставьте один датчик спереди в верхней трети и второй спереди в нижней трети. Для полной стойки разумный минимум: верх, середина и низ со стороны холодного коридора. Если стоек несколько, сначала оснащают самую плотную, самую удаленную от охлаждения и стойку с самым важным оборудованием, затем проверяют картину переносным датчиком.

Влажность нужна не ради красивого графика. Слишком сухой воздух увеличивает риск электростатических разрядов, а высокая влажность вместе с холодными поверхностями создает риск конденсации. ASHRAE советует оценивать влагосодержание по точке росы, потому что относительная влажность меняется вместе с температурой даже при неизменном количестве влаги. Если контроллер показывает только относительную влажность, это все равно полезно, но при выборе нового датчика берите модель, которая вычисляет точку росы.

Линейный датчик протечки кладут в нижней точке, под соединениями труб, возле дренажа кондиционера и по вероятному пути воды. Точечный датчик у двери мало поможет, если конденсат сначала собирается под фальшполом у внутреннего блока. Последний обязательный сигнал синтетический: система мониторинга должна сообщать, что перестала получать данные от ИБП, температурного контроллера или шлюза. Молчание датчика тоже авария.

Температуру измеряют на входе, а не в центре комнаты

Рабочий порог привязывают к температуре воздуха на входе IT-оборудования и требованиям конкретных серверов, а не к ощущению человека в комнате. Руководство ASHRAE для классов A1-A4 указывает рекомендуемый диапазон входной температуры 18-27 °C. Это диапазон нормальной длительной эксплуатации, а не готовая пара аварийных уставок для любой комнаты.

Для обычной серверной я начинаю с предупреждения при 27 °C и критического сигнала при 30 °C на любом входном датчике. Предупреждение требует проверки в течение рабочего интервала, критический сигнал требует немедленной эскалации. Нижнюю границу часто ставят на 18 °C как предупреждение и 15 °C как критическое событие, если документация оборудования не требует иного. Холод сам по себе редко выключает серверы, но внезапное падение температуры может указать на ошибку автоматики, открытое окно зимой или риск конденсации после изменения влажности.

Не копируйте эти числа без измерений. В течение первой недели записывайте значения каждую минуту или каждые пять минут при обычной и высокой нагрузке. Посмотрите суточный размах и разницу между верхом и низом стойки. Если верх держится на 26,5 °C при исправном охлаждении, порог 27 °C будет постоянно шуметь. Сначала исправьте рециркуляцию и кабельные проемы, а затем, если это невозможно, задайте предупреждение чуть выше устойчивого нормального максимума, сохранив запас до предела производителя.

Порог должен иметь выдержку времени и гистерезис. Например, предупреждение срабатывает после трех минут выше 27 °C и закрывается после пяти минут ниже 26 °C. Критическое событие можно открыть после одной минуты выше 30 °C и закрыть после пяти минут ниже 28 °C. Такая логика отсекает краткий выброс при открытии двери и не создает серию событий на границе.

Скорость роста иногда важнее абсолютного значения. Температура 25 °C выглядит нормальной, но рост на 4 °C за десять минут после остановки кондиционера уже требует вызова. Добавьте отдельное предупреждение по скорости, если система умеет считать изменение за окно времени. Если не умеет, короткая выдержка на пороге 27 °C остается приемлемым минимумом, но оператор увидит отказ позже.

Не усредняйте датчики стойки для аварии. Среднее из 24, 25 и 32 °C равно 27 °C и скрывает горячую верхнюю зону. График среднего полезен для отчета, а тревога должна работать по максимальному значению каждого входного датчика. Датчик на выходе горячего воздуха можно хранить для диагностики потока, но его нельзя сравнивать с входным диапазоном ASHRAE.

Порог влажности защищает от двух разных рисков

Для небольшой серверной практичная начальная зона относительной влажности составляет 30-60 %, а предупреждения можно поставить ниже 25 % и выше 65 %. Критические пороги зависят от оборудования, климата, охлаждения и наличия увлажнения, поэтому их проверяют по паспортам техники и проектным условиям. Универсальная жесткая авария на 60 % часто дает ложные вызовы во время краткого изменения температуры.

Точка росы делает риск конденсации понятнее. Если холодная труба, панель или поверхность находится ниже точки росы воздуха, на ней может выпасть влага. Поэтому полезен не только верхний порог точки росы, но и разница между температурой самой холодной доступной поверхности и точкой росы. В простой комнате без датчиков поверхности оператор хотя бы должен видеть одновременный рост точки росы и падение температуры.

Датчик температуры и влажности нельзя крепить к наружной стене, прямо под струей кондиционера, над ИБП или сзади горячей стойки, если вы хотите измерять входные условия. Тепло от контроллера тоже искажает показания, поэтому выносной зонд надежнее корпуса со встроенным чувствительным элементом. Закрепите кабель так, чтобы уборка или работа с дверью стойки не сдвинула зонд.

Сравнивайте все датчики одним эталонным прибором при вводе и затем хотя бы раз в год. Для эксплуатационного мониторинга важна повторяемость: датчик, который стабильно завышает на 1,5 °C, можно учесть поправкой, а датчик с хаотическим дрейфом нужно заменить. Не выставляйте всем зондам разные пороги, чтобы спрятать расхождение.

У ИБП контролируют состояние, автономию и нагрузку

Заряд батареи в процентах не отвечает на вопрос, сколько проживет стойка. Расчетное время зависит от текущей нагрузки, состояния и температуры аккумуляторов, а после изменения нагрузки может заметно пересчитаться. Для реакции на отключение сети нужен показатель оставшихся минут и проверенный сценарий завершения работы, а процент заряда остается вспомогательным сигналом.

RFC 1628 описывает стандартную UPS-MIB с веткой 1.3.6.1.2.1.33. В ней есть состояние батареи, время на батарее, расчетные минуты, заряд, температура батареи, входное напряжение, источник выхода, процент нагрузки и известные аварии. Стандарт требует поддержку нескольких основных аварий, включая работу от батареи, низкий заряд, плохой вход и отключенный выход, но конкретный ИБП может реализовать только часть объектов. Поэтому сначала опросите устройство и составьте список реально доступных метрик, а не импортируйте шаблон вслепую.

Если ИБП или подключенный к нему сервер работает с Network UPS Tools, базовую проверку можно выполнить так:

upsc ups@localhost ups.status
upsc ups@localhost battery.runtime
upsc ups@localhost ups.load

Исправная линия обычно возвращает форму вроде:

OL
1840
37

OL означает питание от сети, 1840 означает расчетные секунды автономии, а 37 означает нагрузку 37 %. Набор имен зависит от драйвера. Руководство NUT прямо советует сначала проверить ups.status: значения OB и LB означают работу от батареи и низкий заряд. Снимите реальные выходные данные своего устройства и храните их рядом с конфигурацией мониторинга, тогда после обновления драйвера будет с чем сравнить.

Событие перехода на батарею отправляйте сразу, но различайте короткое переключение и продолжающееся отключение. Через 30-60 секунд работы от батареи повторите уведомление с оставшимися минутами и нагрузкой. Критическую эскалацию привязывайте к времени, которое нужно сервисам для корректного завершения, плюс резерв. Если управляемое выключение занимает восемь минут, порог в пять минут уже бесполезен. Измерьте реальное время завершения и добавьте запас на задержку команды и старение батареи.

Для нагрузки разумно предупредить при устойчивых 70-80 % и объявить критическое состояние ближе к 90 %, но паспорт ИБП и схема резервирования важнее общего совета. Запас нужен для пусковых токов, роста нагрузки и потери одного модуля в параллельной системе. Отдельно отслеживайте событие перегрузки, плохую батарею, активный байпас, провал входного напряжения и провал связи.

Температура сильно влияет на срок службы герметичных свинцово-кислотных батарей. Документация APC приводит ориентир: повышение температуры на 8 °C сокращает ожидаемый срок батареи примерно вдвое, причем внутри ИБП батарея теплее окружающего воздуха. Это не закон для каждой химии и конструкции, но достаточная причина не ставить ИБП в горячий выхлоп стойки и не считать комнатный датчик заменой температуре батарейного отсека.

Матрица порогов должна описывать действие

Локальные серверы и интеграция
GSE сочетает серверы казахстанского производства с вендор-нейтральной инфраструктурой объекта.
Обсудить решение

Порог без владельца и срока реакции остается цветной линией на графике. Для каждого события запишите условие открытия, выдержку, условие закрытия, канал первой доставки, момент эскалации и конкретное действие. Получится короткая рабочая матрица, а не список произвольных чисел.

Для температуры на входе начальное предупреждение ставят выше 27 °C на три минуты, критическое событие выше 30 °C на одну минуту либо по быстрому росту. Первым действием будет проверка охлаждения, дверей стоек и потока воздуха. Для относительной влажности предупреждения ниже 25 % или выше 65 % выдерживают десять минут, а критические пределы берут из паспортов оборудования и оценки риска конденсации.

Переход ИБП на батарею сообщают сразу. Если состояние длится больше 60 секунд или автономия приближается к порогу выключения, дежурный подтверждает питание здания и готовит завершение сервисов. Предупреждение по расчетной автономии открывают ниже рабочего резерва, критическое событие наступает на сумме измеренного времени выключения и согласованного запаса.

Нагрузку ИБП можно начать предупреждать выше 75 % на пять минут, а критическое событие открыть выше 90 % на одну минуту либо по штатному сигналу перегрузки. Любое подтвержденное срабатывание датчика воды считают критическим. Для потери данных предупреждение после двух пропущенных интервалов помогает заметить нестабильность, а пять минут без связи требуют проверки шлюза, сети, питания датчика и сервера мониторинга.

Эти числа служат стартовой конфигурацией, а не проектной нормой. Температурные пределы согласуйте с классом оборудования и точкой установки. Время автономии задайте после испытания под реальной нагрузкой. Для генератора учитывайте время автоматического запуска и выхода на стабильный режим, но не продлевайте работу до последней минуты батареи: неудачный запуск должен оставить время на контролируемое выключение.

События должны закрываться автоматически только после устойчивого возврата в норму. Протечку и плохую батарею лучше оставить с ручным подтверждением, потому что исчезновение контакта не доказывает устранение причины. В журнале сохраните время открытия, подтверждения, эскалации и закрытия, а также измеренное значение.

Оповещение должно пережить ту же аварию

Письмо через локальный почтовый сервер не считается аварийным каналом, если сервер, коммутатор и интернет-шлюз питаются от того же ИБП. При отключении сеть может исчезнуть раньше, чем система отправит письмо. Постройте путь оповещения на бумаге: датчик, контроллер, коммутатор, мониторинг, DNS, почтовый или push-шлюз, оператор. Любой общий отказ в этой цепочке требует второго пути либо явного признания риска.

Для помещения без дежурной смены нужен как минимум основной удаленный канал и эскалация на голосовой вызов, SMS или другой канал с отдельной инфраструктурой. Сообщение должно содержать объект, помещение, конкретный сигнал, текущее значение, порог, время начала, состояние ИБП и инструкцию первого действия. Фраза «критическая температура» без номера комнаты и значения заставляет дежурного искать данные в самый плохой момент.

Один человек не образует схему дежурства. Назначьте первичного получателя на текущий период, резервного получателя и руководителя эскалации. Если первичный не подтвердил критическое событие за пять минут, система вызывает резервного. Еще через согласованный интервал событие уходит следующему уровню. График должен учитывать отпуск и болезни, а смена контактов должна тестироваться.

Разделите уведомления по срочности. Переход на батарею, высокая температура, протечка, перегрузка и потеря всех данных требуют немедленной доставки. Единичный сбой самотеста, небольшой дрейф влажности или приближение срока обслуживания можно отправить в рабочее время. Когда каждый желтый сигнал будит ночью, люди быстро учатся не реагировать и на красный.

Система мониторинга нуждается во внешнем контроле доступности. Простой вариант: она раз в минуту отправляет heartbeat во внешний сервис или во вторую площадку, а отсутствие нескольких отметок вызывает тревогу по независимому маршруту. Если внешнего сервиса нет, второй узел может опрашивать первый, но нельзя допускать, чтобы оба зависели от одного коммутатора и одного ИБП.

Раз в квартал отключите основной канал в контролируемое время и убедитесь, что резервный маршрут доходит до нужного человека. Тестовое сообщение должно выглядеть как тест, а получатель обязан подтвердить его. Запись «уведомление отправлено» в локальном журнале доказывает работу приложения, но не доказывает доставку на телефон.

SNMP настраивают как телеметрию, а не как доверенную сеть

Инфраструктура под вашу площадку
GSE адаптирует серверное решение к объекту, отраслевым требованиям и доступной сервисной сети.
Обсудить площадку

SNMP-карта ИБП часто переживает серверы и редко получает столько внимания, сколько операционная система. Ограничьте доступ к ней отдельной управляющей сетью, разрешите опрос только с адресов мониторинга и используйте SNMPv3 с проверкой подлинности и шифрованием, если карта его поддерживает. Строку community для SNMPv1 или v2c нельзя считать паролем с приемлемой защитой.

Опрос и traps решают разные задачи. Периодический опрос дает графики, подтверждает доступность устройства и восстанавливает состояние после потери пакета. Trap быстро сообщает о переходе на батарею, но UDP-пакет может потеряться, а получатель может быть недоступен. Включайте оба механизма: trap для скорости, опрос для подтверждения.

Интервал в 30-60 секунд подходит для статуса ИБП и температуры небольшой серверной. Более частый опрос редко меняет реакцию человека, зато увеличивает шум и нагрузку на старые сетевые карты. Сохраняйте сырые показатели достаточно долго, чтобы увидеть рост температуры во время отказа охлаждения, падение расчетной автономии по месяцам и регулярные провалы входного напряжения.

Не разрешайте команды SNMP SET без необходимости. Для мониторинга нужен доступ только на чтение. Удаленное выключение выхода ИБП должно идти через отдельно защищенный и испытанный контур управления с ограниченным кругом операторов. Ошибка в шаблоне мониторинга не должна превращаться в команду на отключение стойки.

После обновления прошивки, замены карты или импорта нового шаблона сравните набор OID и единицы измерения. RFC 1628 задает, например, температуру батареи в градусах Цельсия, батарейное напряжение в десятых долях вольта и входную частоту в десятых долях герца. Вендорские ветки могут использовать другие масштабы. Значение 245 может означать 24,5 В, а не аварийные 245 В батареи.

Ежемесячная проверка проверяет весь путь

ИБП без слепых зон
Инженеры GSE свяжут серверную инфраструктуру с контролем питания и аварийными сигналами.
Связаться с GSE

Ежемесячный осмотр должен подтвердить датчики, аккумуляторы, охлаждение и доставку тревоги, а не закончиться кнопкой «самотест пройден». Назначьте окно, владельца и форму записи результата. Проверка небольшой серверной обычно укладывается в час без отключения сервисов, если полный разряд батареи проводят отдельно по плану.

  1. Осмотрите ИБП, батарейные модули, кондиционер, дренаж и пол. Ищите вздутие, запах, следы жидкости, пыль на вентиляции, незакрепленные кабели и предметы, перекрывающие поток.
  2. Сравните показания входных датчиков переносным прибором в верхней, средней и нижней точках. Проверьте дату последнего значения и уровень заряда автономного датчика.
  3. Запустите предусмотренный производителем самотест ИБП, сохраните результат, нагрузку, заряд и расчетную автономию до и после теста. Не имитируйте пропадание сети выдергиванием вилки, если схема заземления, байпас и регламент этого не допускают.
  4. Создайте по одному контролируемому событию температуры или входа датчика и ИБП, затем проверьте получение, подтверждение и эскалацию. Отдельно отключите один датчик, чтобы проверить тревогу «нет данных».
  5. Просмотрите месячные тренды: максимум температуры по каждому зонду, разницу верх-низ, число переходов на батарею, минимальную автономию, пик нагрузки, отклонения входного напряжения и пропуски телеметрии.

Короткий самотест не измеряет полную автономию под реальной нагрузкой. Периодическое нагрузочное испытание нужно планировать по инструкции производителя и требованиям объекта, с оценкой риска и готовым способом вернуть питание. Его частота зависит от типа батареи, возраста, критичности и возможностей ИБП. Не назначайте глубокий разряд каждый месяц по общему совету: лишние циклы изнашивают батареи, а неуправляемый тест может остановить сервисы.

Смотрите не только на успешный результат, но и на тренд. Если при сопоставимой нагрузке расчетная автономия месяц за месяцем падает, батарея требует внимания до появления штатной аварии. Рост числа коротких переходов на батарею может указывать на качество входного питания или слишком узкие допустимые пределы ИБП.

После каждой проверки создавайте одну запись: дата, исполнитель, измеренные значения, тестовые события, фактические получатели, найденные отклонения, срок исправления и ответственный. Скриншот зеленой панели без чисел и времени нельзя сравнить со следующим месяцем.

Отказ мониторинга моделируют до первой аварии

Приемка заканчивается не тогда, когда появились графики, а когда команда воспроизвела отказ и получила ожидаемую реакцию. Смоделируйте потерю сети ИБП по инструкции производителя, остановку охлаждения в безопасном окне, обрыв датчика, потерю управляющего коммутатора и недоступность основного получателя. Для каждого опыта заранее задайте условие остановки, чтобы тест не создал настоящую аварию.

Самый опасный общий отказ обычно скрыт в питании сети. ИБП держит сервер, но коммутатор датчиков подключен к обычной розетке. При пропадании сети контроллер исчезает, мониторинг видит только потерю связи, а trap о батарее не проходит. Подключите контроллер, управляющий коммутатор и нужный шлюз к резервированному питанию, затем проверьте, сколько живет весь канал.

Второй типичный отказ скрыт в адресации. После замены маршрутизатора меняется правило, SNMP-опрос прекращается, а панель еще показывает последнее зеленое значение. Каждая метрика должна иметь время получения, а интерфейс не должен изображать устаревшие данные как текущие. Авария по возрасту данных здесь важнее красивой визуализации.

Третий отказ создают пороги без контекста. Дежурный получает 32 °C, приезжает и выключает работающий кондиционер, потому что не знает расположение зонда. Подпишите датчики физически и в системе одинаково: помещение, стойка, сторона, высота. К уведомлению добавьте схему доступа, контакт ответственного за здание и разрешенные действия, но не помещайте секреты доступа в открытый текст сообщения.

При проектировании новой серверной или замене инфраструктуры GSE.kz может собрать серверы, стойки, питание, мониторинг и поддержку как единую систему с учетом доступных в Казахстане компонентов. Даже при интеграции внешним подрядчиком владелец объекта должен сам принять матрицу порогов, список получателей и протокол испытаний: эти решения нельзя передать вместе с коробками.

Минимальный мониторинг считается готовым, когда последнее значение имеет время, каждый критический сигнал доходит по независимому пути, дежурный знает первое действие, а ежемесячная запись показывает, как меняется система. До этого момента датчики просто производят числа.

FAQ

Сколько датчиков температуры нужно для одной серверной?

Для одной невысокой стойки начните с двух датчиков на входе воздуха: в верхней и нижней трети. Для полной стойки используйте три точки по высоте, а при нескольких стойках сначала контролируйте самую плотную и самую удаленную от охлаждения.

Какая температура в серверной считается нормальной?

Ориентируйтесь на температуру воздуха на входе серверов. Для оборудования классов A1-A4 ASHRAE рекомендует 18-27 °C, но рабочие уставки нужно сверить с паспортами вашей техники и реальными измерениями.

Можно ли поставить один датчик температуры на стене?

Один настенный датчик часто пропускает горячую зону в верхней части стойки. Он годится для общего фона, но аварийный контроль должен измерять воздух перед входами серверов.

При какой температуре отправлять аварийное оповещение?

Практичная отправная точка: предупреждение выше 27 °C с выдержкой три минуты и критический сигнал выше 30 °C с короткой выдержкой. После недели измерений скорректируйте предупреждение под нормальный максимум, не выходя за требования производителя.

Какие параметры ИБП обязательны для мониторинга?

Контролируйте источник выхода, работу от батареи, расчетную автономию, заряд, нагрузку, состояние батареи и активные аварии. Входное напряжение, температура батареи и байпас дают важный контекст, если ИБП их сообщает.

Почему нельзя ориентироваться только на заряд ИБП?

Одинаковый процент заряда дает разное время при разной нагрузке и состоянии батарей. Решение о завершении сервисов принимайте по проверенной расчетной автономии и реальному времени выключения с запасом.

Нужен ли датчик влажности в небольшой серверной?

Да, один совмещенный датчик температуры, влажности и точки росы стоит недорого и показывает риск сухого воздуха или конденсации. Размещайте его у входного воздуха стойки, а не под струей кондиционера.

Как получать тревоги, если ночью никто не дежурит?

Назначьте первичного и резервного получателя, настройте подтверждение и автоматическую эскалацию на отдельный канал. Путь доставки должен работать при отключении основного питания и локальной сети.

Достаточно ли SNMP trap для контроля ИБП?

Нет, trap приходит быстро, но пакет может потеряться. Совмещайте traps с опросом каждые 30-60 секунд, который строит тренды и обнаруживает потерю связи.

Что обязательно проверять у ИБП каждый месяц?

Осмотрите батареи и вентиляцию, запустите штатный самотест, запишите нагрузку и автономию, проверьте тестовую тревогу и эскалацию. Затем сравните месячный тренд автономии, переходов на батарею и пропусков данных.