Серверная для GPU начинается с инженерных лимитов
Серверная для GPU требует проверки питания, охлаждения, сети и безопасности. Сравниваем свою площадку с готовой площадкой интегратора.

Одну стойку с GPU нельзя планировать как обычную серверную стойку, только с более дорогими серверами. У нее другая плотность мощности, резкие изменения нагрузки, большой поток горячего воздуха и сеть, которая влияет на полезную производительность почти так же сильно, как ускорители. Поэтому выбор между готовой площадкой интегратора и модернизацией своей серверной нужно делать по измеряемым инженерным пределам, а не по тому, где формально есть свободные юниты.
Моя рабочая позиция проста: свою площадку стоит модернизировать, когда организация уже контролирует электроснабжение, охлаждение и эксплуатацию помещения и может доказать запас под полную стойку. Если для каждого из этих пунктов нужен отдельный строительный проект, готовая площадка обычно быстрее и предсказуемее. Владение комнатой само по себе не делает ее подходящим местом для ИИ-инфраструктуры.
Сначала зафиксируйте профиль стойки
Решение начинается со спецификации нагрузки на горизонте хотя бы трех лет. Список закупаемых серверов на первый этап для этого недостаточен: питание, трубопроводы, кабельные трассы и несущую способность пола переделывать после запуска дороже, чем оставить расчетный запас сразу.
Соберите профиль на уровне каждого устройства: количество юнитов, глубина, масса, число вводов питания, номинальная и максимальная мощность, направление воздушного потока, тип охлаждения, сетевые порты и длина допустимых кабелей. Отдельно внесите коммутаторы, систему хранения, узлы управления, консоль и CDU, если применяется жидкостное охлаждение. Они занимают место и выделяют тепло, хотя в ранней смете их часто забывают.
Следующий фрагмент можно отдать поставщику оборудования, инженеру площадки и службе эксплуатации. Значения здесь демонстрационные, их надо заменить числами из выбранной конфигурации:
{
"rack_id": "AI-R01",
"design_horizon_years": 3,
"it_load_kw": {
"day_one_expected": 24,
"day_one_peak": 31,
"final_peak": 46
},
"cooling": {
"mode": "air_or_direct_liquid",
"heat_rejection_kw_final": 46,
"required_inlet_c": "per_equipment_spec"
},
"power": {
"feeds": 2,
"voltage": "per-equipment-spec",
"redundancy_target": "defined-by-business"
},
"network": {
"fabric_ports": 16,
"management_ports": 12,
"storage_ports": 8
},
"rack": {
"usable_u": 42,
"max_static_load_kg": "verify",
"max_depth_mm": "verify"
}
}
Здесь важны три разных числа мощности. day_one_expected помогает оценить типичный режим и счета за электричество. day_one_peak определяет готовность к запуску. final_peak задает предел для кабельных линий, распределения питания и охлаждения. Смешивать их нельзя. Площадка, которая принимает 24 кВт в среднем, но отключает ввод при 31 кВт, не готова к этой стойке.
Зафиксируйте также режим работы. Обучение может держать ускорители близко к полной нагрузке часами, инференс дает иной профиль, а лабораторная разработка простаивает между экспериментами. Лимит мощности через BMC или планировщик допустим как управляемая политика, но это не оправдание для слабого ввода. При сбое политики оборудование должно остаться в безопасном электрическом и тепловом режиме.
Электрический ввод считают по отказу
Система питания годится только тогда, когда она выдерживает проектную нагрузку после одного предусмотренного отказа. Запись «два ввода по 32 кВт» ничего не говорит, пока не ясно, независимы ли источники, как загружены ИБП, какие автоматы стоят по пути и сможет ли оставшаяся ветвь принять всю допустимую нагрузку.
Начните с однолинейной схемы от внешнего питания до блоков PDU в стойке. На ней должны быть номиналы автоматов, сечения и длины кабелей, характеристики ИБП, группы резервирования, байпасы, дизель-генератор и точки общего отказа. Для каждой ветви укажите длительно допустимую нагрузку по местным нормам и проектным условиям. Номинал автомата нельзя целиком объявлять доступной ИТ-мощностью.
У GPU-систем несколько блоков питания и несколько шнуров. Это создает резервирование лишь при правильном распределении. Если все шнуры одной половины системы попали на общий PDU или общий вышестоящий автомат, потеря ветви может снизить производительность либо остановить узел. Карта «PSU - розетка - PDU - автомат - ИБП - ввод» полезнее цветных кабелей, потому что показывает реальную независимость.
В руководстве по планированию NVIDIA DGX H100 указан максимум 10,2 кВт для одного 8U-узла, а четыре таких узла дают 40,8 кВт на стойку без учета части вспомогательной нагрузки. Это не универсальная конфигурация и не предложение ее копировать. Это хороший масштаб для проверки интуиции: свободная стойка в корпоративной серверной часто рассчитана на гораздо меньшую плотность.
Переходные процессы тоже имеют значение. После восстановления питания серверы, вентиляторы, насосы и сетевое оборудование могут запускаться почти одновременно. Проверьте последовательный старт, параметры ИБП при нелинейной нагрузке, время автономии до выхода генератора и поведение системы при возврате сети. ИБП на десять минут не помогает, если чиллер или насосный контур не подключен к согласованной схеме резерва.
На готовой площадке запросите не обещание мощности, а закрепленную за стойкой мощность по вводам, схему резервирования, допустимые разъемы, измерение на уровне PDU и процедуру увеличения лимита. Для своей серверной нужен подписанный расчет электрика и фактическое испытание под нагрузкой. В обоих случаях ответ должен выражаться в киловаттах и сценариях отказа.
Воздушное охлаждение упирается в поток
Воздушная система должна доставить нужный объем холодного воздуха к входам серверов и без рециркуляции удалить весь горячий поток. Общая холодопроизводительность помещения не доказывает, что одна плотная стойка получит свою долю.
Почти вся электрическая мощность ИТ-оборудования превращается в тепло в помещении, поэтому для первого расчета 40 кВт нагрузки требуют отвода примерно 40 кВт тепла. Затем инженер добавляет реальные потери и ограничения системы. Пересчет в BTU/ч не меняет физику, он только переводит единицы: 1 кВт тепла равен примерно 3412 BTU/ч.
Руководство NVIDIA по площадке для DGX H100 приводит ориентир минимального потока 157 кубических футов в минуту на киловатт, но прямо требует уточнять его по условиям, высоте и температурному перепаду оборудования. Для стойки на 40 кВт такой ориентир уже превышает 6000 CFM. Число полезно как проверка масштаба, а не как готовое техническое задание.
ASHRAE Thermal Guidelines разделяет рекомендуемый и допустимый диапазоны температуры и влажности на входе оборудования. Допустимый край не стоит превращать в обычную уставку: он оставляет меньше запаса при засорении фильтра, отказе вентилятора или жаркой погоде. Измерять нужно температуру на входе серверов внизу, посередине и вверху стойки, а не на стене рядом с кондиционером.
Закрытие пустых юнитов заглушками, разделение холодного и горячего коридоров, герметизация кабельных вводов и правильное направление вентиляторов решают проблему рециркуляции. Коммутатор с боковым потоком в стойке с фронтальным потоком требует воздуховода или другого осознанного решения. Иначе небольшой сетевой прибор может подмешивать горячий воздух к входу соседнего GPU-узла.
Обычный комфортный кондиционер опасно оценивать по цифре на шильдике. Он может плохо работать круглосуточно, не держать нужный расход, не иметь зимнего комплекта, останавливаться после краткого пропадания питания или не сообщать об аварии в систему мониторинга. Для своей серверной проверьте резервирование блоков, автоматику перезапуска, отвод конденсата, фильтрацию и доступ к обслуживанию без остановки стойки.
Готовая площадка выигрывает, если она уже продает подтвержденную плотность на конкретном месте и показывает карту воздушных потоков. Но слово «дата-центр» ничего не гарантирует: часть залов проектировали под 5-10 кВт на стойку. Попросите результаты измерений на соседней сопоставимой нагрузке и условия, при которых оператор потребует снизить мощность.
Жидкостный контур меняет границу ответственности
Жидкостное охлаждение оправдано, когда воздушный поток, шум или плотность мощности уже мешают разместить расчетную конфигурацию. Оно не отменяет кондиционирование: блоки питания, память, накопители и сетевое оборудование могут по-прежнему отдавать часть тепла воздуху.
Нужно различать заднюю охлаждаемую дверь и прямой подвод жидкости к компонентам. Дверь забирает тепло из выходящего воздуха и обычно меньше вмешивается в сервер. Direct-to-chip подводит теплоноситель к холодным пластинам процессоров и ускорителей, зато требует согласовать серверный контур, CDU, качество жидкости, давление, расход и температуры. Иммерсионная схема меняет конструкцию оборудования и процессы обслуживания еще сильнее. Эти варианты нельзя объединить в строку «водяное охлаждение».
ASHRAE в материалах по жидкостному охлаждению отделяет контур здания от технологического контура оборудования. Между ними часто стоит CDU, который передает тепло через теплообменник, управляет расходом и отделяет требования серверов от воды здания. Это полезное разделение: команда здания отвечает за доступную температуру и мощность отвода, а оператор ИТ отвечает за параметры вторичного контура и совместимость узлов.
До заказа оборудования зафиксируйте четыре границы:
- кто поставляет и обслуживает CDU, насосы, фильтры и датчики;
- кто отвечает за качество жидкости и анализ проб;
- где стоят запорные клапаны, датчики утечки и аварийный слив;
- что происходит с вычислениями при потере насоса или внешнего холода.
Температуру подачи выбирают относительно требований оборудования и точки росы. Слишком холодная жидкость повышает риск конденсации, особенно при влажном воздухе и открытых трубах. Изоляция, контроль влажности и автоматика нужны как единая система. Сигнал датчика утечки должен не просто попасть в журнал, а вызвать заранее определенную реакцию: уведомление, останов насосов, изоляцию ветви или управляемое завершение задач.
На готовой площадке уточните типы быстросъемных соединений, допустимые теплоносители, диапазон температур, давление, резервирование CDU и лимит киловатт, который реально принимает контур. В своей серверной проверьте, можно ли безопасно провести трубы, выдержит ли здание дополнительное оборудование, куда уйдет тепло и кто приедет на аварию ночью. Если на эти вопросы отвечают разные подрядчики, матрица ответственности должна стать частью договора.
Сеть определяет, сколько GPU работают полезно
Сетевую схему выбирают по характеру вычислений, а не по числу свободных портов. Один сервер с несколькими GPU, кластер распределенного обучения и ферма независимых задач предъявляют разные требования к задержке, пропускной способности и потерям.
Для распределенного обучения обмен градиентами может быстро сделать межузловую фабрику ограничителем. Нужны согласованные скорости адаптеров и коммутаторов, достаточная емкость без скрытой переподписки, предсказуемая задержка и проверенная настройка выбранного транспорта. Название технологии само по себе не доказывает результат. Прогоните типичную коллективную операцию и сравните масштабирование двух, четырех и большего числа узлов.
Разделите как минимум контуры управления, хранения данных и вычислительной фабрики на уровне проектирования. Физическое разделение требуется не всегда, но адресация, доступ, мониторинг и отказные сценарии должны быть понятны. BMC нельзя оставлять в той же доступной сети, что пользовательские рабочие станции. Порты управления нужны даже тогда, когда все юниты стойки уже заняты вычислителями.
Внешний канал влияет на загрузку наборов данных, обновления образов, резервное копирование и удаленную работу. Однако большой интернет-канал не исправит медленное хранилище рядом со стойкой. Измеряйте путь целиком: источник данных, массив, сервер хранения, коммутаторы, сетевые адаптеры и файловую систему. Средняя скорость последовательного чтения не раскрывает поведение при тысячах небольших файлов.
Кабельная трасса требует места, радиуса изгиба, маркировки и допустимой длины. В плотной стойке толстый пучок может мешать горячему потоку и обслуживанию блоков питания. Высокоскоростные медные кабели имеют ограничения по длине, оптика добавляет требования к модулям и чистоте коннекторов. Перенос стойки в соседнее помещение способен изменить спецификацию сети и смету.
Готовая площадка удобнее, если фабрика, кроссы и внешние каналы уже доступны в нужной топологии. Но проверьте, какие компоненты выделены именно вам, где начинается общая инфраструктура и сколько займет замена коммутатора. При модернизации своей серверной преимущество дает короткий путь к существующему хранилищу, если оно действительно выдерживает профиль ИИ-задач. Близость без измерений ничего не доказывает.
Помещение должно выдерживать эксплуатацию
Физическая готовность означает, что стойку можно доставить, установить, обслуживать и безопасно отключить. Контроль доступа и камера не компенсируют слабый пол, узкую дверь или отсутствие места для извлечения тяжелого сервера.
Проверьте весь маршрут от зоны разгрузки: высоту и ширину проемов, грузоподъемность лифта, пороги, повороты, временное хранение и возможность использовать подъемник. Паспортная масса стойки должна включать серверы, PDU, кабели, двери, CDU и запас. Инженер здания проверяет распределенную и точечную нагрузку на пол, а не только общую массу.
Перед стойкой и за ней нужно пространство для монтажа рельсов, замены узлов и работы тележки. Сервер глубиной около метра вместе с кабельными организаторами может не поместиться в старый шкаф. Двери стойки, охлаждаемая задняя дверь и напольные панели должны открываться без блокировки эвакуационного пути.
Система доступа должна различать вход в помещение и работу с конкретной стойкой. Зафиксируйте, кто может войти один, кому нужен сопровождающий, как оформляется временный доступ подрядчика и как отзываются права. Камеры должны покрывать подходы и операции обслуживания с учетом правил хранения записей организации. Для готовой площадки запросите журналирование посещений и порядок выдачи носителей; для своей площадки свяжите процессы с внутренней службой безопасности.
Пожарная защита требует проекта, совместимого с местными нормами, оборудованием и присутствием людей. Нельзя просто поставить газовый баллон рядом со стойкой. Нужны обнаружение, оповещение, безопасная задержка, блокировки вентиляции и понятная процедура входа после срабатывания. Аварийное отключение питания защищают от случайного нажатия и регулярно проверяют.
Шум тоже относится к безопасности. Высокоплотные GPU-системы при полной вентиляции могут требовать защиты слуха и ограничивать длительность работы рядом. NVIDIA для DGX H100 публикует высокий уровень звуковой мощности и отдельно обращает внимание на средства индивидуальной защиты. Даже если выбрано другое оборудование, измерьте шум под нагрузкой и включите результат в инструкции.
Готовая площадка обычно лучше подготовлена к тяжелым поставкам, регламентным работам и круглосуточным авариям. Своя серверная дает прямой контроль и быстрый доступ команды, но только при наличии дежурств, запчастей и полномочий на инженерные системы. Карточка доступа без ночного электрика не сокращает время восстановления питания.
Граница между интегратором и владельцем должна быть письменной
Готовая площадка снимает часть строительных и эксплуатационных задач, но не передает оператору ответственность за всю ИИ-систему. Владелец по-прежнему отвечает за данные, программную среду, права доступа, планирование задач, резервное копирование и проверку производительности.
Составьте матрицу RACI для электричества, охлаждения, стойки, кабелей, сети, прошивок, запасных частей, мониторинга и реагирования. Для каждой аварии должен существовать один исполнитель, который восстанавливает сервис, и один владелец решения. Формулировка «совместная ответственность» без именованных действий обычно означает задержку в момент сбоя.
В договоре готовой площадки важны не рекламные проценты доступности, а измеряемые границы. Где заканчивается SLA электропитания? Какая температура считается нарушением и на каком датчике? Кто меняет PDU? Сколько времени требуется для допуска вашего инженера? Может ли оператор ограничить мощность стойки при проблемах охлаждения? Какие работы требуют окна?
При модернизации своей серверной те же вопросы переходят во внутренние регламенты. У службы эксплуатации здания и ИТ-команды часто разные приоритеты. Первая хочет стабильный режим и редкие изменения, второй нужно менять узлы и проводить тесты. Согласуйте окна, порядок отключения, запас расходников, контакты эскалации и право остановить опасную работу.
Сравнивать варианты нужно по одинаковой границе. Если цена готовой площадки включает два ввода, охлаждение, физическую охрану и дежурную смену, нельзя сопоставлять ее только со счетом за новый кондиционер в своей комнате. Добавьте проектирование, строительные работы, ИБП, генерацию, сервисные контракты, мониторинг, проверки, запасные части и время сотрудников.
GSE.kz может участвовать в таком проекте как системный интегратор ИИ-инфраструктуры и дата-центра, включая подбор серверной части и дальнейшую поддержку. Это не отменяет инженерной приемки: заказчик и интегратор должны утвердить профиль нагрузки, границы ответственности и критерии испытаний до поставки.
Решение видно в таблице ограничений
Выбор площадки становится понятнее, когда каждое требование получает число, владельца и подтверждение. Оценка «хорошо» или «плохо» скрывает разные риски, поэтому используйте статусы «подтверждено», «нужны работы» и «неизвестно».
Сведите сравнение к пяти группам:
- Для мощности готовая площадка должна закрепить лимит по каждому вводу, а своя серверная должна пройти проверку однолинейной схемы и запаса ИБП.
- Для тепла оператор подтверждает лимит конкретного места и режим отказа; владелец своей комнаты рассчитывает воздушный или жидкостный контур и затем испытывает его.
- Срок готовой площадки зависит от свободного места, кроссов и договора. Срок своей площадки зависит от проекта, закупок, разрешений и строительных работ.
- Сеть готового зала дает доступные каналы, но может добавить плату и задержку до данных. Своя комната сокращает путь к данным, если хранилище и фабрика выдерживают нагрузку.
- Доступ на внешнюю площадку регулирует оператор. В своей серверной команда входит быстрее, но ей нужны круглосуточный допуск, дежурные специалисты и запасные части.
Расширение оцените отдельно. На готовой площадке соседние стойки помогут только тогда, когда оператор заранее зарезервировал для них мощность, холод и сетевые порты. В своей серверной предел задают помещение, электрический ввод и инженерные системы всего здания. Ответственность на внешней площадке разделяет договор, а внутри организации она остается у собственных служб и подрядчиков. Оба варианта требуют именованных владельцев.
Готовая площадка обычно сильнее, если запуск нужен быстро, стойка превышает плотность существующего зала или в здании нет круглосуточной инженерной службы. Она также разумна как первый этап, когда реальный профиль нагрузки еще не измерен, а организация не хочет строить инфраструктуру по предположениям.
Модернизация своей серверной выигрывает, когда помещение уже имеет достаточные вводы и резерв, рядом находятся большие массивы данных, правила запрещают вынос оборудования либо команда должна часто работать с железом. Еще один сильный аргумент появляется, если организация планирует несколько стоек: капитальные работы тогда распределяются на большую полезную мощность. Но будущие стойки должны быть утвержденным планом, а не способом оправдать лишние расходы сегодня.
Не оценивайте варианты одной итоговой суммой за год. Разделите разовые затраты, регулярные платежи, стоимость внутреннего труда и цену задержки запуска. Затем проведите чувствительность к трем событиям: рост нагрузки, перенос срока и отказ основного охлаждения. Вариант с низкой базовой ценой может оказаться дорогим после первого такого события.
Приемка должна нагреть стойку
Документы подтверждают замысел, а нагрузочное испытание подтверждает работу собранной системы. Принимать GPU-стойку по факту включения серверов нельзя: в простое она потребляет и нагревает помещение намного меньше, чем при длительной вычислительной задаче.
Проведите испытание по согласованной последовательности:
- Сверьте маркировку всех вводов, PDU, розеток, сетевых портов, датчиков и запорной арматуры с исполнительной схемой.
- Поднимите нагрузку ступенями, выдерживая каждую ступень до стабилизации температур, мощности, расхода воздуха или жидкости.
- На проектной нагрузке зафиксируйте входные температуры по высоте стойки, мощность по ветвям, состояние блоков питания, частоты GPU, ошибки сети и скорость хранилища.
- Имитируйте согласованные отказы по одному: потерю ввода, охлаждающего модуля, насоса, сетевого пути и канала мониторинга.
- После восстановления проверьте автоматический запуск, отсутствие перегрузки, целостность задач и появление всех уведомлений.
Критерии приемки задают до теста. Фраза «температура в норме» не подходит. Укажите предельные показания на входе конкретного оборудования, допустимый перекос по вводам, отсутствие снижения частот из-за температуры, минимальную пропускную способность, время доставки сигнала и поведение задач при отказе.
Тепловой тест должен длиться достаточно, чтобы помещение, вода и строительные конструкции вышли на устойчивый режим. Короткий запуск проверяет только электрическое включение. Летом повторный тест или проверка расчетной модели может понадобиться, если первичную приемку проводили в холодную погоду и система использует наружный воздух либо сухие охладители.
Сохраните исходные данные как базовую линию: версии прошивок, конфигурации BIOS и BMC, лимиты мощности, температуру и влажность, графики PDU, телеметрию GPU, счетчики сети и результаты теста хранилища. После изменения микрокода, добавления узла или перестройки воздушного потока повторите соответствующую часть приемки. Без базовой линии команда спорит о впечатлениях вместо сравнения показаний.
Решение о площадке можно считать готовым, когда оба варианта описаны одной спецификацией и один из них доказал прохождение отказных и тепловых сценариев. Если поставщик или внутренняя служба не может назвать доступные киловатты, отводимое тепло и владельца аварийной реакции, это уже результат оценки. Такая площадка пока не готова к стойке с GPU, сколько бы свободного места ни показывала ее схема.
FAQ
Сколько мощности нужно одной стойке с GPU?
Точное значение получают суммой пиковых нагрузок серверов, сети, хранения и вспомогательных устройств в выбранной конфигурации. Для проектирования берут финальный пик и проверяют, выдержит ли его система после предусмотренного отказа ввода или модуля.
Можно ли поставить GPU-серверы в обычную серверную?
Можно, если помещение подтверждает требуемую мощность, отвод тепла, несущую способность, глубину стойки и безопасную эксплуатацию. Свободные юниты и работающий кондиционер сами по себе этого не доказывают.
Когда для GPU-стойки нужно жидкостное охлаждение?
Оно нужно, когда расчетный воздушный поток нельзя стабильно подать к входам оборудования или вывести из горячей зоны. Решение также диктует спецификация выбранных серверов, поэтому тип контура определяют до закупки.
Что дешевле, готовая площадка или своя серверная?
Ответ зависит от границы расчета. Сравнивайте аренду и услуги готовой площадки со всеми капитальными работами, сервисом инженерных систем, дежурствами, запчастями и ценой задержки запуска своей серверной.
Нужны ли два независимых ввода питания?
Если бизнес требует продолжать работу после отказа одной ветви, нужны два действительно независимых пути с достаточной оставшейся мощностью. Два кабеля от одного автомата или одного ИБП независимости не дают.
Как проверить охлаждение до установки GPU-серверов?
Используйте управляемую тепловую нагрузку или согласованную тестовую конфигурацию и измеряйте температуру на входе по всей высоте стойки. Испытание должно дойти до устойчивого режима и включать отказ одного предусмотренного охлаждающего элемента.
Какая сеть нужна для локальной ИИ-инфраструктуры?
Сеть выбирают по профилю задач: одному узлу, распределенному обучению и независимому инференсу нужны разные фабрики. Проверяйте коллективные операции, путь к хранилищу, задержку и переподписку, а не только скорость портов.
Что запросить у оператора готовой площадки?
Запросите закрепленную мощность по вводам, лимит отвода тепла на выбранном месте, схему резервирования, доступные сетевые подключения и порядок аварийного доступа. Все ограничения должны иметь числа, точки измерения и владельцев реакции.
Как защитить GPU-стойку физически?
Нужны контролируемый доступ, журналирование работ, подходящая пожарная защита и безопасный маршрут доставки тяжелого оборудования. Проверьте также пространство обслуживания, нагрузку на пол, аварийное отключение и уровень шума.
Как принять стойку после монтажа?
Поднимите вычислительную нагрузку ступенями до проектного уровня, снимите электрическую, тепловую и сетевую телеметрию, затем имитируйте согласованные одиночные отказы. Результат принимают по заранее записанным пределам, а не по факту включения серверов.