RTX PRO 6000 или две RTX 5090 для модели 70B?
Сравниваем RTX PRO 6000 и пару RTX 5090 для локальной модели 70B: память, скорость двух GPU, питание, надежность и полная цена станции.

Это не спор «профессиональная карта против игровой». Это выбор между одним большим адресным пространством с ECC и двумя отдельными быстрыми устройствами без NVLink. Карта должна выдерживать не демонстрационный запрос, а самый длинный рабочий контекст, очередь пользователей и обновление программного стека драйверов. Для исследовательского стенда с человеком, который готов менять движок и параметры, две RTX 5090 могут быть рациональной покупкой. Для рабочей станции, которую должны эксплуатировать сотрудники, а поддерживать ИТ-служба, простота одной RTX PRO 6000 обычно окупает разницу в цене.
96 ГБ меняют класс задач
Одна RTX PRO 6000 вмещает то, что пара RTX 5090 не может вместить без более жесткого квантования или выгрузки части данных в оперативную память. По спецификации NVIDIA у RTX PRO 6000 есть 96 ГБ GDDR7 с ECC и пропускная способность 1792 ГБ/с. У RTX 5090 есть 32 ГБ GDDR7, а у двух карт получается 64 ГБ физической памяти, разделенной на два пула.
Вес модели на диске дает только нижнюю границу. У модели с 70 миллиардами параметров веса занимают примерно 140 ГБ в BF16 или FP16, около 70 ГБ при 8 битах и около 35 ГБ при 4 битах. Форматы файлов, служебные таблицы квантования и выравнивание меняют точное число. После загрузки движку нужны рабочие буферы, CUDA Graphs и KV-кэш для контекста. Поэтому файл весом 38 ГБ не означает, что весь процесс стабильно уложится в 40 ГБ.
На 96 ГБ обычно можно запустить 70B в 8-битном представлении с практичным запасом либо в 4 битах с большим контекстом и несколькими параллельными сессиями. На двух RTX 5090 основным вариантом остается 4-битная модель. Качественное 4-битное квантование часто достаточно для чата, поиска по документам и генерации черновиков, но его нельзя считать бесплатным: чувствительные модели и задачи с вычислениями, редкими терминами или строгим форматом надо проверять на собственном наборе запросов.
Есть еще неприятная граница. Если половина разложенной модели требует 29 ГБ на каждой карте, то оставшиеся 3 ГБ быстро съедят KV-кэш и буферы. Суммарная надпись «64 ГБ» выглядит достаточной, а один процесс падает с CUDA out of memory при росте контекста или пакета. У 96 ГБ запас находится на той же карте, где выполняется запрос, и движку не приходится спасать конфигурацию выгрузкой в RAM.
Две карты не образуют общий бассейн памяти
Фреймворк должен явно разделить модель между RTX 5090, иначе второе устройство ничего не добавит к доступной памяти первого. CUDA не превращает две карты в один GPU. PyTorch, vLLM, TensorRT-LLM, llama.cpp и другие движки используют разные способы разбиения, а одинаковый параметр «2 GPU» у них не гарантирует одинаковую схему обмена.
При тензорном параллелизме каждый слой работает на обеих картах, а устройства обмениваются частичными результатами. Такой режим хорошо загружает вычислители, но связь между картами участвует почти в каждом слое. При конвейерном разбиении группы слоев живут на разных GPU. Обменов меньше, зато на одиночном запросе одна карта может ждать другую. Простое распределение слоев в llama.cpp удобно для запуска, но его скорость зависит от выбранного split mode, долей памяти и места, где движок держит KV-кэш.
У RTX 5090 нет NVLink, это прямо указано в таблице NVIDIA. Обмен идет через PCIe и, в некоторых системах, через оперативную память хоста. Материнская плата с двумя длинными разъемами еще ничего не доказывает. Нужны линии от процессора, режим как минимум x8/x8 подходящего поколения, достаточное расстояние между картами и рабочий peer-to-peer доступ. Второй разъем нередко электрически подключен как x4 через чипсет, а широкий кулер перекрывает соседние слоты.
Перед покупкой я прошу поставщика показать вывод nvidia-smi topo -m. Нормальная проверка выглядит как матрица с обеими GPU, CPU affinity и типом пути между картами. Значения PIX или PXB означают путь через один или несколько PCIe-коммутаторов, PHB указывает на прохождение через PCIe host bridge, а SYS обычно означает переход между NUMA-узлами. Чем длиннее путь, тем выше цена частых синхронизаций. Одного скриншота диспетчера устройств для такой проверки недостаточно.
Затем полезно проверить одноранговый доступ утилитой p2pBandwidthLatencyTest из CUDA Samples. Она выводит таблицы пропускной способности и задержки с P2P Enabled и Disabled. Если тест показывает, что доступ между парой GPU недоступен, это не всегда делает запуск невозможным, но меняет ожидаемую скорость. Такой результат надо получить до утверждения корпуса и платы, а не после сборки.
Скорость зависит от режима, а не от суммы ядер
Две RTX 5090 способны обогнать одну RTX PRO 6000, когда движок эффективно делит вычисления и обмен через PCIe не съедает выигрыш. У пары больше суммарных CUDA-ядер и два независимых канала памяти. При обработке нескольких запросов можно назначить отдельную копию небольшой модели каждой карте или разделить 70B и увеличить общую пропускную способность сервиса.
Для одного интерактивного диалога результат менее очевиден. Генерация одного токена большой моделью часто ограничена чтением весов из памяти. Две карты читают свои части параллельно, затем синхронизируются. Хорошая реализация получает ускорение, плохая тратит его на пересылки и ожидание. Одна карта избегает межпроцессорного обмена и дает более предсказуемую задержку первого токена.
Не сравнивайте карты по AI TOPS из рекламных таблиц. Производители могут считать пиковые операции с разной точностью и разреженностью, а ваш движок может не использовать соответствующий путь. Полезны четыре измерения на одной и той же модели: время загрузки, задержка первого токена, скорость последующей генерации и суммарные токены в секунду при ожидаемом числе пользователей. К ним надо добавить пиковое потребление видеопамяти.
Для честного испытания зафиксируйте файл модели, версию драйвера, версию движка, длину входа, длину ответа, размер пакета и параметры сэмплирования. Сделайте прогрев, затем несколько одинаковых прогонов. Если поставщик показывает только короткий запрос на пустом контексте, вы видите лучший случай, а не вашу нагрузку. Тест с документом на 16 или 32 тысячи токенов часто меняет вывод, потому что KV-кэш становится заметной частью памяти.
У пары есть еще один полезный режим: независимые задания. Например, одна карта обслуживает основной запрос, вторая строит эмбеддинги, делает reranking или запускает отдельную модель. Здесь отсутствие общей памяти почти не мешает, а отказ одного процесса не забирает все вычисления. Если именно так устроено приложение, две RTX 5090 могут быть лучше одной большой карты даже без идеального тензорного параллелизма.
Сначала выберите движок и формат весов
Совместимость программного стека надо подтвердить до заказа GPU, потому что одинаковая модель в разных движках расходует память и делится между картами по-разному. Формат GGUF удобен для llama.cpp и смешанной выгрузки на CPU, а форматы GPTQ, AWQ и другие варианты часто выбирают для серверных движков на CUDA. Название «4 бита» не делает эти файлы взаимозаменяемыми и не гарантирует одинаковое качество.
Начните с приложения, а не с карты. Если нужна совместимость с API, пакетная обработка и планировщик нескольких пользователей, проверьте серверный движок с вашим клиентом, авторизацией и мониторингом. Если задача состоит в локальном диалоге одного специалиста и часть слоев допустимо держать в RAM, другой движок может дать проще настройку. Возможность скачать файл и получить первый ответ еще не означает готовность к эксплуатации.
Версии тоже имеют значение. Новый драйвер может требоваться для Blackwell, а конкретная сборка PyTorch или CUDA-библиотеки может еще не поддерживать нужное ядро квантования. Контейнер фиксирует зависимости приложения, но использует драйвер хоста и не исправляет неподходящую PCIe-топологию. В протоколе теста я сохраняю образ контейнера или список пакетов, команду запуска и контрольную сумму файла модели.
Проверьте функции, которые окружают генерацию. Structured output, вызов инструментов, speculative decoding, prefix caching и ограничение числа сессий могут менять память или исключать определенный backend. Если приложение обязано выдавать JSON по схеме, измеряйте долю корректных ответов с включенным ограничителем, а не скорость свободного текста. Если используется RAG, включите в испытание поиск, reranking и фактический размер вставляемых фрагментов.
Обновление должно быть обратимым. Храните предыдущий образ, параметры запуска и небольшой набор контрольных запросов. После смены драйвера, движка или квантования автоматически сравните корректность формата, время первого токена, скорость и максимум VRAM. Две карты добавляют к этой матрице проверку распределения и P2P, одна большая карта сокращает число зависимых параметров, но тоже требует повторного теста.
Последняя проверка касается лицензии модели и обработки данных. Локальный запуск сам по себе не дает права использовать любые веса в коммерческом сервисе и не определяет, где приложение хранит запросы. Зафиксируйте источник весов, условия лицензии, доступ к каталогу модели, политику журналов и удаление временных файлов. Эти требования не меняют объем VRAM, зато могут изменить допустимый движок и способ развертывания.
Контекст и параллельные пользователи съедают запас
KV-кэш растет с длиной контекста, числом одновременно обрабатываемых последовательностей, количеством слоев и размером представления ключей и значений. Универсальной цифры для «70B на 128K» нет: архитектуры используют разное число KV-голов, а движки поддерживают разные типы кэша и способы разбиения. Поэтому расчет только по весам модели систематически занижает требование к памяти.
Практический бюджет памяти я считаю так:
- Беру фактический размер загружаемых весов, а не название квантования.
- Добавляю измеренный расход движка после загрузки модели с пустым контекстом.
- Запускаю самый длинный разрешенный запрос при плановом числе параллельных сессий.
- Оставляю запас на вариации аллокатора, обновление движка и фоновые процессы.
Этот тест важнее калькулятора из интернета. Запустите его тем же API и теми же настройками, которые будут в эксплуатации. Для vLLM надо зафиксировать tensor_parallel_size, max_model_len, max_num_seqs, тип KV-кэша и долю памяти GPU. Для llama.cpp важны число слоев на GPU, схема split mode, доли tensor split, размер контекста и число параллельных последовательностей.
Когда память заканчивается на одной RTX PRO 6000, остается понятный набор компромиссов: уменьшить контекст, сократить параллелизм, перейти на более компактные веса или выгрузить часть слоев. На двух RTX 5090 добавляется балансировка. Свободные 6 ГБ на первой карте не помогают, если вторая уже заполнена, пока движок не умеет перераспределить слои или кэш именно так, как требуется.
Это различие особенно заметно в сервисе с непредсказуемыми запросами. Демонстрация с одним оператором может быть стабильной, а три длинных диалога одновременно вызывают повторное выделение памяти и падение worker-процесса. Для производственной станции я проверяю не только среднее время ответа, но и поведение при заполненной очереди: получает ли клиент контролируемую ошибку, перезапускается ли процесс и освобождает ли драйвер память.
70B означает инференс, а не полноценное обучение
Обе конфигурации разумно рассматривать прежде всего для инференса и ограниченной адаптации модели. Полное обучение 70B или полноценный fine-tuning всех весов требует памяти для параметров, градиентов, состояний оптимизатора и активаций. Даже 96 ГБ для этого недостаточно. Две RTX 5090 тоже не превращают настольную станцию в обучающий кластер.
QLoRA и другие методы параметрически эффективной настройки меняют задачу. Базовые веса остаются квантованными, а обучение обновляет небольшие адаптеры. Одна RTX PRO 6000 дает заметно больше места для длины последовательности, размера пакета и активаций. Пара RTX 5090 дает больше вычислений, но требует поддержки распределенного обучения и добавляет коммуникацию. Возможность запустить один пример еще не подтверждает, что обучение будет достаточно быстрым и стабильным для ежедневной работы.
Надо также отделять качество модели от формата весов. Сравните 4-битный и 8-битный варианты на наборе реальных задач: ответы по внутренним документам, извлечение полей, работа на русском и казахском, генерация JSON, вычисления и отказ отвечать при нехватке данных. Оценивайте совпадение с эталоном и долю сломанных форматов, а не впечатление от пяти удачных диалогов.
Популярный совет «берите две игровые карты, потому что цена за FLOPS ниже» игнорирует цель системы. Для эксперимента цена вычисления действительно важна. Для станции, где модель должна открыться утром после обновления драйвера и пережить длинный запрос без ручного переноса слоев, память и поддерживаемая конфигурация важнее пикового числа операций.
Питание и охлаждение меняют цену корпуса
Максимальная мощность RTX PRO 6000 Workstation Edition составляет 600 Вт. Для одной RTX 5090 NVIDIA указывает 575 Вт, значит две карты могут потребовать до 1150 Вт только для GPU. К этому добавляются процессор, память, накопители, вентиляторы, потери блока питания и кратковременные скачки нагрузки.
Номинал блока питания нельзя выбирать сложением паспортных чисел без запаса. Двухкарточная система требует серверного или рабочего подхода к распределению линий питания, нужного числа штатных кабелей и проверки допустимого тока. Переходники, сильно согнутые у разъема 16-контактные кабели и кабели, зажатые боковой стенкой, я не принимаю как нормальную сборку. Конкретный БП и схема подключения должны быть одобрены изготовителем корпуса или интегратором.
Тепловые 1150 Вт внутри корпуса тоже надо вывести наружу. Карты с открытым охлаждением возвращают горячий воздух в корпус и могут задыхаться, если стоят вплотную. Температура ядра не рассказывает всю историю: следите за температурой памяти, частотами, скоростью вентиляторов и тем, не снижает ли одна карта частоту из-за воздуха от другой. Испытание должно идти при закрытых панелях в помещении с реальной летней температурой.
Разница в энергии легко считается без спорной цены электричества. При одинаковой загрузке разница только по лимитам GPU равна 550 Вт. Восемь часов в день и 250 рабочих дней дают до 1100 кВт·ч разницы в год; круглосуточная верхняя граница составляет около 4818 кВт·ч. Реальное потребление будет ниже паспортного и зависит от ограничения мощности, но формула заставляет включить электричество и кондиционирование в смету.
Ограничение power limit иногда делает две RTX 5090 заметно экономичнее с небольшой потерей скорости. Это надо измерить на вашей модели. Такая настройка не решает вопросы объема памяти, слотов, кабелей и поддержки, поэтому нельзя выдавать ее за полный ответ на требования станции.
Профессиональная карта покупает предсказуемость
RTX PRO 6000 предлагает ECC для видеопамяти, профессиональную ветку драйверов и возможность MIG, указанную NVIDIA для Blackwell Workstation Edition. ECC исправляет определенные ошибки памяти, но не заменяет тестирование и не гарантирует правильный ответ модели. MIG полезен для изоляции ресурсов совместимых нагрузок, однако конкретную поддержку в вашем стеке надо проверить заранее.
У RTX 5090 потребительский класс поддержки. Это не делает карту ненадежной, но меняет процесс разбора проблем. Изготовитель готовой станции может ограничить поддержку конфигурации с двумя картами, кабелями или конкретной платой. Если систему собирают из розничных компонентов, ИТ-служба сама выясняет, относится сбой к драйверу, BIOS, PCIe-топологии, блоку питания или одной из карт.
Для закупки я фиксирую в спецификации не только названия GPU. Нужны версия и канал драйвера, поддерживаемая ОС, прошивка платы, режим PCIe, лимиты мощности, температура при длительной нагрузке, процедура обновления и время восстановления после отказа. Отдельно запрашиваю, кто воспроизводит ошибку приложения и кто меняет компонент. Фраза «гарантия на комплектующие» не отвечает на эти вопросы.
Одна карта сокращает число точек отказа и упрощает диагностику. У пары появляется полезная частичная деградация: некоторые приложения можно временно запустить на одном GPU, если второй отказал. Но 70B, рассчитанная на 64 ГБ, на одной RTX 5090 уже не поместится без другого квантования или выгрузки. План аварийной работы надо реально запустить, а не записать в презентацию.
Для организаций с формальными требованиями имеют значение происхождение станции, документы на сборку, серийный учет и единое окно поддержки. GSE проектирует и производит рабочие станции в Казахстане, интегрирует ИИ-инфраструктуру и предоставляет круглосуточную техническую поддержку через национальную сервисную сеть. Это не выбирает GPU за заказчика, но позволяет закрепить результаты нагрузочного теста и ответственность за всю конфигурацию в одной спецификации.
Считать надо полную стоимость станции
Цена двух GPU или одной GPU не равна цене рабочего места. Для пары RTX 5090 могут понадобиться более дорогая плата с правильной разводкой линий, процессор с достаточным числом PCIe-линий, большой корпус, мощный БП, дополнительное охлаждение и больше времени инженера на настройку. RTX PRO 6000 сама стоит дороже потребительской карты, зато помещает 96 ГБ в два слота и оставляет другие слоты свободными.
Смету полезно разбить на пять строк:
- готовая станция со всеми компонентами и запасом системной RAM;
- доставка, сборка, кабели и проверка под нагрузкой;
- энергия и охлаждение за плановый срок;
- поддержка, запасные части и время восстановления;
- труд инженера на обновления и повторную настройку моделей.
Не подставляйте в сравнение рекомендованные цены из другой страны. Нужны коммерческие предложения на две полностью собранные станции в Казахстане с одинаковыми процессором, объемом RAM, накопителями и условиями поддержки. Если одна конфигурация доступна через месяц, а другая через полгода, стоимость ожидания тоже относится к проекту.
Системной памяти я закладываю достаточно для загрузки модели, преобразования весов и возможного CPU offload. Для 70B рабочая станция со 128 ГБ RAM может оказаться тесной при конвертации или нескольких сервисах; 256 ГБ дает спокойнее работать с файлами и кэшем. Это рекомендация для проектирования, а не обязательное требование каждого движка. Быстрый NVMe не заменяет VRAM, но сокращает загрузку и помогает хранить несколько вариантов модели.
GSE может собрать и испытать обе архитектуры как целую рабочую станцию, включая питание, охлаждение и программный стек, вместо продажи GPU в отрыве от корпуса. В техническое задание стоит внести ваш файл модели и сценарий теста, чтобы приемка проверяла результат, а не только перечень деталей.
Решение определяется режимом эксплуатации
Одну RTX PRO 6000 стоит брать, если 70B должна работать как постоянный внутренний сервис, нужен 8-битный вариант или большой запас под KV-кэш, важны ECC, профессиональная поддержка и простая эксплуатация. Это мой выбор по умолчанию для предприятия. Вы платите за 96 ГБ в одном устройстве и за меньшее число способов получить нестабильную систему.
Две RTX 5090 стоит рассматривать, если бюджет покупки жестко ограничен, приемлемо качественное 4-битное квантование, команда контролирует движок, плата дает правильную PCIe-топологию, а нагрузка хорошо масштабируется или делится на независимые задания. Пара также интересна исследователю, которому важнее максимальная скорость эксперимента, чем единая линия поддержки.
До заказа проведите приемочный тест на целевой модели. Он должен включать холодную загрузку, длинный контекст, плановое число одновременных запросов, час устойчивой генерации, запись температуры и мощности, перезапуск после ошибки и повтор после обновления драйвера. Зафиксируйте версии и сохраните команды запуска. Тогда сравнение закончится не спором о таблицах характеристик, а протоколом, который будущая станция обязана повторить.
Если ни одна конфигурация не проходит тест без опасно малого запаса, не пытайтесь выиграть несколько гигабайт ручной раскладкой слоев. Возьмите более компактную модель, сократите контекст или перенесите нагрузку на серверную платформу с большим объемом памяти и подходящим межсоединением. Рабочая станция хороша тогда, когда ее ограничения совпадают с задачей, а не когда демонстрация один раз выдала ответ.
FAQ
Поместится ли модель 70B на одной RTX 5090?
Обычно нет, если вся модель и рабочие данные должны находиться в 32 ГБ VRAM. Сильно квантованный вариант иногда запускают с частичной выгрузкой в системную память, но скорость и длина контекста страдают.
Складывается ли память двух RTX 5090 в 64 ГБ?
Физически памяти 64 ГБ, но она остается двумя отдельными пулами по 32 ГБ. Движок должен уметь разделить веса, кэш и вычисления, а свободное место на одной карте не всегда доступно другой.
Хватит ли 96 ГБ для 70B в FP16?
Нет, одни веса 70B в FP16 или BF16 занимают примерно 140 ГБ. На 96 ГБ практичны 8-битные и 4-битные варианты, причем точный запас зависит от формата, контекста и движка.
Что быстрее для 70B, RTX PRO 6000 или две RTX 5090?
Пара RTX 5090 может быть быстрее при хорошем тензорном параллелизме и подходящей PCIe-топологии. Одна RTX PRO 6000 часто дает более ровную задержку и избавляет от обмена между GPU, поэтому ответ подтверждает только тест вашей модели.
Нужен ли NVLink для двух RTX 5090?
RTX 5090 не поддерживает NVLink, поэтому выбирать его уже не приходится. Движок может работать через PCIe, но пропускная способность, P2P-доступ и расположение слотов заметно влияют на масштабирование.
Можно ли обучать модель 70B на такой станции?
Полное обучение или настройка всех весов не помещается ни в одну из этих конфигураций. QLoRA и похожие методы возможны при тщательно выбранных длине последовательности, размере пакета и распределении модели.
Насколько важна ECC для локальной LLM?
ECC полезна для долгих профессиональных нагрузок, потому что исправляет определенные ошибки видеопамяти и сообщает о проблемах. Она не проверяет смысл ответа модели и не заменяет контрольные тесты.
Какой блок питания нужен для двух RTX 5090?
Номинал зависит от процессора, платы, лимитов мощности и схемы кабелей, поэтому универсального безопасного числа нет. Проектируйте систему от максимума 1150 Вт только для GPU, с запасом и одобрением изготовителя станции.
Сколько оперативной памяти нужно станции с моделью 70B?
Для готового инференса иногда достаточно 128 ГБ, но конвертация весов, CPU offload и соседние сервисы быстро сокращают запас. Для новой рабочей станции я обычно рассматриваю 256 ГБ как более спокойную отправную точку.
Как проверить две GPU до покупки?
Попросите прогнать целевую модель и сохранить вывод `nvidia-smi topo -m`, P2P-тест, расход VRAM, скорость, температуру и мощность. Испытайте длинный контекст и реальное число одновременных запросов, а не короткую демонстрацию.