6 мин

70B моделі үшін RTX PRO 6000 әлде екі RTX 5090 ма?

Жергілікті 70B үшін RTX PRO 6000 мен екі RTX 5090 салыстырамыз: жад, қос GPU жылдамдығы, қуат, сенімділік және станцияның толық құны.

70B моделі үшін RTX PRO 6000 әлде екі RTX 5090 ма?

Жергілікті 70B моделін тұрақты қолдану үшін мен бір NVIDIA RTX PRO 6000 Blackwell Workstation Edition таңдар едім. Оның 96 ГБ бейнежады кванттау тәсілін, контекст ұзындығын және қатар орындалатын сұраулар санын еркін таңдауға мүмкіндік береді. Екі RTX 5090 жиынтық есептеу қуаты жағынан басым және кейде секундына көбірек токен береді, бірақ оған дұрыс бапталған бағдарламалық жасақтама қажет. Модель мен жұмыс буферлері әр картадағы бөлек 32 ГБ жадқа сыюы тиіс.

Бұл кәсіби және ойын карталары туралы айтыс емес. Таңдау ECC бар бір үлкен мекенжай кеңістігі мен NVLink жоқ екі бөлек жылдам құрылғының арасында жасалады. Карта көрсетілім сұрауына ғана емес, ең ұзын жұмыс контексіне, пайдаланушы кезегіне және бағдарлама жаңартуына төзуі керек. Қозғалтқыш пен параметрлерді өзгертуге дайын маман басқаратын зерттеу стенді үшін екі RTX 5090 орынды болуы мүмкін. Қызметкерлер қолданатын, ал АТ бөлімі сүйемелдейтін жұмыс станциясында бір RTX PRO 6000 қарапайымдылығы көбіне баға айырмасын ақтайды.

96 ГБ тапсырма ауқымын өзгертеді

Бір RTX PRO 6000 екі RTX 5090 қатаңырақ кванттаусыз немесе деректің бір бөлігін жедел жадқа шығармай сыйғыза алмайтын жүктемені қабылдайды. NVIDIA сипаттамасында RTX PRO 6000 үшін ECC бар 96 ГБ GDDR7 және 1792 ГБ/с жад өткізу қабілеті көрсетілген. RTX 5090 картасында 32 ГБ GDDR7 бар, сондықтан екі карта екі бөлек пулға бөлінген 64 ГБ физикалық жад береді.

Дискідегі салмақ файлы тек төменгі шекті көрсетеді. 70 миллиард параметрлі модельдің салмақтары BF16 немесе FP16 форматында шамамен 140 ГБ, 8 битте 70 ГБ, 4 битте 35 ГБ алады. Файл форматы, кванттау кестелері мен туралау нақты көлемді өзгертеді. Жүктелгеннен кейін қозғалтқышқа жұмыс буферлері, CUDA Graphs және контекстің KV-кэші керек. Сондықтан 38 ГБ файл бүкіл процесс 40 ГБ ішінде тұрақты жұмыс істейді деген сөз емес.

96 ГБ жадта 70B моделін көбіне 8 битте жеткілікті қормен немесе 4 битте ұзын контекст және бірнеше қатар сессиямен іске қосуға болады. Екі RTX 5090 үшін негізгі нұсқа 4 биттік модель болып қалады. Сапалы 4 биттік кванттау чатқа, құжат іздеуге және мәтін жобасын жасауға жиі жетеді, бірақ сапа тегін сақталмайды. Есептеулер, сирек терминдер не қатаң пішім қажет тапсырмаларды өз сұрауларыңызбен сынаңыз.

Қолайсыз шек те бар. Бөлінген модельдің әр жартысы әр картада 29 ГБ алса, қалған 3 ГБ KV-кэш пен буферлерге тез кетеді. «64 ГБ» деген жиынтық сан жеткілікті көрінеді, алайда контекст немесе пакет үлкейгенде процесс CUDA out of memory қатесімен тоқтайды. 96 ГБ жағдайда қор сұрауды орындайтын сол картаның өзінде болады, қозғалтқыш конфигурацияны RAM-ға шығару арқылы құтқармайды.

Екі карта бір ортақ жад пулын құрмайды

Фреймворк модельді RTX 5090 карталары арасында өзі бөлуі керек, әйтпесе екінші құрылғы бірінші картаның қолжетімді жадын өсірмейді. CUDA екі картаны бір GPU-ға айналдырмайды. PyTorch, vLLM, TensorRT-LLM, llama.cpp және басқа қозғалтқыштар модельді әртүрлі бөледі, ал бірдей «2 GPU» параметрі бірдей алмасу сызбасына кепіл болмайды.

Тензорлық параллелизмде әр қабатты екі карта бірге есептеп, аралық нәтижелермен алмасады. Есептеу блоктары жақсы жүктеледі, бірақ карталар арасындағы байланыс әр қабатқа дерлік қатысады. Конвейерлік бөлуде қабат топтары әр GPU-да орналасады. Алмасу азаяды, есесіне жалғыз сұрауда бір карта екіншісін күтуі мүмкін. llama.cpp ішіндегі қарапайым қабат бөлу ыңғайлы, бірақ жылдамдық split mode, жад үлесі және KV-кэш орналасуына тәуелді.

NVIDIA кестесінде көрсетілгендей, RTX 5090 NVLink қолдамайды. Дерек PCIe арқылы, кей жүйеде хосттың жедел жады арқылы өтеді. Екі ұзын ұясы бар аналық плата жеткілікті дәлел емес. Процессордан келетін желілер, кемінде лайықты x8/x8 режимі, карталар арасындағы орын және жұмыс істейтін peer-to-peer қатынасы қажет. Екінші ұзын ұя көбіне чипсет арқылы x4 болып қосылады, ал қалың салқындатқыш көрші ұяларды жабады.

Сатып алмас бұрын жеткізушіден nvidia-smi topo -m нәтижесін сұраймын. Дұрыс тексеру екі GPU, CPU affinity және карталар арасындағы жол түрі бар матрицаны көрсетеді. PIX не PXB бір немесе бірнеше PCIe коммутаторы арқылы өтетін жолды, PHB PCIe host bridge арқылы өтуді, ал SYS әдетте NUMA түйіндерінің арасын білдіреді. Жол ұзарған сайын жиі синхрондау қымбаттайды. Құрылғылар диспетчерінің скриншоты жеткіліксіз.

Содан кейін CUDA Samples құрамындағы p2pBandwidthLatencyTest құралын іске қосыңыз. Ол P2P Enabled және Disabled режимдеріндегі өткізу қабілеті мен кідіріс кестелерін шығарады. Карталар арасында тікелей қатынас болмаса, модель бәрібір іске қосылуы мүмкін, бірақ күтілетін жылдамдық өзгереді. Бұл нәтижені корпус пен платаны бекітпей тұрып алу керек.

Жылдамдық ядро санына емес, режимге тәуелді

Қозғалтқыш есепті тиімді бөліп, PCIe алмасуы ұтысты жоймаса, екі RTX 5090 бір RTX PRO 6000-нан жылдам болуы мүмкін. Жұпта жиынтық CUDA ядролары көп және екі тәуелсіз жад арнасы бар. Бірнеше сұрау кезінде шағын модельдің бір көшірмесін әр картаға беруге немесе 70B моделін бөліп, сервистің жалпы өнімділігін көтеруге болады.

Бір интерактивті диалогта нәтиже анық емес. Үлкен модельдің бір токенін шығару жылдамдығы көбіне салмақтарды жадтан оқумен шектеледі. Екі карта өз бөлігін қатар оқып, кейін синхрондалады. Жақсы іске асыру жылдамдық береді, нашары уақытты тасымал мен күтуге жұмсайды. Бір карта GPU арасындағы алмасуды қажет етпей, алғашқы токен кідірісін тұрақтырақ етеді.

Карталарды жарнамалық кестедегі AI TOPS бойынша салыстырмаңыз. Өндірушілер түрлі дәлдік пен сиректік кезіндегі шекті операцияларды санауы мүмкін, ал сіздің қозғалтқышыңыз ол жолды пайдаланбауы ықтимал. Бір модельде төрт көрсеткішті өлшеңіз: жүктеу уақыты, алғашқы токен кідірісі, кейінгі генерация жылдамдығы және жоспарлы пайдаланушы санындағы жиынтық токен/секунд. Ең жоғары VRAM шығынын да жазыңыз.

Әділ сынақ үшін модель файлын, драйвер мен қозғалтқыш нұсқасын, кіріс және шығыс ұзындығын, пакет өлшемін және сэмплинг параметрлерін бекітіңіз. Жүйені қыздырып, бірдей іске қосуды бірнеше рет қайталаңыз. Бос контекстегі қысқа сұрау сіздің жүктемеңізді емес, ең жақсы жағдайды көрсетеді. 16 немесе 32 мың токендік құжатпен сынақ нәтижені жиі өзгертеді, өйткені KV-кэш жадтың елеулі бөлігін алады.

Жұптың тағы бір пайдалы режимі бар: тәуелсіз тапсырмалар. Бір карта негізгі сұрауды орындайды, екіншісі эмбеддинг жасайды, нәтижені қайта сұрыптайды немесе бөлек модельді іске қосады. Мұнда ортақ жадтың жоқтығы көп кедергі келтірмейді, бір процесс істен шықса, бүкіл есептеу тоқтамайды. Қолданба осылай құрылған болса, мінсіз тензорлық параллелизмсіз де екі RTX 5090 тиімді болуы мүмкін.

Алдымен қозғалтқыш пен салмақ форматын таңдаңыз

GPU тапсырысына дейін бағдарламалық стек үйлесімін растаңыз, себебі бір модель әр қозғалтқышта жадты әртүрлі жұмсап, карталар арасында әртүрлі бөлінеді. GGUF llama.cpp және CPU-ға аралас шығару үшін ыңғайлы, ал GPTQ, AWQ және өзге форматтар CUDA серверлік қозғалтқыштарында жиі қолданылады. «4 бит» атауы файлдарды өзара ауыстырмайды және бірдей сапаға кепіл болмайды.

Картадан емес, қолданбадан бастаңыз. API үйлесімі, пакеттік өңдеу және бірнеше пайдаланушыны жоспарлау керек болса, серверлік қозғалтқышты клиент, авторизация және мониторингпен бірге тексеріңіз. Бір маманға жергілікті чат керек және қабаттардың бір бөлігін RAM-да ұстауға болса, басқа қозғалтқыш оңайырақ болуы мүмкін. Файлды жүктеп, бір жауап алу өндірістік дайындықты дәлелдемейді.

Нұсқалар маңызды. Blackwell үшін жаңа драйвер қажет болуы мүмкін, ал PyTorch не CUDA кітапханасының белгілі бір жинағы керекті кванттау ядросын әлі қолдамауы ықтимал. Контейнер қолданба тәуелділіктерін бекітеді, бірақ хост драйверін қолданады және нашар PCIe топологиясын түземейді. Сынақ хаттамасында контейнер бейнесін не пакеттер тізімін, іске қосу пәрменін және модель файлының бақылау сомасын сақтаймын.

Генерацияны қоршаған мүмкіндіктерді тексеріңіз. Structured output, құрал шақыру, speculative decoding, prefix caching және сессия санын шектеу жадты өзгертуі немесе кей backend-ті жарамсыз етуі мүмкін. Қолданба схемаға сай JSON беруі тиіс болса, еркін мәтін жылдамдығын емес, шектеу қосылғандағы дұрыс жауап үлесін өлшеңіз. RAG қолданылса, іздеу, қайта сұрыптау және енгізілетін үзінділердің нақты көлемін сынаққа қосыңыз.

Жаңартуды кері қайтару мүмкін болуы керек. Алдыңғы бейнені, іске қосу параметрлерін және шағын бақылау сұрауларын сақтаңыз. Драйвер, қозғалтқыш не кванттау өзгерген соң пішім дұрыстығын, алғашқы токен уақытын, жылдамдықты және ең жоғары VRAM көлемін автоматты салыстырыңыз. Екі картада бұған бөлу мен P2P тексеруі қосылады. Бір үлкен карта тәуелді параметрлерді азайтады, бірақ қайта сынауды бәрібір қажет етеді.

Соңында модель лицензиясы мен дерек өңдеуді тексеріңіз. Жергілікті іске қосу кез келген салмақты коммерциялық сервисте қолдануға құқық бермейді және қолданба сұрауларды қайда сақтайтынын анықтамайды. Салмақ көзі, лицензия шарты, модель каталогына қатынас, журнал саясаты және уақытша файлдарды жою тәртібі жазылсын. Бұл талаптар VRAM көлемін өзгертпейді, бірақ рұқсат етілген қозғалтқыш пен орналастыру әдісін өзгертуі мүмкін.

Контекст пен қатар пайдаланушылар қорды азайтады

Бүкіл станцияға қолдау
GSE ұлттық сервис желісі жеке GPU-ды емес, дайын конфигурацияны қолдайды.
GSE-ге хабарласу

KV-кэш контекст ұзындығымен, қатар орындалатын тізбектер санымен, қабаттармен және кілт пен мән форматына сай өседі. «128K контекстегі 70B» үшін ортақ сан жоқ. Архитектураларда KV-бас саны әртүрлі, қозғалтқыштар кэш түрлері мен бөлу тәсілдерін әрқалай қолдайды. Тек модель салмағына сүйенген есеп жад талабын үнемі кем көрсетеді.

Жад бюджетін былай есептеймін:

  1. Кванттау атауын емес, жүктелетін салмақтың нақты көлемін аламын.
  2. Модель бос контекспен жүктелгеннен кейінгі қозғалтқыш шығынын қосамын.
  3. Жоспарлы қатар сессиялармен рұқсат етілген ең ұзын сұрауды іске қосамын.
  4. Аллокатор ауытқуына, жаңартуға және фондық процестерге қор қалдырамын.

Бұл сынақ интернеттегі калькулятордан маңыздырақ. Оны өндірістегі API және параметрлермен өткізіңіз. vLLM үшін tensor_parallel_size, max_model_len, max_num_seqs, KV-кэш түрі және GPU жад үлесін бекітіңіз. llama.cpp үшін GPU қабат саны, split mode, tensor split үлесі, контекст көлемі және қатар тізбек санын жазыңыз.

Бір RTX PRO 6000 жады таусылса, ымыралар түсінікті: контексті қысқарту, қатарлықты азайту, шағын салмаққа көшу немесе қабаттарды шығару. Екі RTX 5090 бұған теңгеруді қосады. Екінші карта толып тұрса, бірінші картадағы бос 6 ГБ көмектеспейді, қозғалтқыш қабат не кэшті қажет тәсілмен қайта бөле алуы тиіс.

Айырма болжанбайтын сұраулары бар сервисте анық көрінеді. Бір операторлық көрсетілім тұрақты болғанымен, үш ұзын диалог жадты қайта бөлдіріп, worker процесін құлатуы мүмкін. Өндірісте орташа жауап уақытын ғана емес, толы кезектегі әрекетті тексеріңіз: клиент бақыланатын қате ала ма, процесс қайта іске қосыла ма, драйвер жадты босата ма.

70B толық оқыту емес, инференс деген сөз

Екі конфигурацияны да негізінен инференс пен шектеулі бейімдеуге арналған жүйе деп қараңыз. 70B моделін толық оқыту немесе барлық салмағын баптау үшін параметрлерге, градиенттерге, оңтайландырғыш күйіне және активацияларға жад керек. 96 ГБ та жетпейді. Екі RTX 5090 үстелдік станцияны оқыту кластеріне айналдырмайды.

QLoRA және параметрі тиімді басқа әдістер тапсырманы өзгертеді. Негізгі салмақтар квантталған күйде қалады, оқыту шағын адаптерлерді жаңартады. Бір RTX PRO 6000 тізбек ұзындығы, пакет және активацияға көбірек орын береді. Екі RTX 5090 есептеуді көбейтеді, бірақ бөлінген оқыту қолдауы мен алмасуды қажет етеді. Бір мысалды іске қосу күнделікті оқыту жеткілікті жылдам әрі тұрақты екенін дәлелдемейді.

Модель сапасын салмақ форматынан бөлек бағалаңыз. 4 және 8 биттік нұсқаларды нақты тапсырмаларда салыстырыңыз: ішкі құжат бойынша жауап, өріс шығару, қазақша және орысша жұмыс, JSON жасау, есептеу және дерек жетпегенде жауаптан бас тарту. Бес сәтті чатқа сүйенбей, эталонмен сәйкестік пен бұзылған пішім үлесін санаңыз.

«FLOPS бағасы төмен болғандықтан екі ойын картасын алыңыз» деген кеңес жүйе мақсатын елемейді. Тәжірибеде есептеу бағасы маңызды. Драйвер жаңарған соң таңертең ашылып, қабаттарды қолмен көшірмей ұзын сұрауға төзетін станция үшін шекті операция санынан гөрі жад пен қолдау көрсетілетін конфигурация маңызды.

Қуат пен салқындату корпус бағасын өзгертеді

Екі RTX 5090 сынағы
GSE инженерлері конфигурация бекітілмей тұрып PCIe топологиясы мен 70B масштабталуын тексереді.
Конфигурацияны талқылау

RTX PRO 6000 Workstation Edition ең көбі 600 Вт тұтынады. NVIDIA бір RTX 5090 үшін 575 Вт көрсетеді, сондықтан екі карта тек GPU үшін 1150 Вт дейін қажет етуі мүмкін. Бұған процессор, жад, жинақтауыш, желдеткіш, қуат блогының шығыны және қысқа жүктеме секірістері қосылады.

Қуат блогын паспорт сандарын қорсыз қосып таңдамаңыз. Екі карталы жүйеге жұмыс станциясына лайық қуат бөлу, штаттық кабель саны және ток шегін тексеру қажет. Адаптер, коннектор жанында қатты иілген 16 істікті кабель немесе бүйір қақпақ қысқан сым қалыпты жинақ емес. Нақты қуат блогы мен қосу сызбасын станция өндірушісі не интегратор бекітсін.

Корпус ішіндегі 1150 Вт жылуды сыртқа шығару керек. Ашық салқындатқыштар ыстық ауаны корпусқа қайтарады және қатар тұрса тұншығуы мүмкін. Ядро температурасы жеткіліксіз, жад температурасын, жиілікті, желдеткіш жылдамдығын және бір картаның екіншісінің ыстық ауасынан баяулауын қадағалаңыз. Сынақ жабық қақпақпен, жаздағы нақты бөлме температурасында өтсін.

Энергия айырмасын электр бағасын талқыламай есептеуге болады. GPU қуат шектерінің айырмасы 550 Вт. Күніне сегіз сағат және жылына 250 жұмыс күні 1100 кВт·сағ дейін, тәулік бойғы жоғарғы шек шамамен 4818 кВт·сағ береді. Нақты тұтыну төмен әрі power limit-ке тәуелді, бірақ формула электр мен кондиционерді сметаға қосады.

Power limit төмендету аз жылдамдық жоғалтып, екі RTX 5090 тиімділігін арттыруы мүмкін. Оны өз моделіңізде өлшеңіз. Бұл жад, ұя, кабель және қолдау мәселесін шешпейді, сондықтан толық жауап емес.

Кәсіби карта болжамдылық береді

RTX PRO 6000 ECC бейнежадын, кәсіби драйвер тармағын және NVIDIA Blackwell Workstation Edition үшін көрсеткен MIG мүмкіндігін ұсынады. ECC кей жад қателерін түзетеді, бірақ модель жауабының мағынасын тексермейді және дұрыс жауапқа кепіл емес. MIG үйлесімді жүктемелердің ресурсын бөледі, алайда нақты стек қолдауын алдын ала растаңыз.

RTX 5090 қолдауы тұтынушылық санатқа жатады. Бұл картаны сенімсіз етпейді, бірақ ақауды талдау тәртібін өзгертеді. Дайын станция өндірушісі екі карталы конфигурацияны, кабельді немесе платаны қолдаудан шығаруы мүмкін. Бөлшек компоненттерде АТ бөлімі ақау драйверден, BIOS-тан, PCIe топологиясынан, қуат блогынан не картадан екенін өзі анықтайды.

Сатып алу сипаттамасына GPU атауын ғана жазбаймын. Драйвер арнасы, ОЖ, плата микробағдарламасы, PCIe режимі, қуат шегі, ұзақ жүктемедегі температура, жаңарту тәртібі және қалпына келу уақыты қажет. Қолданба қатесін кім қайталайтынын және бөлшекті кім ауыстыратынын сұраңыз. «Компонент кепілдігі» бұған жауап бермейді.

Бір карта ақау нүктелерін азайтып, диагностиканы оңайлатады. Жұпта ішінара жұмыс істеу мүмкіндігі бар, кей қолданбаны бір GPU-да уақытша іске қосуға болады. Бірақ 64 ГБ-қа есептелген 70B басқа кванттаусыз не offload-сыз бір RTX 5090-ға сыймайды. Апат жоспарын слайдқа жазбай, нақты іске қосыңыз.

Ресми сатып алу талаптары бар ұйым үшін станцияның шығу тегі, жинақтау құжаттары, сериялық есеп және бір қолдау терезесі маңызды. GSE Қазақстанда жұмыс станцияларын жобалап, өндіреді, ЖИ инфрақұрылымын біріктіреді және ұлттық сервис желісі арқылы тәулік бойы техникалық қолдау көрсетеді. Бұл тапсырыс беруші орнына GPU таңдамайды, бірақ жүктеме сынағы мен толық конфигурация жауапкершілігін бір сипаттамаға бекітеді.

Станцияның толық құнын есептеңіз

Бір жүйедегі 96 ГБ
GSE RTX PRO 6000 станциясын модель, қуат және салқындатуға сай жобалайды.
Станция таңдау

Бір не екі GPU бағасы жұмыс орнының бағасына тең емес. Екі RTX 5090 үшін желілері дұрыс қымбат плата, PCIe желісі жеткілікті процессор, үлкен корпус, қуатты БП, қосымша салқындату және инженердің көбірек уақыты қажет болуы мүмкін. RTX PRO 6000 тұтынушылық картадан қымбат, бірақ 96 ГБ жадты екі ұяға сыйғызып, басқа ұяларды бос қалдырады.

Сметаны бес жолға бөліңіз:

  • барлық компоненті және жеткілікті жүйелік RAM бар дайын станция;
  • жеткізу, жинау, кабельдер және жүктемемен тексеру;
  • жоспарлы мерзімдегі энергия мен салқындату;
  • қолдау, қосалқы бөлшек және қалпына келу уақыты;
  • жаңарту мен модельді қайта баптауға кететін инженер еңбегі.

Басқа елдің ұсынылған бағасын салыстырмаңыз. Қазақстандағы бірдей процессор, RAM, жинақтауыш және қолдау шарты бар екі толық станцияға коммерциялық ұсыныс алыңыз. Біреуі бір айда, екіншісі алты айда келсе, күту де жоба құнына кіреді.

Модель жүктеу, салмақ түрлендіру және CPU offload үшін жүйелік жад жеткілікті болсын. 128 ГБ RAM бар 70B станциясы түрлендіруде не бірнеше сервиспен тар болуы мүмкін, 256 ГБ файлдар мен кэшке жайлырақ бастапқы нүкте береді. Бұл әр қозғалтқыштың міндетті талабы емес, жобалау кеңесі. Жылдам NVMe VRAM-ды алмастырмайды, бірақ жүктеуді қысқартып, бірнеше модель нұсқасын сақтайды.

GSE екі архитектураны да GPU-ды корпустан бөлек сатпай, қуат, салқындату және бағдарламалық стек кіретін тұтас жұмыс станциясы ретінде жинап, сынай алады. Қабылдау бөлшектер тізімін емес, нәтижені тексеруі үшін техникалық тапсырмаға модель файлы мен сынақ сценарийін енгізіңіз.

Шешімді пайдалану режимі анықтайды

70B тұрақты ішкі сервис болса, 8 биттік нұсқа не KV-кэшке үлкен қор керек болса, ECC, кәсіби қолдау және оңай пайдалану маңызды болса, бір RTX PRO 6000 алыңыз. Кәсіпорын үшін әдепкі таңдауым осы. Бір құрылғыдағы 96 ГБ және тұрақсыз жүйе құру жолдарының аз болғаны үшін төлейсіз.

Сатып алу бюджеті қатаң, сапалы 4 биттік кванттау қолайлы, команда қозғалтқышты басқарады, плата PCIe топологиясын дұрыс береді, ал жүктеме жақсы масштабталады не тәуелсіз тапсырмаларға бөлінеді десеңіз, екі RTX 5090 қарастырыңыз. Жұп бірыңғай қолдаудан гөрі тәжірибе жылдамдығын бағалайтын зерттеушіге де қызық.

Тапсырысқа дейін мақсатты модельде қабылдау сынағын өткізіңіз. Суық жүктеу, ұзын контекст, жоспарлы қатар сұрау, бір сағат тұрақты генерация, температура мен қуатты жазу, қатеден кейін қайта іске қосу және драйвер жаңарған соң қайталау кірсін. Нұсқалар мен пәрмендерді сақтаңыз. Сонда салыстыру сипаттама кестесі туралы даумен емес, станция қайталауға міндетті хаттамамен аяқталады.

Екі конфигурация да қауіпсіз қормен сынақтан өтпесе, қабаттарды қолмен бөліп бірнеше гигабайт ұтуға тырыспаңыз. Шағын модель алыңыз, контексті қысқартыңыз немесе жүктемені жады көп әрі лайықты байланысы бар серверлік платформаға көшіріңіз. Жұмыс станциясы шектеулері тапсырмаға сәйкес келгенде ғана дұрыс таңдау болады.

FAQ

70B моделі бір RTX 5090-ға сыя ма?

Модель мен жұмыс дерегінің бәрі 32 ГБ VRAM ішінде қалуы тиіс болса, әдетте сыймайды. Қатты квантталған нұсқа жүйелік жадқа ішінара шығарылып іске қосылуы мүмкін, бірақ жылдамдық пен контекст қысқарады.

Екі RTX 5090 жады 64 ГБ болып қосыла ма?

Физикалық жад 64 ГБ, бірақ ол екі бөлек 32 ГБ пул болып қалады. Қозғалтқыш салмақты, кэшті және есептеуді бөлуі керек, бір картадағы бос орын екіншісіне әрдайым қолжетімді емес.

FP16 форматындағы 70B үшін 96 ГБ жете ме?

Жоқ, FP16 немесе BF16 салмақтарының өзі шамамен 140 ГБ алады. 96 ГБ үшін 8 және 4 биттік нұсқалар қолайлы, нақты қор форматқа, контекске және қозғалтқышқа тәуелді.

70B үшін RTX PRO 6000 әлде екі RTX 5090 жылдам ба?

Жақсы тензорлық параллелизм және лайықты PCIe топологиясында екі RTX 5090 жылдам болуы мүмкін. Бір RTX PRO 6000 тұрақтырақ кідіріс беріп, GPU арасындағы алмасуды жояды, сондықтан жауапты өз моделіңіздегі сынақ береді.

Екі RTX 5090 үшін NVLink керек пе?

RTX 5090 NVLink қолдамайды, сондықтан мұндай таңдау жоқ. Қозғалтқыш PCIe арқылы жұмыс істей алады, бірақ өткізу қабілеті, P2P қатынасы және ұя орналасуы масштабталуға қатты әсер етеді.

Бұл станцияда 70B моделін оқытуға бола ма?

Толық оқыту немесе барлық салмақты баптау екі конфигурацияға да сыймайды. QLoRA секілді әдістер тізбек ұзындығы, пакет және модель бөлінуі дұрыс таңдалса жұмыс істей алады.

Жергілікті LLM үшін ECC қаншалықты маңызды?

ECC ұзақ кәсіби жүктемеде кей бейнежад қателерін түзетіп, мәселе туралы хабарлайды. Ол модель жауабының мағынасын тексермейді және бақылау сынағын алмастырмайды.

Екі RTX 5090 үшін қандай қуат блогы керек?

Номинал процессорға, платаға, қуат шегіне және кабельге тәуелді, сондықтан бір қауіпсіз сан жоқ. Тек GPU үшін 1150 Вт максимумнан бастап, қор және станция өндірушісінің бекітуімен жобалаңыз.

70B станциясына қанша жедел жад керек?

Дайын инференске 128 ГБ кейде жетеді, бірақ салмақ түрлендіру, CPU offload және қосымша сервистер қорды тез азайтады. Жаңа станция үшін 256 ГБ жайлырақ бастапқы нүкте деп санаймын.

Сатып алуға дейін екі GPU-ды қалай тексеруге болады?

Мақсатты модельді іске қосуды сұрап, `nvidia-smi topo -m`, P2P сынағын, VRAM, жылдамдық, температура және қуатты сақтаңыз. Қысқа көрсетілім емес, ұзын контекст пен нақты қатар сұрауларды сынаңыз.