Бейне картаны бөлісу әрдайым тиімді емес
Бейне картаны бөлісу жад жеткілікті әрі кідіріс қолайлы болса, жабдықтың бос тұруын азайтады. MIG, vGPU, MPS, өлшеу мен үнемді талдаймыз.

Бір бейне картаны жеке тапсырмалар үдеткішті бос қалдыратын, ал олардың жиынтық шекті жүктемесі жад көлемі мен рұқсат етілген кідіріске сыятын жағдайда бөліскен дұрыс. Картаның бағасы өздігінен ештеңені дәлелдемейді: үнем тек бір мезгілдегі жүктемені, лицензияларды және пайдалану еңбегін өлшегеннен кейін пайда болады.
Ортақ қолжетімділікті қосқан соң орташа жүктеменің өскеніне қуанып, бір аптадан кейін p99 секіргені, жад жетіспеу қателері және қай контейнер көршілерінің түнгі жұмысын бұзғанын анықтай алмағаны үшін оны өшірген жобаларды көп көрдім. Дұрыс бөлу сызбасы шекараларды алдын ала белгілейді. Нашар сызба бір құрылғыда көбірек процесті іске қосуға ғана мүмкіндік береді.
Алдымен пайдаланылмай тұрған қорды табыңыз
Бейне карта кесте бойынша емес, тапсырманың жұмыс циклі ішінде бос тұрса, бөлу орынды. Инференс сервері сұрауларды күтуі мүмкін, интерактивті ноутбук көбіне жадты иеленіп, есептеу блоктарын аз пайдаланады, ал бейне өңдеу тапсырмасы декодтау, есептеу және нәтижені жазу кезеңдерін кезектестіреді. Мұндай профильдер бірін-бірі толықтырады. Есептеу блоктары мен жадты онсыз да толық ұстайтын екі үлкен модельді оқыту тапсырмасы әдетте бір-біріне тек кедергі жасайды.
GPU Utilization орташа мәні бос қордың бәрін көрсетпейді. Ол бейне жад жеткілікті ме, тапсырма жад өткізу қабілетіне тіреле ме, кодтау блогы бос па және сұрау кезегі қаншалықты ұзын деген сұрақтарға жауап бермейді. Сервис жұмыс істейтін аралыққа сай уақыттық қатарды қараңыз: API үшін секундтар мен шеткі кідіріс маңызды, ал пакеттік өңдеуде минуттар және бүкіл топтаманың аяқталу уақыты маңыздырақ болуы мүмкін.
Жобалауды бастамас бұрын әр тапсырма үшін төрт шаманы жазыңыз: қыздырудан кейінгі ең көп бейне жад көлемі, есептеу блоктарының жүктемесі, кідіріске сезімталдық және рұқсат етілетін қайта іске қосу тәртібі. Жұмыстың тәулік сағаттары бойынша келу графигін қосыңыз. Екі тапсырма бір мезгілде шегіне жетсе, орташа мәндерін емес, шекті мәндерін қосыңыз. Шектер әр уақытта болып, кезек күте алса, ортақ үдеткіш қисынды нұсқаға айналады.
Қарапайым тексеру өлшемі бар. Ортақ режим есептік кезеңде бір картадан көбірек пайдалы жұмыс алуы және жауап беру уақытының мақсаты мен топтама мерзімін бұзбауы керек. Егер p99 пайдаланушылармен келісілген шектен асып кетсе немесе түнгі тапсырма таңға дейін бітпесе, жүктеменің 30 пайыздан 85 пайызға өсуі жетістік емес.
Бір күнді емес, толық жұмыс циклін тексеріңіз. Апталық профиль күндізгі шекпен аптасына бір рет қана қабаттасатын сақтық көшірме, қайта оқыту, индекс құру немесе есеп дайындау жұмысын жиі көрсетеді. Кезекке қоюға немесе басымдықты төмендетуге болмайтын болса, мұндай сирек қабаттасудың өзі қажет қорды анықтайды. Фондық жұмысты ілгерілеуін жоғалтпай тоқтатып, жалғастыруға болса, оны жоспарлаушының нақты ережесі ретінде жазыңыз. Инженерлер қақтығысты қолмен байқайды деген үміт ресурсты басқаруға жатпайды.
Бөлу тетіктері әртүрлі міндетті шешеді
CUDA ағындары, MPS, уақыт бойынша бөлу, vGPU және MIG бір функцияның әртүрлі баптауы емес. Олар жад, жоспарлау, ақау және басқару үшін бөлек шекаралар береді.
Ең қарапайым нұсқа бір қолданбаның ішінде жұмыс істейді: процесс бірнеше CUDA streams арқылы операцияларды бастайды, ал фреймворк сұрауларды пакеттерге біріктіреді. Кодтың бір иесі бар кезде бұл көбіне ең дұрыс жол. Қолданба ортақ жадты көреді және параллельділікті өзі басқарады, сондықтан виртуалды машиналар мен бөлек қонақ драйверлеріне шығынданбайды. Бірақ CUDA ағыны бір ағынның қатесін, жадын немесе өткізу қабілетін екіншісінен оқшауламайды.
NVIDIA Multi-Process Service, яғни MPS, бірнеше CUDA процесіне MPS сервері арқылы жұмысты бірге жіберуге мүмкіндік береді. NVIDIA нұсқаулығында екі практикалық пайда айтылған: әртүрлі процестердің ядролары мен көшіру операциялары қабаттаса алады, ал жоспарлау ресурстарының ортақ жиыны контекст ауыстыруды азайтады. Бұл бір бөлімге тиесілі сенімді пакеттік тапсырмаларға, MPI процестеріне және шағын сервистерге пайдалы. MPS Linux пен QNX жүйелерінде жұмыс істейді, ал бақылау құралдары тұтынуды көбіне MPS серверіне тіркейді, сондықтан әр клиенттің үлесін талдау қиындайды. Бұл жалға алушылар арасындағы қауіпсіздік шекарасы емес, бірге жұмыс істеу құралы.
Time slicing процестерге, контейнерлерге немесе виртуалды GPU құрылғыларына кезекпен қолжетімділік береді. NVIDIA vGPU уақыт кванттарын жоспарлайды: бір виртуалды машина орындалып жатқанда, басқалары күтеді. Қысқа квант жауап беру жылдамдығын жақсартады, бірақ ауысуларды жиілетеді; ұзын квант өткізу қабілетіне көмектеседі, алайда күтуді ұзартады. Kubernetes ішінде NVIDIA device plugin параметріндегі replicas бір картаның үстінен бірнеше логикалық ресурс жариялайды. GPU Operator құжаттамасы мұндай репликаларда жад пен ақау оқшаулауы жоқ екенін, ал екі реплика сұрау есептеу қуатының екі есе үлесіне кепілдік бермейтінін ашық ескертеді.
MIG қолдау бар картаны кеңістік бойынша бөледі. Экземпляр жеке есептеу ресурстарын және L2-кэш, жад контроллерлері мен DRAM мекенжай шиналары арқылы оқшауланған жолдарды алады. Әртүрлі экземплярлар болжамдырақ кідіріспен қатар жұмыс істей алады. MIG-backed vGPU осындай экземплярды виртуалды машинаға береді; жабдық пен гипервизордың кейбір жаңа үйлесімдері экземплярдың ішінде уақыт бойынша бөлуді де қолдайды. Мұндай қосымша тығыздық әрдайым пайдалы емес: бір тілімнің ішінде көршілер мен кезек қайта пайда болады.
Талқылауда тағы бір айырма жиі жоғалады: квота, оқшаулау және өнімділік кепілдігі бір ұғым емес. Бекітілген framebuffer көлемі виртуалды машинаның жадын шектейді, бірақ барлық қозғалтқыштың тұрақты үлесін міндетті түрде бекітпейді. Логикалық реплика жоспарлаушыға қолжетімділік беруге көмектеседі, алайда контейнер ішіндегі процесті өздігінен шектемейді. Аппараттық тілім ресурс шекарасын күшейтеді, дегенмен физикалық карта, хост және бағдарламалық стектің бір бөлігі ортақ қалады. Жоба құжатында жалпы «бөлісу» сөзінің орнына тапсырмаға қажет нақты қасиетті атаңыз.
Шығын тек контекст ауыстырудан тумайды
Тетіктің өзінің үстеме шығыны ортақ ресурс үшін бәсекенің зиянынан жиі аз болады. Бір тапсырма анда-санда қысқа ядроларды іске қосып, екіншісі құрылғыны толық толтырмаса, екеуі картаны шығынсыз дерлік бөлісе алады. Сол тапсырмалар бір мезгілде жадтан үлкен тензорларды оқи немесе PCIe арқылы дерек көшіре бастағанда қақтығысады.
Бәсекенің төрт түрін тексеріңіз. Есептеу блоктары қанша ядроның шынымен қатар орындалатынын анықтайды. Бейне жадтың өткізу қабілеті есептеуі салыстырмалы аз, бірақ деректі көп оқитын модельдер мен талдау операцияларын шектейді. PCIe мен NUMA дерек жеткізуге әсер етеді, әсіресе CPU процестері мен карта әртүрлі сокетте тұрса. Декодтау мен кодтаудың бөлек қозғалтқыштары GPU Utilization көрсеткіші төмен көрінген кезде де медиаконвейердің тар жеріне айналуы мүмкін.
Уақыт бойынша бөлу кезек қосады. Бір тапсырма құрылғыны ұзақ орындалатын ядромен ұстап тұрса, көршісінің қысқа сұрауы келесі квантты немесе ығыстыру нүктесін күтуі мүмкін. Сондықтан орташа кідіріс ең нашар әсерді жасырады. Онлайн сервис үшін p50, p95 және p99 мәндерін, сондай-ақ тайм-ауттан асқан сұраулар санын салыстырыңыз. Пакеттік тапсырма үшін толық орындалу уақытын және іске қосулар арасындағы айырманы өлшеңіз.
MIG экземплярлар арасындағы өзара әсерді азайтады, бірақ шағын тілімді барлық бағдарламада тұтас картаның тура сондай үлесіне айналдырмайды. Профиль есептеу ресурстары мен жадтың белгіленген бөлшектерін береді, ал қолданба мұндай геометрияда нашар масштабталуы мүмкін. Ядроны компиляциялау, пакет өлшемі, кітапханалардың жұмыс аймағы және CPU-мен алмасу қолданбаның қасиеті болып қала береді. Тұтас құрылғыдағы нәтиже арифметикалық жолмен бөлініп, болжам ретінде ұсынылмауы керек.
Әр тапсырманың жеке айыбын ғана емес, жиынтық пайдалы өткізу қабілетін есептеңіз. Екі сервис бөлек карталарда секундына 100 және 40 сұрау орындайды делік. Бір картада бірге істегенде қолайлы кідіріспен 92 және 36 сұрау орындайды, жиыны 140 орнына 128 болады. Жиынтық жұмыстың шамамен тоғыз пайызын жоғалтып, бір картаны босаттыңыз. Бұл тиімді болуы мүмкін. Егер бірінші сервис 100 деңгейінде қалып, екіншісі жад жетіспеуі немесе кезек себебінен 10-ға түссе, жабдықтың жоғары жүктемесі нашар шешімді жасырады.
Бейне жад қатаң шекара қояды
Тапсырмалар дерексіз «GPU пайыздарын» емес, нақты жад көлемін бөліседі, ал бұл жерде орташа мәндер өте қауіпті. Модель салмақтарды, кэшті, уақытша буферлерді және кітапханалардың жұмыс кеңістігін иеленеді. Алғашқы сұраудан кейін қыздыру, алгоритм таңдау немесе KV-кэштің ұлғаюы салдарынан көлем өсуі мүмкін. Іске қосылғаннан кейін бірден алынған өлшем әрдайым дерлік тым оптимистік болады.
Time slicing кезінде процестер әдетте кепілді квотасы жоқ бір физикалық жадты көреді. Жоспарлаушы логикалық репликаларды тарата алады, бірақ 48 ГБ жадты 12 ГБ-тан төрт тәуелсіз пулға айналдырмайды. Бір контейнер бос орынды алып қойып, көршісі out of memory қатесін алуы мүмкін. Контейнердің CPU жағындағы жад шектеуі бұл мәселені шешпейді.
vGPU әдетте виртуалды машинаға framebuffer көлемі бекітілген профиль тағайындайды. MIG те экземплярға профильде белгіленген жад көлемін береді. Бұл көршінің жадын қорғайды, бірақ өлшемдерді алдын ала таңдауды талап етеді. Модельге қыздырудан кейін 22 ГБ қажет болса, тұтас картада жад жеткілікті болған күннің өзінде 20 ГБ-тан екі тілім көмектеспейді. Кейде бір үлкен және бір кіші профиль симметриялы бөлуден пайдалырақ.
Есептеу үшін ұзақ тұрақты іске қосудағы ең жоғары мәнді алып, пакет өсуіне, модельдің жаңа нұсқасына және қызметтік шығындарға қор қосыңыз. Қор көлемін әмбебап кестеден алу мүмкін емес. Оны тәжірибемен анықтаңыз: қалыпты шекті жүктемені іске қосып, одан кейін пакет немесе параллельдік көлемін жоспарланған шекке дейін көтеріңіз. Жад жетіспегенде не болатынын бөлек тексеріңіз. Бір тапсырманың басқарылатын қатесі жарамды болуы мүмкін; ортақ процестің бұзылуы, тұрып қалған GPU немесе подтардың жаппай қайта іске қосылуы тәуекел деңгейін өзгертеді.
Жадқа қатысты қолайсыз ымыра бар. Үлкен профильдер тығыздықты азайтады, ал шағын профильдер фрагментация туғызады: картада бос көлем қалады, бірақ рұқсат етілген профильдердің ешқайсысы жаңа тапсырмаға сай келмейді. MIG құрылымын қайта бөлу құрылғыдағы жұмысты тоқтатуды талап етуі мүмкін. Сондықтан профильдер каталогы картаны тең бөлу көрінісіне емес, нақты тапсырма сыныптарына сай болуы керек.
Қолдау картаға және бүкіл бағдарламалық стекке тәуелді
«GPU виртуалдандыруды қолдайды» деген жазу сатып алуға жеткіліксіз. Нақты модельді, пішім-факторды, драйвер нұсқасын, қонақ ОЖ-ны, гипервизорды, лицензия редакциясын және қажет профильді тексеру керек.
NVIDIA-ның қазіргі нұсқаулығында MIG тізімі Ampere архитектурасынан басталады, бірақ сол буынның әр картасы оған кірмейді. Онда кең қолданылатын A100 және A30 үдеткіштері, одан кейін H100, H200 және қолдау бар Blackwell серверлік модельдері көрсетілген. Экземпляр саны әртүрлі: нұсқаулық A100 және бірнеше үлкен үдеткіш үшін жетіге дейін, A30 үшін төртке дейін, ал кейбір Blackwell жұмыс станциясы модельдері үшін одан аз сан береді. Архитектура атауы драйвердің нақты шығарылымына арналған үйлесімділік кестесін алмастырмайды.
Екі CUDA процесін қатар іске қосатын тұтынушылық карта MIG картасына немесе корпоративтік vGPU-ға айналмайды. Ол қатар контекстерді қолдауы мүмкін, бірақ аппараттық тілімдері, қолдауы бар vGPU профильдері немесе қажет лицензиялық шарттары болмауы ықтимал. Осындай негізде кепілді көп пайдаланушылы сервис құру әрекеті көбіне қолдан жасалған диспетчермен және ұзын ерекшеліктер тізімімен аяқталады.
NVIDIA vGPU үшін қолдауы бар GPU, гипервизор, қонақ операциялық жүйе және профильдер матрицасы бар, ал бағдарламалық жасақтама лицензияланады. Шарттар виртуалды жұмыс станцияларына, есептеу профильдеріне және өрістету тәсіліне қарай өзгереді. Лицензия құнын, лицензия серверін және сүйемелдеуді екінші картаның бағасымен салыстырмай тұрып есепке қосыңыз.
AMD SR-IOV тетігі гипервизор виртуалды машиналарға тағайындайтын Virtual Functions жасайды, бірақ қолдау мұнда да серверлік үдеткіштерге, GPU Virtualization драйверіне және тексерілген ОЖ мен гипервизор үйлесімдеріне байланған. ROCm құжаттамасы қолдауы бар конфигурацияларды бөлек тізімдейді. Бір Instinct сериясы бойынша қорытындыны кез келген AMD картасына қолдануға болмайды.
Тапсырыс бермес бұрын жеткізушіден өз сипаттамаңызға арналған расталған матрицаны сұрап, оны жоба нұсқасымен бірге сақтаңыз. Кейін өндірушінің нұсқаулықтарымен салыстырыңыз. Профиль, нұсқа және режим көрсетілмеген «GPU sharing қолдайды» деген тұжырым пайдалану кепілдігін бермейді.
Драйвер, гипервизор немесе қонақ ОЖ айтарлықтай жаңарған сайын үйлесімділікті қайта тексеріңіз. Бұрын жұмыс істеген үйлесім жаңартудан кейін сол профильдерді, көшіру мүмкіндігін және бақылау тәртібін сақтауға міндетті емес. Шағын қабылдау жиынын жасаңыз: әр профильді іске қосу, бір мезгілде жүктеу, метрика жинау, қонақ жүйені қайта іске қосу және қатеден қалпына келу. Алдымен оны бір түйінде өткізіп, содан кейін жаңартуды бүкіл пулға ашыңыз. Осылайша матрицадағы жазба кестедегі уәде болып қалмай, жүйеңіздің тексерілген қасиетіне айналады.
Жүктеменің төрт түрі үнем береді
Бөлісуге ең жақсы үміткер жадты болжамды пайдаланады, есептеу ресурсының бір бөлігін бос қалдырады және уақыттың шағын ауытқуына төзеді. Өндірісте төрт сценарий жиі нәтиже береді.
Бірінші сценарий, сұрау ағыны біркелкі емес бірнеше шағын инференс моделі. Олар бір мезгілде шегіне сирек жетеді, ал сұрауларды пакетке біріктіру көршілерге бос аралық қалдырады. Бір иесі бар сенімді сервистер үшін процестер немесе MPS жеткілікті болуы мүмкін. Әртүрлі командалар мен кідіріске қойылатын қатаң талаптар үшін бөлек MIG профильдері немесе vGPU дұрысырақ.
Екінші сценарий, әзірлеу орталары, зерттеушілердің ноутбуктары және оқу сыныптары. Пайдаланушы контекст пен жадты нақты есептеу уақытынан әлдеқайда ұзақ ұстайды. Платформа ұмыт қалған сессияларды аяқтап, әркімге тұрақты өнімділік уәде етпесе, уақыт бойынша бөлу қолжетімділікті арттырады. Мұнда бір тапсырманың ең аз шығынынан гөрі әділдік пен кезек маңызды.
Үшінші сценарий, графика немесе инженерлік қолданбалары бар виртуалды жұмыс орындары. vGPU әр виртуалды машинаға framebuffer профилін беріп, қолжетімділікті гипервизор арқылы басқаруға мүмкіндік береді. Экономика лицензияларға, қажет кадр жиілігіне, дисплейлерге және қолданба сертификатына тәуелді. Кеңседе үш өлшемді модельді көру мен ауыр интерактивті рендер бір пайдаланушы сыныбы емес.
Төртінші сценарий, бірін-бірі толықтыратын конвейерлер. Бейнені декодтау, алдын ала өңдеу, инференс және кейінгі өңдеу жүйенің әр бөлігін әр уақытта жүктейді. Егер тек есептеу блоктарын емес, декодтау қозғалтқыштарын, жадты, PCIe мен CPU-ды өлшесеңіз, бірге орналастыру бос тұруды қысқартады.
Ұйымдық үнем де болуы мүмкін: бір стандартталған платформаға қосалқы бөлшек сақтау және қолдау әртүрлі жұмыс станцияларының жиынынан оңай. Бірақ ортақ түйіннің ақау ауқымы кең. Оның тоқтауы бірнеше қызметті бұғаттаса, резервтік ресурс пен көшіру рәсімі міндетті, ал олардың құны бөлу жобасына кіреді.
Кейбір жүктемеге тұтас карта берген дұрыс
Бір тапсырма есептеу ресурсын немесе жадты тұрақты түрде толық жүктеп, оның аяқталу мерзімінің бағасы болса, үдеткішті бөлмеңіз. Үлкен модельді оқыту, дерек алмасуы тығыз ғылыми есеп және үлкен пакеттік рендер көршіден көбіне уақыт ауытқуынан басқа ештеңе алмайды. Жоспарлаушы қосымша қор жасамайды.
Қатаң p99 талабы бар тапсырмалар да time slicing үшін нашар көрші. Шағын фондық жұмыс сәтсіз уақытта келуі мүмкін. MIG ресурстарды бекітуге көмектеседі, бірақ шағын профиль сервистің шекті жүктемесін өзі көтеруі тиіс. Оған картаның барлығы дерлік қажет болса, бөлісетін мағыналы қор қалмайды.
Бір-біріне сенбейтін жалға алушыларға MPS немесе уақыт бойынша қолжетімділігі бар қарапайым контейнерлерден мықтырақ шекара керек. NVIDIA GPU Operator құжаттамасы time slicing режимін MIG беретін жад пен ақаудың аппараттық оқшаулауына тікелей қарсы қояды. Әртүрлі заңды тұлғалар, сезімтал деректер немесе міндеттерді қатаң бөлу үшін қолдауы бар виртуалдандыру мен аппараттық шекараны пайдаланып, қауіп моделін бөлек тексеріңіз. «Контейнер» сөзі GPU оқшаулауын дәлелдемейді.
Өндірістік сервисті күтпеген ядроны компиляциялауы, бүкіл жадты алуы немесе құрылғыны қайта орнатуға әкелуі мүмкін тәжірибемен араластырмаңыз. Бөлек MIG экземпляры өзара әсерді азайтады, бірақ сервердің ортақ бөлшектерін, электр қорегін, драйверді және қызмет көрсету терезесін жоймайды. Маңызды қызметтер тұтас физикалық карта істен шыққанда жұмысын жалғастыра алуы керек.
«Орташа жүктеме төмен болғандықтан сегіз реплика қосу» туралы кең тараған кеңес қате. Kubernetes жүйесіндегі реплика саны жоспарлаушыға қанша тұтынушыны кіргізуге болатынын хабарлайды, бірақ әрқайсысына есептеу қуатының немесе жадтың сегізден бірін бекітпейді. Қалаған тығыздықтан емес, жүктеме сынағы бір мезгілде қауіпсіз деп растаған профильдер санынан бастаңыз.
Пилот бәсекені қайталауы керек
Екі тыныш демонстрациялық тапсырмамен тексеру ештеңені дәлелдемейді. Пилот жұмыс шегін, фондық топтаманы, жад өсуін және бір қатысушының ақауын бір мезгілде қайталауы тиіс.
Алдымен әр тапсырма үшін тұтас картадағы бастапқы деңгейді өлшеңіз. Өткізу қабілетін, p95 пен p99 мәндерін, топтаманың толық уақытын, ең көп бейне жадты, энергия тұтынуын және қателерді тіркеңіз. Содан кейін модель нұсқалары мен кіріс дерек өлшемін өзгертпей, сол жиынды бірге қайталаңыз. Әйтпесе әртүрлі тәжірибелерді салыстырасыз.
NVIDIA жүйесінде жедел диагностика үшін нақты nvidia-smi dmon ағыны пайдалы. Утилита нұсқаулығында u тобы SM, жад, encoder, decoder, JPEG және OFA жүктемесін, ал m тобы framebuffer мен BAR1 мәндерін көрсететіні жазылған:
nvidia-smi dmon -i 0 -s pucvm -d 1
Әр аралыққа GPU идентификаторы және қуат, температура, жүктеме, жиілік пен жад бағандары бар бір жол шығуы керек. Бұл ядро трассалаушысы емес және кінәні мінсіз бөлмейді, бірақ қай оқиғалардың бір уақытта болғанын тез көрсетеді. Тұрақты бақылау үшін DCGM Exporter, соның ішінде DCGM_FI_DEV_GPU_UTIL, DCGM_FI_DEV_FB_USED, DCGM_FI_PROF_DRAM_ACTIVE, PCIe санауыштары мен XID қателерін жариялайды. DCGM нұсқаулығы өрістердің қолжетімділігі GPU, драйвер және MIG режиміне тәуелді екенін ескертеді.
Kubernetes ішінде time slicing режимін тексерсеңіз, ортақ ресурс атауынан көрінетін болсын. Бұл үзінді NVIDIA device plugin пішіміне негізделген және жад оқшаулауын жасамайды:
version: v1
sharing:
timeSlicing:
renameByDefault: true
failRequestsGreaterThanOne: true
resources:
- name: nvidia.com/gpu
replicas: 2
renameByDefault ортақ ресурсты ажыратуға көмектеседі, ал failRequestsGreaterThanOne бірнеше реплика сұрау қуатты пропорционалды арттырады деген қате күтуді бұғаттайды. Қолданғаннан кейін түйіннің labels, Capacity және Allocatable мәндерін тексеріп, содан соң қақтығысатын профильдерді іске қосыңыз.
Ақау сынағы міндетті. Бір қатысушыны басқарылатын жад қатесіне жеткізіп, оның процесін аяқтаңыз, контейнерді қайта іске қосып, көршілерін тексеріңіз. Бақылау жүйесі нені көрсететінін және қалпына келуге қанша уақыт кететінін жазыңыз. Команда нашарлауды иесімен байланыстырып, құрылғыны тез босата алмаса, жоғары тығыздық түнгі қолмен талдауға айналады.
Шешімді пайдалану экономикасы қабылдайды
Бір картаның бағасын екі картаның бағасымен емес, жұмыс істейтін екі нұсқаның жылдық құнымен салыстырыңыз. Ортақ үдеткіш үшін карта мен серверді, қажет болса vGPU лицензияларын, интеграция жұмысын, бақылауды, ақауға арналған резервті, қайта бөлу терезелерін және кезекші команданың уақытын қосыңыз. Бөлек нұсқа үшін қосымша карталарды, слоттарды, электр қуатын, салқындатуды, желіні және әр картаның бос тұруын есепке алыңыз.
Есепке пилоттың үш нәтижесі керек: ортақ түйін қанша пайдалы жұмыс атқарады, мақсатты уақыттың қанша бұзылуын туғызады және қанша сағат қолдау талап етеді. Бұзылулар мен еңбекті ішкі мөлшерлемелеріңіз бойынша ақшаға айналдырыңыз. Белгісіздері адал көрсетілген дәл модель жабдық үнемі тиынына дейін есептеліп, инженер еңбегі тегін деп алынған кестеден пайдалырақ.
Қабылдау ережесін бекітіңіз. Мысалы, әр тапсырма тағайындалған жадқа қорымен сыйса, ортақ сынақ мақсатты p99 бен топтама мерзімін сақтаса, бір қатысушының ақауы бәрін қайта іске қосуды талап етпесе және лицензиялар мен резервтен кейін жылдық үнем оң болып қалса, бірге орналастыруға рұқсат беріледі. Мұндай ереже таңдаулы профильдер тізіміне қарағанда карта ауысуына жақсырақ төзеді.
Қорға жауапты адамды тағайындаңыз. Ол жаңа тапсырма сыныптарын бекітіп, бастапқы өлшем нәтижелерін сақтап, қақтығыс кезінде қай тапсырманы шектеу керегін шешуі тиіс. Мұндай рөл болмаса, әр команда өз жұмыс уақытын оңтайландырады да, ортақ түйін біртіндеп орындай алатын мөлшерден көп уәде алады. Әр профильге арналған қарапайым тізім пайдалы: иесі, модель мен нұсқа, ең көп жад, басымдық, рұқсат етілген сағаттар, p99 мақсаты немесе топтама мерзімі, ығыстыру кезіндегі әрекет және кезекші маманның байланысы.
Модель немесе сұрау ағыны өзгергенде шешімді қайта қараңыз. Сәтті конфигурация сервердің тұрақты қасиетіне айналмайды, себебі ұзағырақ контекст, жаңа кіріс өлшемі немесе басқа алгоритм бұрынғы қорды жоюы мүмкін. Тұрақты жүйе үшін нақты шек пен қабылданған лимитті салыстыратын айлық есеп әдетте жеткілікті. Жылдам өсетін сервиске жад толмай немесе шеткі кідіріс мақсаттан шықпай тұрып автоматты ескерту керек. Тығыздықты сақтау үшін апта сайын пакеттерді азайтып, жұмыс терезелерін ауыстыру қажет болса, пайдалану шығыны үнемді әлдеқашан жойған.
Қызмет көрсету кезіндегі тоқтау құнын ұмытпаңыз. Жеке картадағы жаңарту бір тапсырмаға әсер етеді, ал ортақ картадағы жаңарту бірнеше иеден бір мезгілде жұмыс терезесін сұрайды. Драйверді орнатудың өзі аз уақыт алса да, келісу, қайта іске қосқаннан кейін тексеру және ықтимал кері қайтару уақыт талап етеді. Жоспарланған жаңартулар саны мен ортақ терезе құнын модельге қосыңыз. Қызметтер әртүрлі күнтізбемен жұмыс істесе немесе бөлек бөлімдерге тиесілі болса, үйлестіру бос тұрған екінші картадан қымбат болуы мүмкін. Бұл шығын жабдық сипаттамасында сирек көрінеді, бірақ өзгерістер журналында үнемі пайда болады.
AI және дата-орталық инфрақұрылымын жобалағанда GSE серверлік платформаны, NVIDIA немесе AMD үдеткіштерін және қолдау сызбасын өлшенген жүктеме профильдеріне сай таңдай алады. Режимді таңдау бәрібір тапсырыс берушінің пилотына сүйенуі керек, себебі аппараттық үйлесімділік үнемді дәлелдемейді.
Өлшемдер анық пайда көрсетпесе, тұтас картаны бір тапсырмаға қалдырыңыз. Қоры көрінетін қарапайым сызба инженерлер үнемі түсіндіріп, қайта баптап және құтқарып отыратын тығыз конфигурациядан жиі арзанырақ.
FAQ
Кез келген бейне картаны бірнеше тапсырмаға бөлуге бола ма?
Көптеген GPU құрылғыларында бірнеше процесс жұмыс істей алады, бірақ аппараттық бөлу мен vGPU белгілі модельдер мен бағдарламалық стектерде ғана қолдау табады. Нақты картаны, драйверді, ОЖ-ны, гипервизорды, профиль мен лицензияны өндіруші матрицасымен тексеріңіз.
MIG пен time slicing айырмасы қандай?
MIG экземплярға аппараттық ресурстар мен профиль белгілеген жадты бөледі, сондықтан бөлек экземплярлар мықтырақ оқшаулаумен қатар жұмыс істейді. Time slicing тұтынушыларды ортақ құрылғыға кезекпен кіргізеді және әдетте олардың жады мен ақауын оқшауламайды.
GPU бөлгенде өнімділік қанша төмендейді?
Әмбебап пайыз жоқ, себебі нәтиже есептеу блоктары, жад, PCIe және арнайы қозғалтқыштар үшін бәсекеге тәуелді. Бір мезгілдегі жұмыс шегінде жиынтық өткізу қабілеті мен p95/p99 мәндерін өлшеңіз.
Kubernetes әр подты бейне жадтың жетіспеуінен қорғай ма?
Кәдімгі `nvidia.com/gpu` лимиті немесе time-sliced replica подқа бейне жад квотасын бермейді. Бекітілген көлем үшін қолдауы бар MIG немесе vGPU профилі, не қолданба мен платформа ішіндегі бақылау керек.
MPS қай кезде MIG-тен жақсы?
Қысқа ядроларды қабаттастырып, контекст ауыстыруды азайту керек болғанда, MPS бір иесі бар сенімді CUDA процестеріне сай келеді. Жад, ақау немесе жалға алушы шекарасы қажет болса, MIG не қолдауы бар vGPU таңдаңыз.
Оқыту мен инференсті бір уақытта іске қосуға бола ма?
Оқыту шектеліп, инференс шекті жүктемеде шеткі кідіріс мақсатын сақтаса, болады. Шектеусіз оқыту әдетте картаны толық жүктеп, болжамсыз кезек жасайды, сондықтан маңызды инференсті оқшаулаған дұрыс.
MIG профилінің өлшемін қалай таңдау керек?
Қыздырудан кейінгі ең көп жадты, жұмыс шегіндегі есептеуді және жүктемені көтеретін ең шағын профильдегі кідірісті өлшеңіз. Тәжірибемен расталған қор қосып, нақты карта үшін рұқсат етілген профиль үйлесімдерін тексеріңіз.
GPU ортақ пайдалану үшін лицензия керек пе?
Қарапайым CUDA процестері немесе bare metal жүйесіндегі MIG шарттары коммерциялық NVIDIA vGPU шарттарынан өзгеше. GPU виртуалды машиналарға vGPU арқылы берілсе, лицензияның қажет редакциясы мен қолдауын есепке қосыңыз.
Бейне картаны бөлмес бұрын қандай метрикаларды жинау керек?
Есептеу мен жад жүктемесін, пайдаланылған framebuffer көлемін, PCIe трафигін, encoder/decoder жұмысын, сервистің p95/p99 мәндерін, топтама уақытын және GPU қателерін жинаңыз. Бір орташа пайыз емес, бір мезгілдегі шектің уақыттық қатары керек.
Екінші бейне картаны қашан алған тиімді?
Бір тапсырма құрылғыны толық жүктесе, қатаң p99 қажет болса, жалға алушылар бір-біріне сенбесе немесе ортақ ақау тым қымбатқа түссе, екінші карта тиімдірек. Лицензия, энергия, резерв және қолдау еңбегін қосып, жылдық құнды салыстырыңыз.