8 мин

Сервер жады қателерін BMC журналдары арқылы диагностикалау

BMC, ECC және жүйелік журналдар арқылы сервер жады қателерін диагностикалау: ақаулы DIMM-ді тауып, қуат пен микробағдарлама ақауын ажырату.

Сервер жады қателерін BMC журналдары арқылы диагностикалау

Аптасына шамамен бір рет қайта жүктелетін серверді ескертуде бірінші аталған DIMM-ді ауыстырып жөндеуге болмайды. Алдымен оқиғалар тізбегін дәлелдеу керек: аппараттық оқиға қайта жүктелуден бұрын болды, жад контроллері оны арнаға немесе слотқа байланыстырды, ал қате бақыланатын тексеру кезінде қайта шықты. Осы тізбектің бір буынын өткізіп алсаңыз, бірнеше апта бойы жарамды жадты орыннан орынға ауыстырып, қуаттың қысқа төмендеуін, қызып кетуді немесе микробағдарлама қатесін байқамай қалуыңыз мүмкін.

Мен әуелі BMC журналын қараймын, содан кейін оны операциялық жүйе журналымен салыстырамын, тек осыдан соң ғана серверді тоқтататын уақытты жоспарлаймын. Мұндай тәртіп бастапқы деректерді сақтайды, ECC түзетуін өлімге әкелетін қатеден ажыратады және жұмыс істеп тұрған серверді кездейсоқ тәжірибелерге арналған стендке айналдырмайды. Аралықтың өзі диагноз бермейді: апталық қайталану көбіне ақаулы модульдің ішкі таймерін емес, сақтық көшірме жасау, сканерлеу, пакеттік өңдеу немесе қызмет көрсету кестесін көрсетеді.

Апталық қайта жүктелу әлі DIMM-ге нұсқамайды

Қайта жүктелу тек оның алдында уақыты сәйкес келетін жад туралы аппараттық жазба немесе сенімді машиналық есеп болғанда ғана жадпен байланысты. «Сервер жұмысы күтпеген жерден аяқталды» деген жазба салдарды хабарлайды. Ол себепті атамайды. Бірнеше ай бойы жиналған жалғыз Correctable ECC есептегіші де нақты бір қайта жүктелуді түсіндірмейді.

Алдымен төрт уақытты тіркеңіз: операциялық жүйенің соңғы қалыпты хабары, жүктелгеннен кейінгі алғашқы хабар, қуат жоғалар алдындағы BMC оқиғасы және тұрақты жүктеменің басталуы. Олардың бәрін бір сағат белдеуіне келтіріңіз. BMC сағаты жиі кейін қалады, кезекші қуат ажыратылғаннан кейін бастапқы күйге түседі немесе операциялық жүйе жергілікті уақытты көрсетіп тұрғанда UTC қолданады. Бірнеше минуттық айырма себеп пен салдардың орнын оңай ауыстырады.

Жұмыс кестесі қарапайым болғаны дұрыс: уақыт, дереккөз, ауырлық дәрежесі, құрамдас бөлік, физикалық локатор, есептегіш және жүйенің әрекеті. Оқиғаға жақын жолдардан тек «memory» сөзін емес, оқиғалар ретін іздеңіз. Мысалы, бір арнада CE санының өсуі, одан кейін UE, Machine Check және қуат қосылғаны туралы жаңа жазба басқа сокеттегі DIMM жөніндегі ескі ескертуден әлдеқайда нанымды.

Жоспарлы қайта іске қосудың қалыпты себептерін де тексеріңіз. Операциялық жүйе жоспарлаушысы, виртуалдандыру оркестраторы, жаңарту агенті, қолданба watchdog-ы және BMC арқылы кірген әкімші әртүрлі із қалдырады. Қайта жүктеу пәрмені, watchdog timeout, кіріс қуатының жоғалуы және аппараттық reset бірдей емес. Егер BMC «power cycle requested by user» деп жазса, жад диагностикасы корпус ашылмай тұрып аяқталады.

Апталық ырғақ ақауды қоздыратын жүктемені табуға көмектеседі. Оқиғаны толық сақтық көшірмемен, антивирустық тексерумен, есеп құрумен, массивті тексерумен және кэшті тазалаумен салыстырыңыз. Мұндай жүктеме температураны көтеруі, бұрын қолданылмаған жад беттерін толтыруы немесе екі қуат көзін қатар жүктеуі мүмкін. Ол ақау пайда болатын жағдайды қайталайды, бірақ бұзылған бөлшекті әлі атамайды.

Операциялық жүйенің қайта жүктелуін қуаттың толық жоғалуынан ажыратыңыз. Қалыпты restart кезінде BMC жұмысын жалғастырады, оның басқару сессиясының жұмыс уақыты нөлденбейді, ал қуат оқиғаларының тізбегінде қалыпты өшіру мен қосу болады. Қатаң reset немесе кернеу төмендегенде үзіліс, күтпеген іске қосылу не BMC-мен байланыстың жоғалуы көрінуі мүмкін. Бұл айырмашылық күдікті бөлшектер тізімін бірден қысқартады.

Операциялық жүйе бастапқы жазбаны жасырып қалмағанын тексеріңіз. Linux бірдей хабарлардың жиілігін шектей алады, ал Windows кейде сақталған WHEA жазбасын келесі жүктелуден кейін ғана жариялайды. Ондайда жарияланған уақыт аппараттық оқиға уақытына тең болмайды. Бір терезедегі көрсету уақытына ғана сұрыптамай, жүктеу идентификаторын, жазбаның ішіндегі сақталған timestamp-ты және BMC оқиғаларының ретін салыстырыңыз.

Тазарту не жаңарту алдында журналдарды сақтаңыз

Алғашқы көшірмені есептегіштерді нөлдеуден, BIOS жаңартудан және модульдерді ауыстырудан бұрын жасаңыз, әйтпесе оқиға мен бастапқы конфигурацияның байланысын жоясыз. BMC оқиғалар журналын, сенсор деректерін, жад тізімдемесін, BMC және BIOS нұсқаларын, сондай-ақ операциялық жүйенің жүйелік журналын сақтаңыз. Көшірмеге күнді, сервердің сериялық нөмірін және жинау себебін қосыңыз.

Жергілікті IPMI интерфейсі бар Linux жүйесінде негізгі пәрмендер жинағы мынадай болуы мүмкін:

mkdir -p incident-memory
ipmitool sel info > incident-memory/sel-info.txt
ipmitool sel elist > incident-memory/sel-extended.txt
ipmitool sdr elist > incident-memory/sensors.txt
ipmitool fru print > incident-memory/fru.txt
journalctl -k -b -1 > incident-memory/kernel-previous-boot.txt
journalctl -k -S "14 days ago" | grep -Ei "edac|ecc|mce|hardware error|memory" > incident-memory/kernel-memory.txt
dmidecode -t memory > incident-memory/dmi-memory.txt

BMC құпиясөзін пәрмен жолына жазбаңыз: ол командалық қабық тарихына түседі және кейде процестер тізімінен көрінеді. Қашықтағы IPMI үшін ұйымыңыздың ережесіне сай құпиясөз сұрауын немесе қорғалған тіркелгі деректері файлын қолданыңыз. Өндіруші сервистік пакетті экспорттайтын өз утилитасын берсе, оның толық архивін де сақтаңыз, бірақ оқуға болатын журналды сонымен алмастырмаңыз.

ipmitool sel elist әдетте жазба идентификаторын, күнді, уақытты, сенсор атауын, оқиға түрін және күйді қайтарады. Нақты мәтін BMC-ге байланысты. Керек пішін мынаған ұқсайды, бірақ сөзбе-сөз сәйкес болуы міндетті емес:

01a4 | 07/21/2026 | 02:14:08 | Memory #0x8a | Correctable ECC | Asserted
01a5 | 07/21/2026 | 02:14:11 | Memory #0x8a | Uncorrectable ECC | Asserted
01a6 | 07/21/2026 | 02:14:12 | System Event | Undetermined system hardware failure | Asserted

IPMItool BMC-ні CPU мен операциялық жүйеден тәуелсіз жұмыс істейтін, сенсорларды бақылайтын және оқиғаларды жазатын сервистік процессор деп сипаттайды. Сондықтан оның журналы ядро тоқтап қалса да жиі сақталады. Тәуелсіздік BMC-ні қатесіз етпейді: микробағдарлама слотты қате анықтауы, сағат ауытқуы, ал шағын SEL ескі жазбалардың үстінен жазуы мүмкін. Оны оқиғадан кейін бірден экспорттаңыз.

Redfish бар платформаларда LogEntry-мен бірге Memory және MemoryMetrics ресурстарын тексеріңіз. DMTF стандарты ағымдағы кезең мен бүкіл қызмет мерзімі үшін CorrectableECCErrorCount және UncorrectableECCErrorCount есептегіштерін бөледі, ал Memory ресурсы DeviceLocator бере алады. Бұл бөлу пайдалы: есептегіш өзгеріс қарқынын көрсетеді, локатор оны темірге байланыстырады. Хабарлар реестріндегі түсіндірмесіз OEM өрісін өз бетіңізше жорамалдамаңыз.

Windows жүйесінде Microsoft-Windows-WHEA-Logger провайдерінің оқиғаларын жүйелік журналдан іріктеп, экран суретін емес, жазбаның XML пішімін сақтаңыз. Microsoft құжаттамасы WHEA аппараттық жазбаларды CPER негізіндегі пішіммен жасайтынын және платформа жады қатесінің бөлек бөлімін қоса алатынын айтады. Оқуға ыңғайлы сипаттама пайдалы, бірақ жалпы оқиға мәтінінен гөрі жазба өрістері маңызды.

Операциялық жүйе гипервизор болса, деректерді тек қонақ машинадан емес, хосттан жинаңыз. Қонақ жүйе физикалық мекенжайды, арнаны немесе WHEA/EDAC оқиғасын алмай, виртуалды CPU ақауын не кенет өшуді ғана көруі мүмкін. Кластер журналы көшіру мен fencing уақытын көрсетеді, бірақ физикалық жадты BMC, микробағдарлама және хост ядросы локализациялайды.

SEL сыйымдылығы мен толу пайызын бірден тексеріңіз. Сақиналы журнал кейінгі restart-ты қалдырып, ертеректегі CE ескертуін өшіріп жіберуі мүмкін. Шулы сенсор журналды жылдам толтырса, журналды автоматты түрде экспорттап, шудың себебін бөлек түзетіңіз. Өндіруші оқиғаның диагностикаға қатысы жоқ екенін растамайынша, оқуды жеңілдету үшін сенсор жазбасын өшірмеңіз.

Хэш немесе бастапқы файлдардың кемінде өзгермейтін көшірмесі бірнеше тексеруден кейінгі шатасудан қорғайды. Каталог атауларында «new» және «final» емес, сервер мен уақыт көрсетілсін. Есепте қай есептегіш қашан нөлденгенін жазыңыз: жөндеуден кейінгі нөлдік CurrentPeriod дәлел болып көрінуі мүмкін, бірақ оны бес минут бұрын тазартқан болуы ықтимал.

CE, UE және өлімге әкелетін қате әртүрлі шешім талап етеді

Correctable Error дегеніміз ECC механизмі қатені тауып, дерек тұтынушыға берілмей тұрып түзетті деген сөз. Uncorrected Error деректі түзету мүмкін болмағанын білдіреді; зақымдалған деректің орнына және платформаның мүмкіндігіне қарай мұндай қате кейінге қалдырылуы, оқшаулануы немесе жүйені тоқтатуы мүмкін. Бұл санаттарды «CE қауіпсіз, UE әрқашан серверді өшіреді» деген ережеге сыйғызуға болмайды.

Linux EDAC ішкі жүйесінің құжаттамасы corrected, uncorrected, deferred және fatal оқиғаларды нақты ажыратады. Онда CE ағыны тозуды көрсетуі мүмкін екені, бірақ болашақ UE-ге кепіл болмайтыны да ескертіледі. Іс жүзіндегі қорытынды «ECC бәрін түзетті» деген жеңіл кеңестен қатаң: қайталанбаған бір түзету бақылауды қажет етеді, ал бір локатордағы тұрақты өсім апат болмай тұрып жоспарлы оқшаулауды талап етеді.

Бес белгіні бірге қараңыз:

  • ауырлық дәрежесі мен платформаның жасаған әрекеті;
  • бір сокетте, арнада, rank-та немесе DIMM-де қайталануы;
  • ағымдағы кезең есептегіші нөлденгеннен кейінгі өсу жылдамдығы;
  • температура және жүктемемен уақыттасуы;
  • CE-ден UE-ге, rank өшірілуіне, sparing-ке немесе қайта жүктелуге өтуі.

CE үшін барлығына ортақ рұқсат етілетін сан жоқ. Шек процессорға, жад режиміне, микробағдарламаға, DIMM түріне және сервер өндірушісінің саясатына байланысты. Форумнан алынған бөтен сан қауіпті: бір BMC түзетілген әр сөзді санайды, екіншісі бір топ қатені бір оқиғаға біріктіреді, үшіншісі өз ішкі шегінен асқанда ғана жазба жасайды. Нақты модельдің сервистік құжатындағы ауыстыру ережесін қолданыңыз және бірдей жағдайда өсу жылдамдығын салыстырыңыз.

Оқиғаны бір модульдің диагнозымен шатастырмаңыз. Қазіргі сервер платформаларында жад контроллері процессордың ішінде тұрады, ал сигнал жолы сокет, плата жолдары, қосқыш және DIMM арқылы өтеді. «Memory channel A» хабары ақау аймағын дәлелдейді. Бірақ күдіктілер қатарында модуль, слот, контроллер арнасы және сокет контактісі қалады.

Lockstep және memory mirroring режимдері ақау аймағын одан әрі кеңейтеді. Linux RAS нұсқаулығы lockstep модульдерді кеңірек түзету үшін топтастыратынын, бірақ қате болғанда контроллер бір DIMM-ді ажырата алмай, жұпты көрсетуі мүмкін екенін айтады. BMC осындай режимде бірден екі модульді атаса, бұл екі модульдің қатар істен шығуы емес, локализация шектеуі болуы мүмкін.

Threshold exceeded және disabled оқиғалары бір түзетумен тең емес. Біріншісі платформаның ішкі саясаты ескерту жасауға жеткілікті қате жинағанын білдіреді, екіншісі training не жұмыс кезіндегі ақаудан кейін rank немесе арна жұмыстан шығарылғанын көрсетуі мүмкін. Жүктелгеннен кейінгі жад күйін жазыңыз: қолжетімді көлемнің азаюы кейде жүйенің жасап қойған қалпына келтіру әрекеті болады.

Қате мекенжайына да сақ болыңыз. Бір физикалық мекенжайда немесе тар ауқымда қайталану ұяшықтың тұрақты ақауы туралы болжамды күшейтеді, ал бір арнадағы кездейсоқ мекенжайлар ортақ электр жолына нұсқауы мүмкін. Операциялық жүйе, interleaving және контроллердің мекенжай түрлендіруі кері сәйкестендіруді қиындатады. Нақты CPU-ға арналған декодер болмаса, бет мекенжайынан өзіңіз DIMM нөмірін шығармаңыз.

Кәдімгі kernel panic, bug check немесе Machine Check әрқашан жадты білдірмейді. Intel MCA-ны шина, кэш, ECC, parity және басқа аппараттық көздердің қателерін хабарлайтын механизм деп сипаттайды. Машиналық тексерудің бөлімін және bank өрісін оқыңыз. Көк экрандағы WHEA_UNCORRECTABLE_ERROR тақырыбы ауыстырылатын бөлшекті емес, тоқтау санатын атайды.

Контроллер кодын физикалық слотпен сәйкестендіріңіз

Модульді тек оқиғадағы логикалық мекенжайды жүйелік платада жазылған белгіге аударғаннан кейін ауыстырыңыз. CPU1_CH2_DIMM0, A2, P1-DIMMB1 және «1-арна, 0-слот» бірдей белгі емес. Әр өндірушінің сызбасы бөлек, ал операциялық жүйедегі нөмірлеу нөлден басталуы мүмкін.

Серверді тоқтатпай тұрып карта жасаңыз. Онда платадағы слот атауы, BMC локаторы, SMBIOS ішіндегі Locator және Bank Locator, DIMM сериялық нөмірі, бөлшек нөмірі, көлемі, жылдамдығы және процессор сокетіне байланысы болсын. Деректерді нақты модель мен плата ревизиясының нұсқаулығымен салыстырыңыз. Жұмыс басталғанға дейін толтырылған слоттарды суретке түсіру модульдер ауысқаннан кейін инженердің есіне сенуден дұрыс.

dmidecode электр тізбегін өлшемейді, ол микробағдарламаның SMBIOS-қа жазғанын көрсетеді. Шығыста Locator: DIMM_A2 тұрса, бұл пайдалы белгі, бірақ тәуелсіз растау емес. Redfish DeviceLocator да микробағдарламадан келеді. Екі интерфейс BIOS-тағы бір қате кестені қайталауы мүмкін.

ECC syndrome контроллерге зақымдалған биттерді анықтауға көмектеседі, бірақ құжаттамасыз модульдегі нақты микросхеманы атауға сирек мүмкіндік береді. Кездейсоқ syndrome 0x... мәнін басқа CPU буынының кестесімен шешпеңіз. Channel, slot, rank және bank өрістері тек процессор нұсқаулығы мен плата өндірушісінің іске асыруы аясында пайдалы.

Журналдар бір арнадағы әртүрлі DIMM-дерді атаса, күдік ортақ жолға ауысады: слот, жад арнасы, CPU сокеті, процессордың орнығуы немесе плата. Қате рұқсат етілген симметриялы слотқа көшірілген модульдің сериялық нөмірімен бірге жүрсе, күдік DIMM-ге ауысады. Оқшаулау дәл осы айырмашылықты дәлелдеуі керек.

Корпусты ашпай тұрып жадты толтыру ережелерін тексеріңіз. Сервер арна жұбында бірдей көлем мен құрылымды, слоттардың нақты ретін немесе lockstep үшін бірдей DIMM-дерді талап етуі мүмкін. Кездейсоқ орын ауыстыру жаңа конфигурация қатесін жасап, бастапқы ақауды жасырады.

Жөндеуге дейінгі тізімдеме тағы бір жиі қатені шешеді: сырттай бірдей екі модульдің бөлшек нөмірі, rank саны немесе қолдайтын жылдамдығы бөлек болуы мүмкін. Микробағдарлама бүкіл топтың жылдамдығын төмендетеді немесе конфигурацияның бір бөлігін қабылдамайды, ал инженер мінез-құлық өзгерісін «күдікті» DIMM-ге телиді. Жапсырмадағы жылдамдықты ғана емес, нақты жұмыс жылдамдығын жазыңыз.

Локатор болмаса, dmidecode жолдарының ретіне қарап болжамаңыз. Сервистік дампты алыңыз және өндіруші MCA немесе OEM кодын декодтауды ұсына ма, тексеріңіз. Сенімді сәйкестендіру болмаса, оқшаулау аумағы жұпқа немесе арнаға дейін кеңейеді, ал қызмет көрсету уақыты ұзарады. Бұл ыңғайлы нөмірі бар модульді ауыстырудан адалырақ.

Әр тексеруде бір айнымалыны ғана оқшаулаңыз

Кездейсоқ жинақсыз сервер жады
GSE сервер конфигурациясын жүктемеге сай таңдап, өндірістен жеткізуге дейін бақылайды.
Серверді іріктеу

Сенімді оқшаулау бір айнымалыны өзгертеді, қолдау көрсетілетін конфигурацияны сақтайды және жүйеге сол жүктеме циклін аяқтауға мүмкіндік береді. Төрт DIMM-ді қатар ауыстырып, BIOS-ты жаңартып және қуат көзін алмастырсаңыз, сервер тұрақтануы мүмкін, бірақ себеп белгісіз қалады. Келесі ақауда бәрін басынан бастайсыз.

Тоқтатар алдында жүктемені басқа жерге көшіріңіз, резервтеуді тексеріңіз және қызмет көрсету уақытын келісіңіз. Операциялық жүйені қалыпты жолмен аяқтап, сервистік рәсімге сай қуатты ажыратыңыз, зарядтың тарауын күтіңіз және статикалық электрден қорғаныңыз. Нақты платформа нұсқаулығында мүмкіндік көрсетілмесе, қарапайым DIMM-ді жұмыс үстінде ауыстыруға болмайды.

Диагностиканы мына ретпен орындаңыз:

  1. Бастапқы слоттар мен сериялық нөмірлерді тіркеп, күдікті DIMM-ді сол слотқа қайта орнатыңыз. Контактілерді, ілмектерді, ауа бағыттағыштарды және ластануды тексеріңіз.
  2. Микробағдарламаны өзгертпей, өндірушінің кіріктірілген офлайн диагностикасын іске қосыңыз. Тест идентификаторы мен физикалық локаторды қоса, толық нәтижені сақтаңыз.
  3. Қате қайта шықса, күдікті модуль мен жарамды екені белгілі үйлесімді модульді рұқсат етілген екі балама слот арасында ауыстырыңыз. Арналарды толтыру сызбасын бұзбаңыз.
  4. Сол жүктемені қайталап, жаңа оқиғаларды салыстырыңыз. Қате модульмен бірге жүрсе, DIMM-ді ауыстырыңыз; слотта қалса, платаны, сокетті және контроллерді зерттеңіз; жоғалса, бақылауды жалғастырыңыз, себебі контакт мәселесі уақытша кеткен болуы мүмкін.
  5. Екі сокетті серверде үйлесімділік пен топологияны тексермей DIMM-ді сокеттер арасында көшірмеңіз. Мұндай көшіру модульді, арнаны және жад контроллерін қатар өзгертеді.

Әр тексеруден кейін журналды экспорттап, тест басталған уақытты белгілеңіз. SEL-ді бастапқы файлды сақтағаннан кейін ғана және журнал толса не ескі жазбалар салыстыруға кедергі болса ғана тазалаңыз. Дәлелдерді өшіргеннен гөрі соңғы ескі жазбаның идентификаторын тіркеп, жаңаларын сүзген дұрыс.

Жарамды екені белгілі модуль қолдау көрсетілетін түрге, rank құрылымына, көлемге және платформа талаптарына сай болуы керек. «Қосқышқа кірді» деген сөз үйлесімді дегенді білдірмейді. RDIMM мен LRDIMM-ді араластырмаңыз, кез келген жылдамдықпен жүктеледі деп ойламаңыз және шығу тегі белгісіз модульді бақылау үлгісі ретінде қолданбаңыз.

Сервер memory sparing, rank sparing немесе зақымдалған бетті жұмыстан шығаруды қолдаса, іске қосылған әрекетті тіркеңіз. Одан кейін көлем немесе өнімділік өзгеруі, ал белгі келесі шекке дейін жоғалуы мүмкін. Жад аймағы автоматты түрде шығарылғаннан кейін сәтті жүктелу темірдің жарамдылығын дәлелдемейді.

Теріс нәтиже де пайдалы: қате DIMM-мен бірге жүрмейді және бір слотта қалмайды, бірақ тек толық конфигурацияда пайда болады. Арна жүктемесінің ережесін, орнатылған модуль санына рұқсат етілген ең жоғары жылдамдықты және жинақтардың сәйкестігін тексеріңіз. Қысқартылған конфигурация бұзылған DIMM алынғандықтан емес, контроллердің электр жүктемесі азайғандықтан немесе training өзгергендіктен жұмыс істеуі мүмкін.

Контактілерді кездейсоқ химиялық затпен немесе өшіргішпен тазаламаңыз. Өндіруші рәсімін ұстанып, мақұлданған материалдарды қолданыңыз және контакт жиегіне қол тигізбеңіз. Коррозияны, қызу ізін немесе зақымды суретке түсіріңіз; мұндай модульді тағы бір тест үшін жұмысқа қайтарудың қажеті жоқ.

Жүктеме тесті жадты қыздырып қана қоймай, жағдайды қайталауы керек

Тест ақауға апаратын жолды қайталап, жұмыс деректеріне артық қауіп төндірмегенде пайдалы. Толық офлайн жад тесті мекенжай кеңістігін жақсы тексереді, бірақ CPU, дискілер, желі, сақтық көшірме және температураның апталық үйлесімін қайталамайды. Ауыстырудан кейінгі қысқа тест сирек қатені өткізіп алуы мүмкін.

Алдымен сервердің кіріктірілген диагностикасын қолданыңыз, себебі ол топологияны біледі және сервистік код қалдыра алады. Содан кейін келісілген уақытта бірнеше өтімі бар ұзақ жад тестін іске қосыңыз. Құрал мен ұзақтықты платформа нұсқаулығына сай таңдаңыз. Экран жасыл болғаны үшін бір өтімнен кейін DIMM-ді жарамды деп жарияламаңыз.

Апталық оқиғаны қайталау үшін мүмкін болса қалыпты тапсырманы деректер көшірмесінде немесе резервтік түйінде орындаңыз. CE мен UE-ді, кіріс ауа температурасын, CPU және DIMM температурасын, қуат тұтынуды, қуат көздерінің күйін және түзету жиілігін қатар бақылаңыз. Ең жоғары қызудан гөрі оқиғалардың реті маңызды.

Тексеру алдын ала жазылған сұраққа жауап беруі керек. Мысалы: «X сериялық нөмірі B2-ге көшірілгеннен кейін толық сақтық көшірме кезінде A2 локаторында жаңа CE пайда бола ма?» Мұндай өлшем «тұрақты сияқты» деген сөздің қорытындыны алмастыруына жол бермейді.

UE туралы хабарлаған және деректердің жалғыз өзекті көшірмесін сақтайтын түйінде агрессивті тест жүргізбеңіз. Алдымен сервистерді көшіріп, сақтық көшірменің қалпына келетінін тексеріңіз. Тозып жатқан жад арнасына қосымша жүктеме диагностика уақытын апатқа айналдыруы мүмкін.

Бірдей аралықтарды салыстырыңыз. Нөлдеуге келмейтін lifetime есептегіші соңғы тексеруді бағалауға жарамайды. DMTF Redfish MemoryMetrics ішінде CurrentPeriod пен LifeTime-ды дәл осы үшін бөледі; ағымдағы кезеңді немесе екі көшірменің айырмасын қолданыңыз. Қысқа бос тұру кезінде жаңа қатенің болмауы бұрынғы жүктеме туралы ештеңе айтпайды.

Әр есептегішті қай бөлік жазатынын қадағалаңыз. BMC, EDAC және WHEA бір аппараттық оқиғаны әртүрлі жолмен алуы мүмкін, сондықтан үш санды қосу нәтижені үлкейтеді. Жазбаларды уақыт, локатор, syndrome және severity бойынша топтастырыңыз. Мақсат ең үлкен қате санын шығару емес, бір тізбекті қалпына келтіру.

Тест локаторсыз қате берсе, оның мекенжайын, өтімін, дерек үлгісін және ақау уақытын сақтаңыз. Бір үлгіде қайталану сервис мамандарына көмектеседі, бірақ аппараттық локализацияны алмастырмайды. Диагностика құралы топологиясы бар толық есепті экспорттай алса, соңғы жолдың экран суреті жеткіліксіз.

Қуат мәселесін оқиғалардың жалпы көрінісі ашады

Сервер мен интеграция бірге
GSE S200 жеткізіп, жауапкершілікті бөлек мердігерлерге бөлмей инфрақұрылымды интеграциялайды.
Серверді іріктеу

Сервер бір локаторға байланысқан алдын ала ECC жазбасынсыз қуатын жоғалтса, екі қуат көзі немесе бірнеше шина ауытқу көрсетсе және ақау бүкіл жүйенің ең жоғары жүктемесімен сәйкес келсе, себептің қуатта болуы ықтимал. Кернеу төмендегенде контроллер бұзылған транзакция алғандықтан, журналда жад соңғы болып көрінуі мүмкін.

AC lost, power unit failure, voltage out of range, power good lost жазбаларын, BMC-нің кенет reset болуын, кірістің ауысуын және резервтеудің жоғалуын іздеңіз. Мәтін платформаға байланысты. Оларды тек осы сервердің операциялық жүйесімен емес, UPS, PDU және көрші жабдық журналдарымен салыстырыңыз.

Физикалық тізбекті тексеріңіз: A және B кірістері, олардың көздері шынымен бөлек пе, кабельдер бекітілген бе, екі қуат көзі де жарамды ма, қолдайтын қуаты мен микробағдарламасы бірдей ме. Екі кабель де шамадан тыс жүктелген бір PDU-ға қосылса, BMC экранындағы резервтеу көмектеспейді. Қызмет көрсетуден кейін сервер күтілген резервтеу режимін көретінін растаңыз.

BMC кернеу көрсеткіштері өзгерісті бақылауға пайдалы, бірақ қуат сапасын өлшемейді. Контроллер сенсорларды белгілі бір аралықпен сұрайды және қысқа төмендеуді өткізіп алуы мүмкін. UPS журналы сол секундта батареяға ауысуды немесе шамадан тыс жүктемені көрсетіп, SEL тек күтпеген өшуді жазса, алдымен қуатты зерттеңіз.

Жалпы жүктеме де маңызды. Сақтық көшірме CPU, жад және дискілерді қатар жүктеп, тұтынуды көтереді. CE қуат оқиғаларының жанында екі сокеттің бірнеше арнасына шашыраса, бір DIMM-ді ауыстыру әлсіз болжам болады. Қателер шиналар тұрақты кезде бір сериялық нөмірмен бірге қайталанса, қуат күдігі кейінге шегінеді.

Қуат көзін қуаты мен үйлесімділігін бағаламай жұмыс серверлері арасында ауыстырып тексермеңіз. Қолдау көрсетілетін қосалқы қуат көзін, бөлек тексерілген кірісті және бақыланатын жүктемені қолдану қауіпсіздеу. Әр өзгерісті DIMM ауыстыруындай қатаң тіркеңіз.

Журналды өшу сәтінде ғана емес, оған дейінгі бірнеше сағат бойынша тексеріңіз. Қуат көзінің present, degraded және OK күйлері арасында қайта-қайта ауысуы ақаудан бұрын басталуы мүмкін. Мұндай тұрақсыздық restart маңындағы тар сүзгіге түспесе де, нашар контактіні немесе кірісті жақсы көрсетеді.

Сервер қуат шегіне жақын жұмыс істесе, соңғы өзгерістерден кейін нақты конфигурацияны өндіруші есебімен салыстырыңыз. Жаңа үдеткіш, шассиден қуат алатын диск сөресі немесе қуаттырақ CPU қорды өзгертеді. Жүйе резервтеу режимінде болса, екі қуат көзінің жапсырмадағы номиналын жай қосуға болмайды: біреуі істен шыққанда қалғаны толық жүктемені көтеруі керек.

Микробағдарлама, сокет және плата жарамды жадты кінәлауы мүмкін

Диагностикаға арналған бір жол
GSE сервер жабдығын, жүйелік интеграцияны және кейінгі қолдауды бір конфигурацияға біріктіреді.
Серверді іріктеу

Қателер жаңартудан кейін басталса, әр интерфейстегі локаторлар сәйкес келмесе, нұсқа ескертпелерінде RAS немесе memory training түзетуі айтылса не бірдей аппараттық конфигурациялар бірнеше серверде бір код берсе, микробағдарламадан күдіктеніңіз. Бұл ақаулы серверді бірден жаңартуға рұқсат емес. Алдымен нұсқалар мен журналдарды сақтап, содан кейін үйлесімділік матрицасы мен өндіруші нұсқаулығын тексеріңіз.

BIOS іске қосылғанда жадты баптайды, BMC оқиғаларды түсіндіріп сақтайды, ал микрокод пен жүйелік микробағдарлама машиналық қателерді өңдеуге қатысады. Нұсқалардың сәйкессіз жинағы қате локаторға, қайталанатын training failure-ге немесе дұрыс емес қалпына келтіру саясатына әкелуі мүмкін. Құрамдастарды өндіруші көрсеткен ретпен, кері қайту мүмкіндігімен және әр логикалық кезеңнен кейін бөлек тест жасап жаңартыңыз.

BIOS параметрлерін бастапқы күйге түсіру кейде жад режимі мен жылдамдығын өзгертеді, сондықтан ол бейтарап диагностикалық қадам емес. Reset алдында конфигурацияны экспорттап, memory mode, жылдамдық, interleaving, sparing, mirroring және қуат параметрлерін белгілеңіз. Одан кейін оларды нақты салыстырыңыз.

DIMM ауыстырылғаннан кейін қате арнада қалса немесе training кезінде бір арнаның бірнеше слоты жоғалса, CPU контактісі мен сокет күйін тексеріңіз. Майысқан контакт, радиатордың біркелкі қысылмауы немесе плата жолының зақымы жад ақауы сияқты көрінеді. Мұндай жұмыс сервистік рәсімді талап етеді: тиісті құралсыз CPU алу жаңа ақау қосуы мүмкін.

CPU ішіндегі жад контроллері де күдік қатарында қалады. Дәлел бір оқиғадағы «CPU» сөзі емес, модульдер мен слоттар тексерілгеннен кейін қатенің нақты сокет арнасына тұрақты байланысуы. Тәжірибе үшін CPU ауыстыру қымбат және термоинтерфейсті, қысымды, микробағдарлама идентификациясын өзгертеді, сондықтан оны құжатталған оқшаулаудан кейін қалдырыңыз.

Температураны бөлек тексеріңіз. Бітелген ауа бағыттағыш, орнатылмаған бітеуіш, тоқтаған желдеткіш немесе ыстық кіріс ауа апталық шарықтау кезінде қате туғызуы мүмкін. Температурамен сәйкестік DIMM ақауын дәлелдемейді, бірақ қайталанатын жағдай мен салқындату жүйесіне түсінікті түзету береді.

Суық іске қосудан кейінгі training қатесін жүктеме кезіндегі қатеден ажыратыңыз. Біріншісі BIOS операциялық жүйе басталмай тұрып арналарды баптағанда пайда болады, сондықтан қолжетімді көлем азайып үлгерсе де ядро журналы таза болуы мүмкін. Екіншісі оқу және жазу кезінде шығады. Training үшін модуль үйлесімділігі, дұрыс орнығу, сокет, BIOS нұсқасы және іске қосу температурасы ерекше маңызды.

Микробағдарламаны «ең соңғысын орнатамыз» қағидасымен жаңартпаңыз. Плата ревизиясын, процессорларды және жад түрін қолдайтын нұсқа қажет, ал оның ескертпелерінде тиісті түзету немесе өндіруші ұсынысы жазылуы керек. Пакет пен checksum-ды ұйым тәртібіне сай сенімді жеткізу арнасынан сақтаңыз; кездейсоқ файл диагностиканы плата істен шығатын қауіпке айналдырады.

Оқиғаны тыныштықпен емес, дәлелмен жабыңыз

Бастапқы деректер сақталып, істен шыққан құрамдас не жағдай аталып, бір негізді өзгеріс жасалып және соған тең жүктеме кезеңі жаңа оқиғасыз өткенде инцидентті жабуға болады. Апталық тапсырма бұл жолы орындалмаса, «бір апта қайта жүктелмеді» деген сөз әлсіз дәлел.

DIMM ауыстырғанда ескі және жаңа сериялық нөмірлерді, слотты, микробағдарлама нұсқасын, белсенді жад режимін және офлайн тест нәтижесін жазыңыз. Жүктелгеннен кейін толық жад көлемін, арналар симметриясын, жұмыс жылдамдығын, резервтеу күйін және training errors жоқтығын тексеріңіз. Содан соң есептегіштердің жаңа бастапқы деңгейін алыңыз.

Жөндеуден кейін ескі журналдарды өшірмеңіз. Уақыт тізбегін, слоттар картасын, ауыстыру туралы шешімді және тексеру нәтижелерін бірге сақтаңыз. Бұл бір айдан кейін сол арнадағы қайталануды көруге және екінші DIMM ақауын алғашқы ауыстыру уақытша жасырған плата мәселесінен ажыратуға мүмкіндік береді.

GSE инфрақұрылымында S200 серверлері мен тәулік бойғы техникалық қолдау аппараттық конфигурацияны тексеру және сервистік оқиғаны жүргізу үшін бір қызмет жолын береді, бірақ инженерге бастапқы SEL, микробағдарлама нұсқалары және нақты локатор бәрібір қажет. Бұл деректер болмаса, кез келген өндіруші оларды қайта жинаудан бастайды, ал тоқтап тұру ұзарады.

Жаңа UE, CE шегінен асу, қуат көзінің жоғалуы, жоғары температура және BMC журналының толуы туралы ескертулерді баптаңыз. Әр түзетуді түнгі апатқа айналдырмаңыз: сервер мен локатор бойынша топтастырып, өсімді санаңыз және ағын жылдамдағанда немесе ауырлық өзгергенде басымдығын көтеріңіз.

Бақылау кезеңі оқиға болған режимдерді кемінде қамтуы керек: суық іске қосу, қалыпты жұмыс жүктемесі және апталық тапсырма. Жөндеу кестені немесе дерек көлемін өзгертсе, осы шектеуді жазыңыз. Жеңіл жүктемеде оқиға болмауы аралық нәтиже болып қалады.

Бірдей серверлер паркі үшін бақылау фоны пайдалы. Әртүрлі модельдердің есептегіштерін араластырмай, сол буындағы түйіндердің нұсқаларын, жад конфигурациясын және CE жиілігін салыстырыңыз. Бірдей жүктемеде қатты ерекшеленетін бір түйінге басымдық берілуі керек; жаңартудан кейін топта бір жаңа кодтың пайда болуы назарды микробағдарламаға немесе ортақ жағдайға қайтарады.

Жақсы қорытынды есеп себепті бір тексерілетін сөйлемге сыйғызады: «CE және UE X сериялық нөмірлі DIMM-мен бірге бірдей жүктемеде A2-ден B2-ге көшті; ауыстырылғаннан кейін ағымдағы кезең есептегіштері тапсырманың екі толық циклінде нөлде қалды». Мұндай сөйлем құра алмасаңыз, зерттеу себепті сәйкестіктен әлі ажыратқан жоқ.

FAQ

Бір түзетілген ECC қатесі серверді қайта жүктей ала ма?

Әдетте бір CE қайта жүктеуді талап етпейді, себебі контроллер деректі түзетіп қойған. Бірақ ол үлкен оқиғалар тізбегінің бөлігі болуы мүмкін, сондықтан уақытын UE, Machine Check, watchdog және қуат жоғалуымен салыстырыңыз.

Correctable ECC-тің қандай деңгейін қауіпті деуге болады?

Барлық платформаға ортақ сан жоқ, себебі олар қателерді әртүрлі санап, топтастырады. Өз сервер моделіңіздің шегін қолданыңыз, ал оған дейін бір локатордағы өсімді және ауыр оқиғаларға өтуді бағалаңыз.

BMC атаған DIMM-ді бірден ауыстыруға бола ма?

Сервистік саясат дереу ауыстыруды талап етсе, болады, бірақ диагнозды слоттар картасы және журналдармен растаған дұрыс. BMC кейде тек арнаны немесе модуль жұбын локализациялайды, әсіресе lockstep және mirroring режимдерінде.

Жад журналындағы CE мен UE айырмасы қандай?

CE кезінде ECC механизмі деректі қолданылмай тұрып түзетеді. UE кезінде түзету сәтсіз болады; қауіпсіз жалғастыру мүмкіндігіне қарай платформа қатені оқшаулауы, өңдеуді кейінге қалдыруы немесе жүйені тоқтатуы мүмкін.

Неге жад тесті өтеді де, сервер қайта жүктеледі?

Қысқа тест апталық тапсырманың температурасын, қуат тұтынуын және жад бөлінуін қайталамауы мүмкін. Соған тең жүктемені қайталап, жадты, қуатты және салқындатуды қатар бақылаңыз.

Қайталама тест алдында SEL журналын тазалау керек пе?

Алдымен оны экспорттап, соңғы бастапқы жазбаның идентификаторын белгілеңіз. Журнал толғанда немесе платформа жаңа оқиғаларды сенімді бөлуге мүмкіндік бермегенде ғана тазалаңыз.

DIMM емес, слот ақаулы екенін қалай түсінуге болады?

Күдікті DIMM мен жарамды үйлесімді модульді рұқсат етілген балама слоттар арасында ауыстырып, бір айнымалыны ғана өзгертіңіз. Арнада немесе слотта қалған қате ортақ жолға, платаға, сокетке не контроллерге нұсқайды.

Қуат көзі ECC қатесін туғыза ала ма?

Кернеудің төмендеуі немесе қуаттың жоғалуы өшу маңында аппараттық қателер туғызуы мүмкін, бірақ бір ECC жазбасы мұны дәлелдемейді. SEL, UPS және PDU журналдарынан, кернеу сенсорларынан және екі қуат көзінің оқиғаларынан ортақ көрініс іздеңіз.

Жадты ауыстырмай тұрып BIOS жаңарту керек пе?

Бастапқы журналдарды, нұсқаларды және конфигурацияны сақтамай тұрып жаңартпаңыз. Жаңарту нақты модельге арналған белгілі түзетумен негізделіп, өндіруші рәсімі бойынша жеке тексерумен орындалуы керек.

Серверді жұмысқа қашан қайтаруға болады?

Қолдау көрсетілетін жад конфигурациясы қалпына келіп, аппараттық диагностика өтіп және бұрын ақау туғызған жүктеме толық қайталанғаннан кейін. Жаңа бастапқы есептегіштерді тіркеп, UE, CE өсімі, қуат пен температура ескертулерін қалдырыңыз.