7 мин

SMART бойынша дискіні қашан ауыстыру керек

Дискіні қашан ауыстыру керек: HDD және NVMe жүйесіндегі қандай SMART қателері шұғыл ауыстыруды, ал қайсысы кабель, қуат не салқындатуды тексеруді талап етеді.

SMART бойынша дискіні қашан ауыстыру керек

SMART дискінің нақты қашан істен шығатынын айтпайды. Ол бұрын болған ақаулардың ізін, тозуды және жинақтауыш деректі енді сенімді сақтай алмайтынын өзі мойындайтын бірнеше күйді көрсетеді. Сондықтан сары түсті кез келген белгі емес, жалпы FAILED мәртебесі, оқылмай тұрған аймақтар, сәтсіз аяқталған өзіндік тест немесе NVMe жүйесінің қауіпті күйі дискіні дереу ауыстыруға негіз болады.

Әкімшінің ең қауіпті қатесі ақылға қонымды әрекет сияқты көрінеді: ескертуді байқап, ұзақ тест не толық қайта жазуды іске қосып, сақтық көшірмеге содан кейін ғана кірісу. Дерек маңызды болса, ретті керісінше өзгертіңіз. Алдымен артық жазуды тоқтатып, оқылатын деректі сақтаңыз, содан кейін диагнозды нақтылаңыз. SMART жүйесіндегі жасыл мәртебе сақтық көшірмені алмастырмайды, ал RAID ақаулы дискіні жарамды етпейді.

Дереу ауыстыруды төрт белгі талап етеді

Диск өз ақауын хабарласа, деректі тұрақты оқи алмаса, ішкі оқу тестінен өтпесе немесе NVMe қауіпті күйге көшсе, оны жұмыс жүктемесінен дереу шығару керек. «Дереу» дегеніміз бірнеше аптадан кейінгі жоспарлы үзілісті күтпеу, жүктеме тестін бастамау және есептегіш тағы өсе ме деп бақыламау. Деректі қорғап, ауыстыратын құрылғыны дайындаңыз.

HDD және SATA SSD үшін төрт топтағы қауіпті белгіні қолданамын:

  • SMART overall-health self-assessment test result: FAILED немесе SMART Health Status: BAD;
  • оқу қателерімен қатар нөлден жоғары әрі өсіп жатқан Current_Pending_Sector не Offline_Uncorrectable;
  • өзіндік тест журналындағы Completed: read failure жазбасы;
  • тасымалдағыштың өз қателерімен бір уақытта қайталанатын I/O errors, командалардың тұрып қалуы немесе дискінің жүйеден жоғалуы.

NVMe үшін негізгі қауіпті белгі critical_warning деп аталады. Degraded reliability және read-only биттері ішкі жүйенің сенімділігі төмендегенін немесе бүкіл тасымалдағыш тек оқу режиміне өткенін тікелей көрсетеді. available_spare өндіруші белгілеген шектен түссе, жинақтауыш та қауіпті битті орнатады. Қолданбалар деректің көп бөлігін әлі оқып тұрса да, сервердегі мұндай құрылғыны жұмыстан шығару керек.

Бір маңызды ескерту бар: өспей тұрған жалғыз қайта тағайындалған сектор және басқа қатенің болмауы нақты HDD жақында бұзылады дегенді дәлелдемейді. Үйдегі маңызы төмен қосалқы қоймада оны кейде бақылауға болады. Қызмет көрсету уақыты анық өндірістік серверде мен бәрібір ауыстыруды жоспарлаймын, өйткені қайта-қайта тексеру мен массивтің әлсіреуі көбіне диск бағасынан қымбат. Шұғылдықты қазіргі қате, оның өзгеруі және жинақтауыштың міндеті анықтайды.

RAW, VALUE және тарихты бөлек оқыңыз

SMART дерегін дұрыс оқу бастапқы есептегішті, қалыпқа келтірілген бағаны және өндіруші шегін ажыратудан басталады. Бұл бағандар әртүрлі сұраққа жауап береді. Оларды шатастыру жалған дабылдардың көбін туғызады.

Әдеттегі ATA есебінде VALUE шамамен 100 немесе 200 мәнінен басталып, жағдай нашарлаған сайын көбіне төмендейді. WORST ең нашар қалыпқа келтірілген мәнді сақтайды, ал THRESH атрибут сәтсіз деп саналатын шекті белгілейді. RAW_VALUE ішкі есептегішті көрсетеді, бірақ оның пішімін өндіруші таңдайды. VALUE бағанындағы 100 денсаулық 100 пайыз деген сөз емес, ал RAW_VALUE ішіндегі үлкен сан әрдайым жүздеген физикалық қатені білдірмейді.

Бұл айырма Raw_Read_Error_Rate және Seek_Error_Rate көрсеткіштерінде айқын көрінеді. Кейбір модельдер бастапқы өріске бірнеше шаманы бірге жазады немесе қателермен қатар сәтті операциялардың өте үлкен санын есептейді. Seagate өз анықтамасында жеке атрибут мәндері мен шектер фирмалық екенін, ал бөгде бағдарлама оларды әркелкі түсіндіруі мүмкін екенін ашық ескертеді. Кездейсоқ кестедегі шекті басқа модельге қолданбаңыз.

WHEN_FAILED бағанын да жиі қате оқиды. Бос өріс дискінің жарамды екеніне кепіл бермейді, ол тек қалыпқа келтірілген атрибут өндіруші шегінен өтпегенін білдіреді. Журналда оқу қатесі немесе бірнеше күтілудегі сектор тұрса да, SMART PASSED көрсетуі мүмкін. smartmontools коды жалпы мәртебенің сәтсіздігін, атрибуттың шектен түсуін, error log ішіндегі қатені және self-test log ішіндегі қатені әдейі бөлек есептейді.

Бір реттік көрсеткіштен гөрі тарих маңызды. Модельді, сериялық нөмірді, жұмыс уақытын, барлық атрибутты және тест журналын сақтап, сол дискіні өз бұрынғы күйімен салыстырыңыз. Әртүрлі диск топтарының RAW мәндерін өндіруші құжатын тексергеннен кейін ғана салыстыруға болады. Кеше Current_Pending_Sector 0 болып, бүгін 1-ге, ал қалыпты оқудан кейін 8-ге өссе, қалыпқа келтірілген VALUE жақсы көрінгенімен, бет белсенді бұзылып жатыр.

HDD үшін күтілудегі және түзелмейтін секторлар қауіпті

Магниттік дискіде 5, 187, 197 және 198 атрибуттары ең пайдалы, бірақ әрқайсысы ақаудың бөлек кезеңін сипаттайды. Оларды бірдей көрсеткіш деп санауға болмайды.

Reallocated_Sector_Ct (5) диск қанша нашар физикалық секторды резервтегі сектормен ауыстырғанын көрсетеді. Логикалық мекенжайдағы дерек қайтадан дұрыс оқылуы мүмкін, сондықтан бұл әрдайым қазіргі қате емес, бұрынғы оқиғаның ізі. Бір тұрақты қайта тағайындалған секторды бақылау керек. Оның тез өсуі, жаңа оқу қатесі немесе қалыпқа келтірілген резервтің азаюы ауыстыруды талап етеді.

Current_Pending_Sector (197) қауіптірек: диск секторды сенімді оқи алмады және ол жөнінде шешім қабылдауды күтіп тұр. Кейінгі сәтті жазу сектордың жарамды екенін растауы немесе микробағдарламаға оны қайта тағайындатуы мүмкін. Оған дейін сол LBA ішіндегі дерек қолжетімсіз болуы ықтимал. Деректің жалғыз көшірмесі тұрған дискідегі нөлден жоғары 197 көрсеткіші алдымен бүкіл оқылатын деректі көшіру керек дегенді білдіреді, «pending мәнін нөлге түсіруге» асықпаңыз.

Offline_Uncorrectable (198) фондық тексеру немесе өзіндік тест кезінде жинақтауыш түзете алмаған аймақтарды санайды. 198 нөлден жоғары болып, журналда read failure тұрса, тасымалдағыш қайталанатын оқу мәселесін көрсетіп қойған. Ресми мәртебесі кейін қалпына келсе де, мұндай HDD-ні жұмыс массивінде қалдырмаймын.

Reported_Uncorrect (187) диск түзете алмай, хостқа хабарлаған қателерді жазады. Command_Timeout (188) уақыт шегінен асып тоқтаған командаларды белгілейді, бірақ оны қуат, контроллер және модель деректерімен салыстыру керек. Backblaze үлкен HDD паркінде ықтимал ақауларды тексеру үшін 5, 187, 188, 197 және 198 атрибуттарын таңдаған. Бұл пайдалы тәжірибелік сүзгі, бірақ жалпыға ортақ кепілдік емес: олардың тәртібі жалғыз көшірмені жоғалтпай диск ауыстыруға болатын массивтерге арналған.

Google жүргізген «Failure Trends in a Large Disk Drive Population» зерттеуі жайсыздау қорытынды береді. Қайта тағайындаулар, тексеру қателері және күтілудегі секторлар ақаумен жақсы байланысқан, бірақ істен шыққан көптеген диск осы күшті белгілердің ешқайсын көрсетпеген. Есептегіштер жанғанда SMART қауіпті жақсы растайды, алайда барлық нөл қауіп жоқ екенін нашар дәлелдейді.

NVMe ресурсының таусылуын басқа белгілер көрсетеді

NVMe ішінен HDD-ге тән нөмірленген атрибуттарды іздемеңіз. Стандарт ортақ SMART / Health Information бетін белгілейді, ондағы күйлер түсініктірек: critical_warning, available_spare, available_spare_threshold, percentage_used, media_errors және қателер журналы.

NVM Express 2.0 спецификациясы бөлек critical_warning биттерін анықтайды. 0-бит қолжетімді резерв шектен төмен түскенін білдіреді; 1-бит температура белгіленген шекарадан шыққанын хабарлайды; 2-бит тасымалдағыштың елеулі қатесі немесе ішкі қате салдарынан сенімділік төмендегенін көрсетеді; 3-бит бүкіл тасымалдағыш тек оқу режиміне өткенін айтады. Резервтік қуаты және persistent memory мүмкіндігі бар құрылғыларға тағы екі күй арналған.

Бұл биттердің шұғылдығы бірдей емес. Read-only және degraded reliability жинақтауышты жазудан бірден шығарып, ауыстыруды талап етеді. Spare below threshold резерв өндірушінің өзі қауіпті деп санайтын деңгейге жеткенін білдіреді, сондықтан келесі ескертуді күту орынсыз. Температура биті шықса, алдымен салқындатуды түзетіп, жүктемені азайтыңыз. Температура қалыпқа келгеннен кейін ескерту қайталанса, құрылғының немесе датчиктің ақауын тексеріңіз.

percentage_used микробағдарламаның болжамды жазу төзімділігіне сүйеніп есептеген пайдаланылған ресурс бағасын көрсетеді. 100 мәні жинақтауыш сол минутта өшеді дегенді білдірмейді, кей құрылғылар 100-ден жоғары мәнге де жол береді. Бұл есептік жазу ресурсы таусылғанын білдіреді. Жұмыс жүйесінде осы шекке дейін жоспарлы ауыстыру керек, ал онымен бірге media_errors, critical warning немесе қолданба қателері байқалса, ауыстыру шұғыл болады.

media_errors түзетілмеген тұтастық қателерін санайды. Оған түзелмейтін ECC, стандарт сипаттаған жол ішіндегі CRC қатесі немесе LBA tag сәйкессіздігі кіреді. Белгілі бір оқиғадан қалған бір ескі мәнді error log пен өзгерісін көрмей бағалау дұрыс емес. Қалыпты жүктеме кезіндегі жаңа өсім, әсіресе critical warning қатар шықса, жай ғана жасына байланысты деп есептелмеуі керек. Ал unsafe_shutdowns қалыпты өшіру хабарламасынсыз қуат жоғалғанын көрсетеді. Ол пайдалану жағдайын түсіндіреді, бірақ NAND тозуын өздігінен дәлелдемейді.

Кабель ақауы мен қызу тасымалдағыштың бұзылуына тең емес

Сервер жүйесінің ашық жеткізілімі
GSE сервер жабдығын жобалауды, өндіруді, жеткізуді және қолдауды бақылайды.
Конфигурация таңдау

Интерфейс, қуат және температура есептегіштері дискіні бірден тастауды емес, қосылу жолын жөндеуді талап етеді. Олар жарамды жинақтауышты ауыстырып, серверде нақты ақауды қалдырып кетпеуге көмектеседі.

SATA жүйесіндегі UDMA_CRC_Error_Count (199) көбіне жинақтауыш пен контроллер арасында дерек тасымалдау кезінде бұзылғанда өседі. Жиі кездесетін себеп кабельде, жалғағышта, диск ұясында, қуатта немесе портта болады. Ескі нөлден жоғары мән кабель ауысқаннан кейін өшпейді. Оны жазып алыңыз, қосылымды қайта орнатыңыз не ауыстырыңыз және RAW өсе ме, соны бақылаңыз. Есептегіш тоқтаса, тасымалдағыш жарамды болуы мүмкін. 197 және 198 қатар өссе, бір кабель ауыстыру диагнозды жаппайды.

Жоғары температура әрекет етуді талап етеді, бірақ барлық модельге ортақ сан жоқ. NVMe үшін қазіргі температураны Identify Controller ішіндегі warning және critical threshold мәндерімен салыстырыңыз. SATA үшін нақты модельдің анықтамасы мен техникалық құжатын, сондай-ақ сол ұядағы тарихты қараңыз. Көрші дискілер қалыпты тұрғанда бір диск температурасының күрт өсуі желдеткіш істен шыққаннан кейін бүкіл қатардың бірдей жылынуынан күмәндірек.

Power_On_Hours, Power_Cycle_Count, Start_Stop_Count және Load_Cycle_Count жас пен жұмыс тәртібін сипаттайды. Жұмыс сағатының көп болуы паркті жаңартуды жоспарлауға көмектеседі, бірақ дереу үкім шығармайды. SATA SSD ішіндегі Wear_Leveling_Count пен фирмалық life remaining көрсеткіштеріне де осы қағида жүреді: шкаланың мағынасы мен бағытын модель құжатынан тексеріңіз.

Интерфейс қатесінің есептегішін «бұл диск туралы емес» деп елемеуге болмайды. Нашар жалғағыш жүйені тоқтатып, дискіні RAID құрамынан шығарып, аяқталмаған жазуды зақымдауы мүмкін. Шешімі ғана өзгеше: деректі сақтап, кабельді, қуатты немесе backplane құрылғысын жөндеңіз, содан кейін өзгерісті қайта тексеріңіз. Қосылу жолын жөндемей дискіні ауыстыру жаңа құрылғыда сол белгілердің қайталануына жиі әкеледі.

Шешімді мәртебе мен өзгеріс бірге анықтайды

SMART жүйесінің бір реттік көрсеткіші тек анық сәтсіздік кезінде өздігінен әрекет етуге негіз болады. Қалған жағдайда шешім дерекке қазіргі әсерге, есептегіштің өсуіне және дискінің міндетіне сүйенеді.

  • Жалпы FAILED немесе BAD: микробағдарлама өз ақау шегінен өткен. Жүктемені алып, қолжетімді деректі көшіріп, дискіні дереу ауыстырыңыз.
  • Read-only немесе reliability degraded көрсетілген NVMe critical warning: контроллер сенімділіктің төмендегенін мойындады. Құрылғыны қайта жазуға қоспай, ауыстырыңыз.
  • 197 не 198 атрибуты өсіп, self-test read failure берді: оқылмайтын белсенді аймақ бар. Тестке дейін көшіріп, содан кейін дискіні ауыстырыңыз.
  • 5 атрибуты нөлден жоғары, тұрақты және басқа қате жоқ: жинақтауыш бір аймақты қайта тағайындаған. Бақылауды күшейтіп, маңызды міндет үшін ауыстыруды жоспарлаңыз.
  • 199 атрибуты media errors жоқ кезде өседі: SATA қосылымының ақауы бет ақауынан ықтималырақ. Кабельді, портты, ұяны немесе қуатты жөндеп, қайта өлшеңіз.

Кей жағдайда бұл нұсқаулық әдейі сақтықты күшейтеді. Бухгалтерлік дерекқордың жалғыз көшірмесі тұрған дискіні басқа репликасы мен тексерілген сақтық көшірмесі бар дискіден ертерек тоқтатыңыз. RAID құрамындағы бір құрылғы істен шыққаннан кейін қалған дискілер rebuild кезінде көп оқылады, сондықтан олардың біріндегі бірнеше pending-сектор бөлек архивтік жинақтауыштағы сондай сектордан қауіпті.

Мен «он bad sector болғанда ауыстыру» ережесін қолданбаймын. Оның ортақ техникалық негізі жоқ: сектор өлшемі, микробағдарлама резерві, модель, өсу жылдамдығы және қате сипаты әртүрлі. Нөл диск өміріне кепіл болмайды, ал таңдалған дөңгелек сан қауіпті басқарылатын етпейді. Белсенді pending және uncorrectable үшін деректің қолжетімсіз болуының өзі маңызды; reallocated үшін өзгеріс пен жағдай маңыздырақ.

Екі HDD-ден тұратын айнаны қарастырайық. Массив бірінші жинақтауышты failed деп көрсетіп тұр, ал екіншісінде екі pending-сектор пайда болды. Жаңа дискіге автоматты rebuild екінші дискіні ретімен оқи бастайды да, күмәнді аймаққа жетуі әбден мүмкін. Жалғыз сақтық көшірме тексерілмесе, rebuild түймесін ойланбай басу басқарылатын әлсіреуді оқу мен жаңа қатенің жарысына айналдырады. Алдымен көшірмені растаңыз, орны толмайтын деректі сақтаңыз және қай дереккөз әлі оқылатынын анықтаңыз.

Көшіру басымдығы да қатеге байланысты. Каталог ашылып, үлкен архивтер I/O error берсе, алдымен шағын бірегей құжаттар мен қолданба метадеректерін, содан кейін қайта жасауға болатын көлемді деректі алыңыз. Бір нашар файлды қайта-қайта оқу қалған жұмысты кешіктіреді. ddrescue сияқты құралдар оқылған және өткізіп жіберілген аймақтардың картасын жүргізеді, сондықтан образдың жеңіл бөлігін алдымен жинап, қиын блоктарға кейін орала алады. Бұл дискіні жөндеу емес, қайталама сұраулар санын басқару.

Алдымен деректі сақтап, бетті кейін тексеріңіз

Дискіні тосын жағдайсыз ауыстыру
GSE сервер конфигурациясын таңдап, жабдыққа жеткізілгеннен кейін де қолдау көрсетеді.
Конфигурация таңдау

Қауіпті белгі шыққанда дұрыс реттілік ақаулы тасымалдағыштан оқуды азайтып, ең маңызды файлдарды қалпына келтіру мүмкіндігін сақтайды. Диагностика деректі көшірумен жарыспауы керек.

  1. Қолданбаларды, индекстеуді, дефрагментацияны, scrub және дискіге жазатын тапсырмаларды тоқтатыңыз. Ақау массивке әсер етсе, құрылғыны кездейсоқ суырып алмай, қоймаға арналған рәсімді орындаңыз.
  2. SMART толық есебін, ядро журналын, модельді, сериялық нөмірді, ұяны және оқиға уақытын сақтаңыз. Диск жүйеден жоғалып жатса, бұған бірнеше сағат жұмсамаңыз.
  3. Ең маңызды және бірегей деректі жарамды қоймаға көшіріңіз. Оқу тұрақсыз болса, шексіз қайталайтын кәдімгі көшірудің орнына нашар аймақтарды өткізіп, кейін орала алатын образ жасау құралын пайдаланыңыз.
  4. Алынған көшірмені тексеріңіз: маңызды файлдарды ашыңыз, белгілі хештерді салыстырыңыз, қолданба немесе дерекқор тексеруін көшірмеде орындаңыз.
  5. Жинақтауышты ауыстырып, резервтеуді қалпына келтіріңіз. Қажет болса, алынған дискіні содан кейін ғана зерттеңіз.

Pending-секторға нөл жазу жөніндегі кең тараған кеңес микробағдарламаға секторды қабылдатуы немесе қайта тағайындатуы мүмкін. Сол себепті бұл көшіруге дейін қауіпті: жазу LBA ішіндегі бұрынғы деректі жойып, дәлелді өзгертеді. Дерек сәтті қалпына келгеннен кейін мұндай операция зертханалық тексеруге жарайды, бірақ жұмыс жүктемесінде түзелмейтін қате берген дискіге сенімді қайтармайды.

Ұзақ SMART self-test негізінен диск ішіндегі бетті оқиды және тұрақты жинақтауышта пайдалы. Тырсылдайтын, жүйеден ажырайтын немесе pending санын жылдам өсіретін дискіде бұл тест қосымша жұмыс туғызып, көшіруді кешіктіреді. Деректі қайта жасау мүмкін болмаса және қалыпты оқу жағдайды нашарлатса, тәжірибені тоқтатып, тасымалдағышты дерек қалпына келтіру мамандарына беріңіз.

Түрлі түсті белгіге емес, толық есепке қараңыз

Бастапқы тексеруге графикалық бағдарламаның жасыл белгісі емес, толық мәтіндік есеп керек. smartctl жалпы мәртебені, атрибуттарды, қате журналын және өзіндік тест журналын көрсетеді; NVMe үшін сол денсаулық бетін nvme-cli шығара алады.

sudo smartctl -x /dev/sdX
sudo smartctl -l selftest /dev/sdX
sudo smartctl -x -j /dev/sdX > smart-sdX.json

sudo nvme smart-log /dev/nvme0
sudo smartctl -x -j /dev/nvme0 > smart-nvme0.json

ATA үшін жақсы бастапқы жазбада SMART overall-health жолы, атрибуттар кестесі, SMART Error Log және SMART Self-test log сақталуы керек. NVMe үшін кемінде critical_warning, available_spare, available_spare_threshold, percentage_used, media_errors, num_err_log_entries, температура және қауіпті температура күйіндегі уақыт қажет. JSON мониторингке ыңғайлы, өйткені бос орынмен тураланған бағандарды талдаудың қажеті жоқ.

Дерек көшірілгеннен кейін диск тұрақты қолжетімді болса, қысқа өзіндік тестті іске қосуға болады. smartctl -t short /dev/sdX командасы көбіне тестті тек кезекке қояды; нәтижені кейін smartctl -l selftest /dev/sdX арқылы оқу керек. Толық оқу үшін -t long қолданылады, ал күтілетін уақытты бағдарлама жауабында көрсетеді. Қысқа тест қатесіз өтсе де, бүкіл бетті тексермейді.

smartctl қайтару коды әдеттегі 0 немесе 1 емес, биттік маска. smartmontools құжатында 3-бит жалпы SMART status сәтсіздігін, 4-бит шектен төмен түскен қазіргі prefail атрибутын, 6-бит error log ішіндегі жазбаларды, 7-бит self-test log ішіндегі қателерді білдіреді. Тек exit_code == 1 шартын тексеретін скрипт елеулі күйлерді өткізіп алады. Алдымен JSON мен қайтару кодын сақтап, кейін құрылғы түріне сай биттерді талдаңыз.

RAID контроллері немесе USB көпірі SMART дерегін жасыруы не құрылғы түрінің параметрін талап етуі мүмкін. smartctl HBA артындағы жинақтауышты көрмесе, бұл оның жарамды екенін дәлелдемейді. Деректі контроллер қолдайтын интерфейс немесе BMC арқылы сұраңыз, логикалық дискіні физикалық ұямен сәйкестендіріңіз және қайта жүктелгеннен кейін өзгеруі мүмкін /dev/sdX атауына ғана сүйеніп құрылғы ауыстырмаңыз.

ATA error log дерегін жұмыс уақытымен және команда түрімен бірге оқу керек. Ескі жазба кабель ауысқанға дейін пайда болып, журналда мәңгі қалуы мүмкін, ал сол LBA бойынша жаңа UNC қатесі оқу мәселесін растайды. Interrupted (host reset) белгісі бар өзіндік тест Completed: read failure дегенмен бірдей емес: біріншісін қайта жүктеу, ұйқы режимі немесе контроллер командасы тоқтатуы ықтимал. Оны сброс себебін анықтап, деректі қорғағаннан кейін ғана қайталаңыз.

NVMe жүйесіндегі num_err_log_entries те жоғалған файлдар санын білдірмейді. Ол әртүрлі команда мәртебелері жазылатын контроллер қате журналының жазбаларын санайды. Шешім үшін жазбалардың өзі, media_errors, critical warning және операциялық жүйе оқиғалары керек. Утилитаның дұрыс емес әкімшілік командасы есептегішті өсірсе, ауыстыру қажет емес; жаңа жазбалар I/O error және media error қатар шыққанда көбейсе, ауыстыруды кейінге қалдырмаңыз.

Мониторинг әдемі санды емес, өзгерісті ұстауы керек

Жүйеге бір тарап жауап береді
GSE жабдықты өндіру мен жеткізуден кейінгі техникалық қолдауға дейін жүргізеді.
Жобаны талқылау

Пайдалы ескерту күн сайын ескі есептегіштер тізімін жібермей, жаңа қауіп пен оның жылдамдығын көрсетеді. Әр сериялық нөмір үшін бастапқы жазба мен соңғы мәнді сақтаңыз. Алғашқы pending, uncorrectable, media error, сәтсіз self-test және кез келген critical warning жағдайын бөлек белгілеңіз.

HDD үшін орынды көтеру тәртібі мынадай: жалпы FAILED, жаңа self-test read failure және 197 не 198 өсімі төтенше оқиға жасайды; жаңа 5 ескерту мен тексеру тапсырмасын жасайды; 199 өсімі қосылу жолын тексеруге тапсырма береді. 5 бойынша жоспарлы ауыстыру шегі міндетке байланысты, бірақ алғашқы оқиғадан кейінгі қайталама өсімді ескі кездейсоқ белгі деп санауға болмайды.

NVMe үшін reliability degraded, read-only және spare below threshold биттері төтенше оқиға жасайды. percentage_used жөніндегі ескертуді алғаш рет 100 пайызда емес, сатып алу тәртібі мен жеткізу мерзіміне қарай ертерек беріңіз. Температура оқиғасында қазіргі мән, контроллер шектері, қызу ұзақтығы және көрші құрылғылар күйі болуы керек. Сонда кезекші маман желдеткіш ақауын бір ғана ыстық жинақтауыштан ажырата алады.

Мониторингтің өзін жарамды сынақ құрылғысында тексеріңіз. smartctl дерегін бірнеше ай жинап, бірақ қайтару кодын жоғалтқан, self-test log оқымаған немесе жаңартудан кейін өріс атауын өзгерткен конфигурацияларды талай көрдім. Мұндай жүйедегі бос график қатенің жоқтығын емес, жинаудың бұзылғанын білдіреді.

SMART операциялық жүйені бақылауды да алмастырмайды. Блок деңгейіндегі уақыт шектері, контроллер сбросы, кідірістің өсуі, read-only файлдық жүйе және RAID әлсіреуі түсінікті атрибуттан бұрын шығуы мүмкін. Қолданба оқиғасы мен тасымалдағыш күйін бір уақыт сызығына жинаңыз. Сонда ненің бірінші болғаны көрінеді: қызу, интерфейс қатесі, тасымалдағыш зақымы немесе қуат жоғалуы.

Диск ауысқаннан кейін ақау себебін жойыңыз

Жаңа диск тасымалдағыш мәселесін шешеді, бірақ нашар backplane құрылғысын, стойканың қызуын немесе тексерілген көшірменің жоқтығын түземейді. Резервтеу қалпына келгеннен кейін көрші құрылғылардың SMART дерегін, контроллер журналын және сол ұядағы температураны салыстырыңыз. CRC қателері мен сбростар жаңа жинақтауышқа көшсе, қосылу жолындағы себеп әлі бар.

Ұйымда «диск ауыстырылды» деген жазбамен шектелмей, себебін де көрсету керек: жалпы FAILED, pending өсімі, сәтсіз self-test, NVMe critical warning, интерфейс қатесі немесе ресурс бойынша алдын ала ауыстыру. Мұндай жіктеу SMART нақты қай ақауды алдын ала көрсеткенін және қанша ауыстыру кабель не салқындату салдарынан болғанын анықтайды. Ол ойдан шығарылған жалпы шекке сүйенбей, қосалқы диск санын және нақты қызмет көрсету уақытын жоспарлауға көмектеседі.

GSE.kz серверлерінде жинақтауыш диагностикасын тәулік бойғы техникалық қолдаумен және нақты конфигурация деректерімен, соның ішінде контроллермен, диск ұясымен және стойка жағдайымен байланыстыру орынды. Өндіруші әрі жүйелік интегратор бүкіл қосылу жолын және ауыстырылатын құрылғы үйлесімділігін бағалай алады, ал бір SMART скриншоты жүйенің бір бөлігін ғана сипаттайды.

Алынған диск uncorrectable қатесін берсе немесе өзіндік тесттен өтпесе, оны «екінші сақтық көшірме» деп пайдаланбаңыз. Ондағы деректі ұйым тәртібіне сай жойыңыз, кепілдік қайтаруды рәсімдеңіз немесе маңызы төмен зертханалық диагностикаға ғана қалдырыңыз. Жұмыс шегі түсінікті: анық ақау немесе оқу мүмкіндігінің белсенді жоғалуы қазір ауыстыруды талап етеді; тұрақты тарихи есептегіш бақылауды талап етеді; интерфейс ақауы интерфейсті жөндеуді талап етеді. Үш жағдайда да бұрыннан жасалған және тексерілген сақтық көшірме қажет.

FAQ

SMART PASSED мәртебесіне сенуге бола ма?

PASSED жинақтауыш жалпы ақаудың ішкі шегінен өтпегенін білдіреді. Ол өзіндік тест журналындағы қатені, pending-секторларды, интерфейс ақауын немесе ескертусіз кенет бұзылуды жоққа шығармайды. Толық есеп пен сақтық көшірме күйін тексеріңіз.

HDD ішінде қанша қайта тағайындалған секторға жол беруге болады?

Барлығына ортақ рұқсат етілген сан жоқ. Басқа қатесі жоқ бір тұрақты `Reallocated_Sector_Ct` көрсеткішін маңызы төмен міндетте бақылауға болады, бірақ оның өсуі, pending-секторлар немесе read failure ауыстыруды талап етеді. Жұмыс серверінде алғашқы расталған өсімнен кейін ауыстыру көбіне арзанырақ.

Current Pending Sector 1 болса, дискіні ауыстыру керек пе?

Алдымен маңызды деректі көшіріңіз, өйткені бір күтілудегі сектордың өзінде оқылмайтын блок болуы мүмкін. Көшіргеннен кейін журнал мен өзгерісті тексеріңіз. Сектор қалыпты қайта жазудан кейін кетпесе, есептегіш өссе немесе өзіндік тест сәтсіз болса, дискіні ауыстырыңыз.

Offline Uncorrectable нөлден жоғары болса, қауіпті ме?

Иә, бұл фондық тексеру немесе өзіндік тест оқуды түзете алмағанын білдіреді. `Completed: read failure` жазбасымен не 197 өсімімен бірге ол дискіні жұмыс жүктемесінен шығаруға негіз болады. Дерек сақталмай тұрып толық қайта жазуды бастамаңыз.

SMART overall-health FAILED нені білдіреді?

Жинақтауыш микробағдарламасы бақыланатын бір не бірнеше параметр ақау шегінен өтті деп санайды. Қолжетімді деректі сақтап, құрылғыны бақылау кезеңінсіз ауыстырыңыз. Қайта жазудан кейінгі жасыл тест бұрынғы сенімді қайтармайды.

UDMA CRC Error Count үшін SATA дискісін ауыстыру керек пе?

Бірден ауыстыру қажет емес. 199 атрибутының өсуі көбіне кабель, порт, диск ұясы немесе қуат мәселесін көрсетеді, сондықтан қосылу жолын жөндеп, жаңа мәнді бақылаңыз. Онымен қатар media errors, pending немесе uncorrectable байқалса, диск жөнінде бөлек шешім қажет.

NVMe SSD құрылғысын қандай Percentage Used мәнінде ауыстыру керек?

100 пайызға жақындағанда жинақтауыш есептік жазу ресурсына жетеді, сондықтан жұмыс жүйесінде ауыстыруды алдын ала жоспарлаңыз. `critical_warning`, жаңа `media_errors`, read-only режимі немесе қолданба ақауы оны шұғыл етеді. 100 санының өзі құрылғы дәл қазір тоқтайды деген кепілдік емес.

Ақаулы дискіде long SMART test жүргізуге бола ма?

Деректі көшіргеннен кейін және диск тұрақты жауап берсе ғана болады. Ұзақ тест беттің көп бөлігін оқып, қосымша жұмыс туғызады және деректі көшіруге кететін уақытты азайтады. Диск тырсылдаса, жоғалса немесе қатені тез көбейтсе, алдымен образ жасаңыз не қалпына келтіру мамандарына жүгініңіз.

RAID контроллерінің артында SMART неге мәселе көрсетпейді?

Контроллер, HBA немесе USB көпірі SMART командаларын жасыруы не құрылғының ерекше түрін талап етуі мүмкін. Телеметрияны контроллер қолдайтын интерфейс немесе BMC арқылы алып, сериялық нөмірді ұямен сәйкестендіріңіз. Есептің болмауы диск жарамды деген сөз емес.

Жақсы SMART дерегі диск бұзылмайтынына кепіл бола ма?

Жоқ. Google далалық зерттеуінде істен шыққан HDD құрылғыларының елеулі бөлігі алдын ала күшті SMART белгісін көрсетпеген. SMART пайда болған қауіпті табуға көмектеседі, ал деректі резервтеу, тексерілген көшірмелер және ауыстыру рәсімі қорғайды.