بلاگ

بازسازی سرور و بازسازی RAID پس از Rebuild

بازسازی سرور و بازسازی RAID پس از Rebuild

اگر همین الان آرایه شما مشکل دارد، این را اول بخوانید

در بحران RAID، کاری که نمی‌کنید مهم‌تر از کاری است که می‌کنید. بیشتر مواردی که اطلاعات برای همیشه از دست می‌رود، به خاطر خود خرابی نیست — به خاطر اقدامات عجولانه‌ی بعد از آن است.

تا مشخص شدن وضعیت، این کارها را انجام ندهید

کار چرا خطرناک است
ری‌استارت پشت سر هم سرور هر بوت می‌تواند وضعیت آرایه را بدتر کند
بیرون کشیدن و جابه‌جا کردن هاردها ترتیب دیسک‌ها در آرایه حیاتی است
ساختن دوباره آرایه (Create/Recreate) اطلاعات را برای همیشه پاک می‌کند
اجرای Initialize یا Format اطلاعات را برای همیشه پاک می‌کند
اجرای chkdsk یا fsck روی آرایه تخریب‌شده می‌تواند خرابی را گسترش دهد
شروع Rebuild بدون بکاپ اگر دیسک دومی خراب شود، همه‌چیز از دست می‌رود

اول وضعیت را تشخیص دهید

وضعیت نشانه معنی
تخریب‌شده (Degraded) یک هارد کهربایی، سرور بالا می‌آید، اطلاعات در دسترس است آرایه کار می‌کند اما افزونگی ندارد
خراب (Failed) چند هارد کهربایی، درایو منطقی در دسترس نیست آرایه از کار افتاده
در حال بازسازی چراغ آبی چشمک‌زن در جریان است، دست نزنید
  • اگر وضعیت تخریب‌شده است: فرصت دارید. اول بکاپ بگیرید، بعد هارد را تعویض کنید.
  • اگر وضعیت خراب است: متوقف شوید. بخش «وقتی آرایه از کار افتاده» را بخوانید.

تفاوت Rebuild و Recovery

این دو کلمه اغلب به‌جای هم استفاده می‌شوند اما دو موقعیت کاملاً متفاوت‌اند:

  1. بازسازی (Rebuild) فرایندی روتین است. یک دیسک خراب شده، آرایه هنوز کار می‌کند، شما دیسک را تعویض می‌کنید و کنترلر اطلاعات را از روی دیسک‌های باقی‌مانده بازمی‌سازد. این کار خودکار و کم‌ریسک است.
  2. بازیابی (Recovery) یک عملیات بحرانی است. آرایه از کار افتاده و اطلاعات دیگر مستقیماً در دسترس نیست. اینجا هدف، نجات داده است نه بازگرداندن افزونگی. ریسک بالاست و هر اشتباه می‌تواند نهایی باشد.

اگر سرور شما بالا می‌آید و اطلاعات را می‌بینید، شما در وضعیت اول هستید — نفس بکشید.

راهنمای مدیریت بحران RAID

تحمل خطا در سطوح مختلف RAID

بدانید آرایه شما چند دیسک را می‌تواند از دست بدهد:

سطح RAID حداکثر دیسک قابل از دست رفتن وضعیت
RAID 0 صفر خرابی یک دیسک یعنی از دست رفتن کل اطلاعات
RAID 1 ۱ دیسک از هر جفت آینه، یکی
RAID 5 ۱ دیسک دومی یعنی خرابی کامل آرایه
RAID 6 ۲ دیسک سومی یعنی خرابی کامل
RAID 10 ۱ دیسک از هر جفت اگر دو دیسک از یک جفت بروند، آرایه می‌رود
RAID 50 ۱ دیسک از هر گروه

نکته‌ای که خیلی‌ها دیر می‌فهمند: در RAID 10 اگر شانس با شما یار باشد ممکن است چند دیسک از کار بیفتد و آرایه سالم بماند، اما اگر دو دیسک از یک جفت خراب شوند، همان دو دیسک کافی است تا همه‌چیز از بین برود.

وضعیت تخریب‌شده: مسیر درست

اگر یک دیسک خراب شده و آرایه هنوز کار می‌کند، ترتیب زیر را دقیقاً رعایت کنید.

۱. اول بکاپ، بعد هر کار دیگر

این مهم‌ترین مرحله است و اغلب نادیده گرفته می‌شود.

آرایه تخریب‌شده هیچ افزونگی ندارد. اگر در فاصله‌ی بین الان و پایان بازسازی، دیسک دیگری خراب شود، تمام اطلاعات از دست می‌رود.

بدتر اینکه بازسازی خودش پرخطرترین لحظه‌ی عمر آرایه است: در حین Rebuild، کنترلر تمام سطح تمام دیسک‌های باقی‌مانده را از ابتدا تا انتها می‌خواند. اگر روی یکی از آن‌ها سکتور معیوبی وجود داشته باشد که تا حالا به آن دست نخورده بود، دقیقاً همان‌جا خودش را نشان می‌دهد.

دیسک‌های یک آرایه معمولاً هم‌سن هستند و در شرایط یکسان کار کرده‌اند. اگر یکی خراب شده، بقیه هم در آستانه‌اند.

پس: پیش از شروع بازسازی بکاپ بگیرید، حتی اگر بکاپ قبلی دارید.

۲. دیسک معیوب را دقیقاً شناسایی کنید

از لاگ iLO (بخش Integrated Management Log) یا از ابزار Smart Storage Administrator، شماره پورت، باکس و بی دیسک معیوب را پیدا کنید. سپس با قابلیت Identify چراغ همان دیسک را روشن کنید تا از نظر فیزیکی مطمئن شوید.

بر اساس حدس دیسک را بیرون نکشید. در یک آرایه تخریب‌شده، کشیدن دیسک سالم به‌جای دیسک خراب، آرایه را کاملاً از کار می‌اندازد.

۳. دیسک جایگزین مناسب

ظرفیت باید برابر یا بیشتر از دیسک قبلی باشد، نوع رابط (SAS یا SATA) و فرم‌فاکتور یکسان، و کدی سازگار با نسل سرور. کدی سرورهای Gen8، Gen9 و Gen10 با هم فرق دارند.

۴. تعویض و شروع بازسازی

دیسک‌های Hot-Plug را بدون خاموش کردن سرور می‌توان تعویض کرد. بازسازی معمولاً خودکار شروع می‌شود.

اگر Hot Spare تعریف کرده باشید، بازسازی بلافاصله پس از خرابی و بدون دخالت شما شروع شده است.

۵. در حین بازسازی

  • سرور را ری‌استارت نکنید
  • هیچ دیسک دیگری را جابه‌جا نکنید
  • تا حد امکان بار کاری سنگین اجرا نکنید
  • پیشرفت را در SSA یا iLO دنبال کنید

مدت زمان: بسته به ظرفیت دیسک، سطح RAID و بار سرور، از چند ساعت تا بیش از یک روز. یک آرایه با دیسک‌های چند ترابایتی ممکن است بیش از ۲۴ ساعت طول بکشد.

تنظیم اولویت بازسازی: در Smart Storage Administrator می‌توانید اولویت Rebuild را تغییر دهید. اولویت بالا بازسازی را سریع‌تر می‌کند اما کارایی سرور را کاهش می‌دهد. اولویت پایین سرور را روان نگه می‌دارد اما پنجره‌ی خطر را طولانی‌تر می‌کند.

در آرایه‌ای که افزونگی ندارد، معمولاً بهتر است اولویت را بالا بگذارید و هرچه زودتر از این وضعیت خارج شوید.

وقتی آرایه از کار افتاده:

اگر بیش از حد تحمل آرایه دیسک از دست رفته و درایو منطقی در دسترس نیست، وارد وضعیت بحرانی شده‌اید.

اول: متوقف شوید

سرور را روشن نکنید و ری‌استارت نکنید. هر بوت اضافه، ریسک اضافه است.

هیچ گزینه‌ای را در صفحه‌ی خطای هنگام بوت تأیید نکنید تا وقتی که دقیقاً بدانید آن گزینه چه می‌کند. برخی از این گزینه‌ها آرایه را از نو می‌سازند و این یعنی پاک شدن دائمی اطلاعات.

چرا گاهی «خرابی» واقعی نیست

در بخش قابل توجهی از موارد، دیسک‌ها واقعاً خراب نشده‌اند. کنترلر آن‌ها را از آرایه خارج کرده اما خود دیسک‌ها سالم‌اند. علت‌های رایج:

  • قطعی برق ناگهانی در حین نوشتن
  • کابل SAS شل یا بک‌پلین معیوب — چند دیسک همزمان ناپدید می‌شوند
  • خرابی کنترلر RAID — دیسک‌ها سالم‌اند اما آرایه خوانده نمی‌شود
  • خرابی باتری یا ماژول کش کنترلر
  • بیرون کشیدن اشتباهی دیسک توسط کاربر
  • دمای بالا که باعث خروج موقت چند دیسک شده

اگر چند دیسک همزمان از کار افتاده‌اند، احتمال اینکه واقعاً هر دو خراب شده باشند کم است. معمولاً یک عامل مشترک وجود دارد — کابل، بک‌پلین، کنترلر یا برق.

این خبر خوبی است: در چنین حالتی شانس بازگرداندن آرایه بالاست، اما فقط اگر اقدام اشتباهی انجام نداده باشید.

چه کاری می‌توانید بکنید:

  1. اتصالات فیزیکی را بررسی کنید. کابل‌های SAS بین کنترلر و بک‌پلین را چک کنید که محکم نشسته باشند. اگر اخیراً سرور جابه‌جا شده یا داخل شاسی کار کرده‌اید، این محتمل‌ترین علت است.
  2. لاگ iLO را بخوانید. ترتیب زمانی رویدادها را ببینید: کدام دیسک اول از کار افتاد و چه فاصله‌ای تا دیسک بعدی بود؟ اگر همه در یک ثانیه رخ داده، مشکل از دیسک‌ها نیست.
  3. وضعیت را مستند کنید. از صفحه‌ی خطا، از لاگ iLO و از وضعیت SSA عکس بگیرید. موقعیت فیزیکی هر دیسک را یادداشت کنید. این اطلاعات برای متخصص حیاتی است.
  4. در ابزار SSA فقط نگاه کنید، تغییر ندهید. ببینید کنترلر چه وضعیتی برای هر دیسک گزارش می‌کند.

چه زمانی سراغ متخصص بروید

اگر اطلاعات روی این سرور برایتان ارزش دارد و بکاپ سالم و به‌روز ندارید، همین‌جا متوقف شوید و با متخصص تماس بگیرید.

عملیات‌هایی مثل فعال‌سازی مجدد دیسک خارج‌شده، بازسازی متادیتای آرایه یا کلون‌گیری از دیسک‌ها، اگر درست انجام شوند می‌توانند همه‌چیز را برگردانند و اگر اشتباه انجام شوند، شانس بازیابی را برای همیشه از بین می‌برند.

هزینه‌ی مشاوره در برابر ارزش اطلاعات از دست رفته، معمولاً ناچیز است.

بازسازی کامل نمی‌شود یا شکست می‌خورد

اگر Rebuild شروع می‌شود اما در درصد مشخصی متوقف می‌شود یا خطا می‌دهد:

  1. سکتور معیوب روی دیسک دیگر. رایج‌ترین علت. کنترلر در حین خواندن به بخشی برخورده که قابل خواندن نیست. این یعنی دیسک دومی هم مشکل دارد.
  2. دیسک جایگزین معیوب. دیسک جدید را در بی دیگری تست کنید.
  3. ظرفیت ناکافی. دیسک جایگزین حتی چند مگابایت کوچک‌تر باشد، بازسازی انجام نمی‌شود.
  4. فریمور ناسازگار. فریمور کنترلر یا دیسک را بررسی کنید.
  5. مشکل بک‌پلین یا کابل. اگر بازسازی همیشه در همان نقطه متوقف می‌شود اما دیسک‌ها سالم به نظر می‌رسند.

اگر بازسازی مکرراً شکست می‌خورد، آن را دوباره و دوباره اجرا نکنید. هر تلاش ناموفق، فشار بیشتری به دیسک‌های باقی‌مانده وارد می‌کند. متوقف شوید و علت را پیدا کنید.

پیشگیری: کارهایی که بحران بعدی را جلوگیری می‌کنند

  1. Hot Spare تعریف کنید. یک دیسک یدک آنلاین باعث می‌شود بازسازی بلافاصله پس از خرابی شروع شود، بدون اینکه منتظر حضور شما بماند. پنجره‌ی بی‌افزونگی از چند روز به چند ساعت کاهش می‌یابد.
  2. هشدارهای iLO را فعال کنید. ارسال ایمیل هنگام خطا. خرابی دیسک معمولاً هفته‌ها قبل علائم می‌دهد؛ فقط باید کسی آن‌ها را ببیند.
  3. برای آرایه‌های بزرگ به RAID ۶ فکر کنید. با دیسک‌های چند ترابایتی، مدت بازسازی طولانی است و احتمال خرابی دیسک دوم در همان بازه واقعی است. RAID ۶ تحمل دو خرابی می‌دهد.
  4. بکاپ منظم و آزمایش‌شده داشته باشید. RAID در برابر خرابی سخت‌افزار محافظت می‌کند، نه در برابر حذف اشتباهی فایل، باج‌افزار، خرابی کنترلر یا خطای انسانی. بکاپی که هرگز بازیابی‌اش را تست نکرده‌اید، بکاپ نیست.
  5. وضعیت آرایه را دوره‌ای بررسی کنید. ماهی یک بار سری به SSA و لاگ iLO بزنید.
  6. دما را رصد کنید. دمای بالا مستقیم‌ترین عامل کوتاه شدن عمر دیسک است.
  7. فریمور را به‌روز نگه دارید. بسیاری از باگ‌های شناخته‌شده‌ی کنترلر و دیسک با آپدیت برطرف می‌شوند.

سؤالات متداول

آرایه RAID من از کار افتاده، اول چه کار کنم؟ هیچ کاری نکنید. سرور را ری‌استارت نکنید، دیسک‌ها را جابه‌جا نکنید، آرایه را دوباره نسازید و هیچ گزینه‌ای را در صفحه‌ی خطای بوت تأیید نکنید. وضعیت را از عکس و لاگ iLO مستند کنید و اگر بکاپ به‌روز ندارید، با متخصص تماس بگیرید.

تفاوت Rebuild و Recovery چیست؟ بازسازی (Rebuild) فرایندی روتین است: یک دیسک خراب شده، آرایه هنوز کار می‌کند و پس از تعویض دیسک، اطلاعات از روی دیسک‌های باقی‌مانده بازسازی می‌شود. بازیابی (Recovery) وقتی است که آرایه از کار افتاده و اطلاعات در دسترس نیست — عملیاتی بحرانی با ریسک بالا.

در RAID ۵ دو دیسک خراب شده، اطلاعات از بین رفته؟ لزوماً نه. در بسیاری از موارد دیسک‌ها واقعاً خراب نشده‌اند و یک عامل مشترک مثل کابل شل، بک‌پلین معیوب، خرابی کنترلر یا قطعی برق باعث خروجشان از آرایه شده است. اما شانس بازیابی فقط تا وقتی باقی است که اقدام اشتباهی انجام نداده باشید.

آیا در حین بازسازی می‌توانم از سرور استفاده کنم؟ از نظر فنی بله، اما توصیه می‌شود بار کاری را سبک نگه دارید. بار سنگین هم بازسازی را کند می‌کند و هم فشار بیشتری به دیسک‌های باقی‌مانده وارد می‌کند.

بازسازی چقدر طول می‌کشد؟ از چند ساعت تا بیش از یک روز، بسته به ظرفیت دیسک، سطح RAID، تنظیم اولویت بازسازی و بار کاری سرور. آرایه‌هایی با دیسک‌های چند ترابایتی معمولاً بیش از ۲۴ ساعت طول می‌کشند.

چرا می‌گویند بازسازی خودش خطرناک است؟ چون در حین Rebuild کنترلر تمام سطح تمام دیسک‌های باقی‌مانده را می‌خواند. اگر سکتور معیوبی وجود داشته باشد که تا حالا استفاده نشده بود، همان‌جا خودش را نشان می‌دهد. دیسک‌های یک آرایه معمولاً هم‌سن‌اند، پس اگر یکی خراب شده بقیه هم در معرض‌اند. به همین دلیل بکاپ گرفتن پیش از شروع بازسازی ضروری است.

بازسازی در وسط کار متوقف می‌شود، چه کنم؟ معمولاً یعنی روی یکی از دیسک‌های باقی‌مانده سکتور معیوب وجود دارد. آن را بارها اجرا نکنید — هر تلاش ناموفق فشار بیشتری وارد می‌کند. علت را پیدا کنید: سلامت دیسک جایگزین، ظرفیت آن، کابل و بک‌پلین، و نسخه فریمور.

آیا RAID جای بکاپ را می‌گیرد؟ خیر. RAID فقط در برابر خرابی سخت‌افزاری دیسک محافظت می‌کند. در برابر حذف اشتباهی، باج‌افزار، خرابی کنترلر یا خرابی همزمان چند دیسک هیچ محافظتی ندارد.

Hot Spare چیست و ارزشش را دارد؟ دیسک یدکی است که در سرور نصب و به آرایه اختصاص داده می‌شود اما استفاده نمی‌شود. به‌محض خرابی یک دیسک، بازسازی خودکار روی آن شروع می‌شود. این کار پنجره‌ی زمانی که آرایه بدون افزونگی است را به‌شدت کوتاه می‌کند و یکی از مؤثرترین اقدامات پیشگیرانه است.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *