اگر همین الان آرایه شما مشکل دارد، این را اول بخوانید
در بحران RAID، کاری که نمیکنید مهمتر از کاری است که میکنید. بیشتر مواردی که اطلاعات برای همیشه از دست میرود، به خاطر خود خرابی نیست — به خاطر اقدامات عجولانهی بعد از آن است.
تا مشخص شدن وضعیت، این کارها را انجام ندهید
| کار | چرا خطرناک است |
|---|---|
| ریاستارت پشت سر هم سرور | هر بوت میتواند وضعیت آرایه را بدتر کند |
| بیرون کشیدن و جابهجا کردن هاردها | ترتیب دیسکها در آرایه حیاتی است |
| ساختن دوباره آرایه (Create/Recreate) | اطلاعات را برای همیشه پاک میکند |
| اجرای Initialize یا Format | اطلاعات را برای همیشه پاک میکند |
| اجرای chkdsk یا fsck روی آرایه تخریبشده | میتواند خرابی را گسترش دهد |
| شروع Rebuild بدون بکاپ | اگر دیسک دومی خراب شود، همهچیز از دست میرود |
اول وضعیت را تشخیص دهید
| وضعیت | نشانه | معنی |
|---|---|---|
| تخریبشده (Degraded) | یک هارد کهربایی، سرور بالا میآید، اطلاعات در دسترس است | آرایه کار میکند اما افزونگی ندارد |
| خراب (Failed) | چند هارد کهربایی، درایو منطقی در دسترس نیست | آرایه از کار افتاده |
| در حال بازسازی | چراغ آبی چشمکزن | در جریان است، دست نزنید |
- اگر وضعیت تخریبشده است: فرصت دارید. اول بکاپ بگیرید، بعد هارد را تعویض کنید.
- اگر وضعیت خراب است: متوقف شوید. بخش «وقتی آرایه از کار افتاده» را بخوانید.
تفاوت Rebuild و Recovery
این دو کلمه اغلب بهجای هم استفاده میشوند اما دو موقعیت کاملاً متفاوتاند:
- بازسازی (Rebuild) فرایندی روتین است. یک دیسک خراب شده، آرایه هنوز کار میکند، شما دیسک را تعویض میکنید و کنترلر اطلاعات را از روی دیسکهای باقیمانده بازمیسازد. این کار خودکار و کمریسک است.
- بازیابی (Recovery) یک عملیات بحرانی است. آرایه از کار افتاده و اطلاعات دیگر مستقیماً در دسترس نیست. اینجا هدف، نجات داده است نه بازگرداندن افزونگی. ریسک بالاست و هر اشتباه میتواند نهایی باشد.
اگر سرور شما بالا میآید و اطلاعات را میبینید، شما در وضعیت اول هستید — نفس بکشید.

تحمل خطا در سطوح مختلف RAID
بدانید آرایه شما چند دیسک را میتواند از دست بدهد:
| سطح RAID | حداکثر دیسک قابل از دست رفتن | وضعیت |
|---|---|---|
| RAID 0 | صفر | خرابی یک دیسک یعنی از دست رفتن کل اطلاعات |
| RAID 1 | ۱ دیسک | از هر جفت آینه، یکی |
| RAID 5 | ۱ دیسک | دومی یعنی خرابی کامل آرایه |
| RAID 6 | ۲ دیسک | سومی یعنی خرابی کامل |
| RAID 10 | ۱ دیسک از هر جفت | اگر دو دیسک از یک جفت بروند، آرایه میرود |
| RAID 50 | ۱ دیسک از هر گروه | — |
نکتهای که خیلیها دیر میفهمند: در RAID 10 اگر شانس با شما یار باشد ممکن است چند دیسک از کار بیفتد و آرایه سالم بماند، اما اگر دو دیسک از یک جفت خراب شوند، همان دو دیسک کافی است تا همهچیز از بین برود.
وضعیت تخریبشده: مسیر درست
اگر یک دیسک خراب شده و آرایه هنوز کار میکند، ترتیب زیر را دقیقاً رعایت کنید.
۱. اول بکاپ، بعد هر کار دیگر
این مهمترین مرحله است و اغلب نادیده گرفته میشود.
آرایه تخریبشده هیچ افزونگی ندارد. اگر در فاصلهی بین الان و پایان بازسازی، دیسک دیگری خراب شود، تمام اطلاعات از دست میرود.
بدتر اینکه بازسازی خودش پرخطرترین لحظهی عمر آرایه است: در حین Rebuild، کنترلر تمام سطح تمام دیسکهای باقیمانده را از ابتدا تا انتها میخواند. اگر روی یکی از آنها سکتور معیوبی وجود داشته باشد که تا حالا به آن دست نخورده بود، دقیقاً همانجا خودش را نشان میدهد.
دیسکهای یک آرایه معمولاً همسن هستند و در شرایط یکسان کار کردهاند. اگر یکی خراب شده، بقیه هم در آستانهاند.
پس: پیش از شروع بازسازی بکاپ بگیرید، حتی اگر بکاپ قبلی دارید.
۲. دیسک معیوب را دقیقاً شناسایی کنید
از لاگ iLO (بخش Integrated Management Log) یا از ابزار Smart Storage Administrator، شماره پورت، باکس و بی دیسک معیوب را پیدا کنید. سپس با قابلیت Identify چراغ همان دیسک را روشن کنید تا از نظر فیزیکی مطمئن شوید.
بر اساس حدس دیسک را بیرون نکشید. در یک آرایه تخریبشده، کشیدن دیسک سالم بهجای دیسک خراب، آرایه را کاملاً از کار میاندازد.
۳. دیسک جایگزین مناسب
ظرفیت باید برابر یا بیشتر از دیسک قبلی باشد، نوع رابط (SAS یا SATA) و فرمفاکتور یکسان، و کدی سازگار با نسل سرور. کدی سرورهای Gen8، Gen9 و Gen10 با هم فرق دارند.
۴. تعویض و شروع بازسازی
دیسکهای Hot-Plug را بدون خاموش کردن سرور میتوان تعویض کرد. بازسازی معمولاً خودکار شروع میشود.
اگر Hot Spare تعریف کرده باشید، بازسازی بلافاصله پس از خرابی و بدون دخالت شما شروع شده است.
۵. در حین بازسازی
- سرور را ریاستارت نکنید
- هیچ دیسک دیگری را جابهجا نکنید
- تا حد امکان بار کاری سنگین اجرا نکنید
- پیشرفت را در SSA یا iLO دنبال کنید
مدت زمان: بسته به ظرفیت دیسک، سطح RAID و بار سرور، از چند ساعت تا بیش از یک روز. یک آرایه با دیسکهای چند ترابایتی ممکن است بیش از ۲۴ ساعت طول بکشد.
تنظیم اولویت بازسازی: در Smart Storage Administrator میتوانید اولویت Rebuild را تغییر دهید. اولویت بالا بازسازی را سریعتر میکند اما کارایی سرور را کاهش میدهد. اولویت پایین سرور را روان نگه میدارد اما پنجرهی خطر را طولانیتر میکند.
در آرایهای که افزونگی ندارد، معمولاً بهتر است اولویت را بالا بگذارید و هرچه زودتر از این وضعیت خارج شوید.
وقتی آرایه از کار افتاده:
اگر بیش از حد تحمل آرایه دیسک از دست رفته و درایو منطقی در دسترس نیست، وارد وضعیت بحرانی شدهاید.
اول: متوقف شوید
سرور را روشن نکنید و ریاستارت نکنید. هر بوت اضافه، ریسک اضافه است.
هیچ گزینهای را در صفحهی خطای هنگام بوت تأیید نکنید تا وقتی که دقیقاً بدانید آن گزینه چه میکند. برخی از این گزینهها آرایه را از نو میسازند و این یعنی پاک شدن دائمی اطلاعات.
چرا گاهی «خرابی» واقعی نیست
در بخش قابل توجهی از موارد، دیسکها واقعاً خراب نشدهاند. کنترلر آنها را از آرایه خارج کرده اما خود دیسکها سالماند. علتهای رایج:
- قطعی برق ناگهانی در حین نوشتن
- کابل SAS شل یا بکپلین معیوب — چند دیسک همزمان ناپدید میشوند
- خرابی کنترلر RAID — دیسکها سالماند اما آرایه خوانده نمیشود
- خرابی باتری یا ماژول کش کنترلر
- بیرون کشیدن اشتباهی دیسک توسط کاربر
- دمای بالا که باعث خروج موقت چند دیسک شده
اگر چند دیسک همزمان از کار افتادهاند، احتمال اینکه واقعاً هر دو خراب شده باشند کم است. معمولاً یک عامل مشترک وجود دارد — کابل، بکپلین، کنترلر یا برق.
این خبر خوبی است: در چنین حالتی شانس بازگرداندن آرایه بالاست، اما فقط اگر اقدام اشتباهی انجام نداده باشید.
چه کاری میتوانید بکنید:
- اتصالات فیزیکی را بررسی کنید. کابلهای SAS بین کنترلر و بکپلین را چک کنید که محکم نشسته باشند. اگر اخیراً سرور جابهجا شده یا داخل شاسی کار کردهاید، این محتملترین علت است.
- لاگ iLO را بخوانید. ترتیب زمانی رویدادها را ببینید: کدام دیسک اول از کار افتاد و چه فاصلهای تا دیسک بعدی بود؟ اگر همه در یک ثانیه رخ داده، مشکل از دیسکها نیست.
- وضعیت را مستند کنید. از صفحهی خطا، از لاگ iLO و از وضعیت SSA عکس بگیرید. موقعیت فیزیکی هر دیسک را یادداشت کنید. این اطلاعات برای متخصص حیاتی است.
- در ابزار SSA فقط نگاه کنید، تغییر ندهید. ببینید کنترلر چه وضعیتی برای هر دیسک گزارش میکند.
چه زمانی سراغ متخصص بروید
اگر اطلاعات روی این سرور برایتان ارزش دارد و بکاپ سالم و بهروز ندارید، همینجا متوقف شوید و با متخصص تماس بگیرید.
عملیاتهایی مثل فعالسازی مجدد دیسک خارجشده، بازسازی متادیتای آرایه یا کلونگیری از دیسکها، اگر درست انجام شوند میتوانند همهچیز را برگردانند و اگر اشتباه انجام شوند، شانس بازیابی را برای همیشه از بین میبرند.
هزینهی مشاوره در برابر ارزش اطلاعات از دست رفته، معمولاً ناچیز است.
بازسازی کامل نمیشود یا شکست میخورد
اگر Rebuild شروع میشود اما در درصد مشخصی متوقف میشود یا خطا میدهد:
- سکتور معیوب روی دیسک دیگر. رایجترین علت. کنترلر در حین خواندن به بخشی برخورده که قابل خواندن نیست. این یعنی دیسک دومی هم مشکل دارد.
- دیسک جایگزین معیوب. دیسک جدید را در بی دیگری تست کنید.
- ظرفیت ناکافی. دیسک جایگزین حتی چند مگابایت کوچکتر باشد، بازسازی انجام نمیشود.
- فریمور ناسازگار. فریمور کنترلر یا دیسک را بررسی کنید.
- مشکل بکپلین یا کابل. اگر بازسازی همیشه در همان نقطه متوقف میشود اما دیسکها سالم به نظر میرسند.
اگر بازسازی مکرراً شکست میخورد، آن را دوباره و دوباره اجرا نکنید. هر تلاش ناموفق، فشار بیشتری به دیسکهای باقیمانده وارد میکند. متوقف شوید و علت را پیدا کنید.
پیشگیری: کارهایی که بحران بعدی را جلوگیری میکنند
- Hot Spare تعریف کنید. یک دیسک یدک آنلاین باعث میشود بازسازی بلافاصله پس از خرابی شروع شود، بدون اینکه منتظر حضور شما بماند. پنجرهی بیافزونگی از چند روز به چند ساعت کاهش مییابد.
- هشدارهای iLO را فعال کنید. ارسال ایمیل هنگام خطا. خرابی دیسک معمولاً هفتهها قبل علائم میدهد؛ فقط باید کسی آنها را ببیند.
- برای آرایههای بزرگ به RAID ۶ فکر کنید. با دیسکهای چند ترابایتی، مدت بازسازی طولانی است و احتمال خرابی دیسک دوم در همان بازه واقعی است. RAID ۶ تحمل دو خرابی میدهد.
- بکاپ منظم و آزمایششده داشته باشید. RAID در برابر خرابی سختافزار محافظت میکند، نه در برابر حذف اشتباهی فایل، باجافزار، خرابی کنترلر یا خطای انسانی. بکاپی که هرگز بازیابیاش را تست نکردهاید، بکاپ نیست.
- وضعیت آرایه را دورهای بررسی کنید. ماهی یک بار سری به SSA و لاگ iLO بزنید.
- دما را رصد کنید. دمای بالا مستقیمترین عامل کوتاه شدن عمر دیسک است.
- فریمور را بهروز نگه دارید. بسیاری از باگهای شناختهشدهی کنترلر و دیسک با آپدیت برطرف میشوند.
سؤالات متداول
آرایه RAID من از کار افتاده، اول چه کار کنم؟ هیچ کاری نکنید. سرور را ریاستارت نکنید، دیسکها را جابهجا نکنید، آرایه را دوباره نسازید و هیچ گزینهای را در صفحهی خطای بوت تأیید نکنید. وضعیت را از عکس و لاگ iLO مستند کنید و اگر بکاپ بهروز ندارید، با متخصص تماس بگیرید.
تفاوت Rebuild و Recovery چیست؟ بازسازی (Rebuild) فرایندی روتین است: یک دیسک خراب شده، آرایه هنوز کار میکند و پس از تعویض دیسک، اطلاعات از روی دیسکهای باقیمانده بازسازی میشود. بازیابی (Recovery) وقتی است که آرایه از کار افتاده و اطلاعات در دسترس نیست — عملیاتی بحرانی با ریسک بالا.
در RAID ۵ دو دیسک خراب شده، اطلاعات از بین رفته؟ لزوماً نه. در بسیاری از موارد دیسکها واقعاً خراب نشدهاند و یک عامل مشترک مثل کابل شل، بکپلین معیوب، خرابی کنترلر یا قطعی برق باعث خروجشان از آرایه شده است. اما شانس بازیابی فقط تا وقتی باقی است که اقدام اشتباهی انجام نداده باشید.
آیا در حین بازسازی میتوانم از سرور استفاده کنم؟ از نظر فنی بله، اما توصیه میشود بار کاری را سبک نگه دارید. بار سنگین هم بازسازی را کند میکند و هم فشار بیشتری به دیسکهای باقیمانده وارد میکند.
بازسازی چقدر طول میکشد؟ از چند ساعت تا بیش از یک روز، بسته به ظرفیت دیسک، سطح RAID، تنظیم اولویت بازسازی و بار کاری سرور. آرایههایی با دیسکهای چند ترابایتی معمولاً بیش از ۲۴ ساعت طول میکشند.
چرا میگویند بازسازی خودش خطرناک است؟ چون در حین Rebuild کنترلر تمام سطح تمام دیسکهای باقیمانده را میخواند. اگر سکتور معیوبی وجود داشته باشد که تا حالا استفاده نشده بود، همانجا خودش را نشان میدهد. دیسکهای یک آرایه معمولاً همسناند، پس اگر یکی خراب شده بقیه هم در معرضاند. به همین دلیل بکاپ گرفتن پیش از شروع بازسازی ضروری است.
بازسازی در وسط کار متوقف میشود، چه کنم؟ معمولاً یعنی روی یکی از دیسکهای باقیمانده سکتور معیوب وجود دارد. آن را بارها اجرا نکنید — هر تلاش ناموفق فشار بیشتری وارد میکند. علت را پیدا کنید: سلامت دیسک جایگزین، ظرفیت آن، کابل و بکپلین، و نسخه فریمور.
آیا RAID جای بکاپ را میگیرد؟ خیر. RAID فقط در برابر خرابی سختافزاری دیسک محافظت میکند. در برابر حذف اشتباهی، باجافزار، خرابی کنترلر یا خرابی همزمان چند دیسک هیچ محافظتی ندارد.
Hot Spare چیست و ارزشش را دارد؟ دیسک یدکی است که در سرور نصب و به آرایه اختصاص داده میشود اما استفاده نمیشود. بهمحض خرابی یک دیسک، بازسازی خودکار روی آن شروع میشود. این کار پنجرهی زمانی که آرایه بدون افزونگی است را بهشدت کوتاه میکند و یکی از مؤثرترین اقدامات پیشگیرانه است.










