بلاگ

تشخیص و رفع خرابی هارد سرور HP

راهنمای کامل تشخیص و رفع خرابی هارد سرور

اگر همین الان مشکل دارید

قبل از هر کاری، این جدول را ببینید:

وضعیتی که می‌بینید معنی اقدام فوری
چراغ کهربایی ثابت روی یک هارد هارد خراب شده هارد را تعویض کنید
چراغ کهربایی چشمک‌زن (یک بار در ثانیه) هشدار خرابی قریب‌الوقوع از اطلاعات بکاپ بگیرید، هارد را تعویض کنید
چراغ آبی چشمک‌زن هارد در حال بازسازی (Rebuild) دست نزنید تا کامل شود
خطای 1720 هنگام روشن شدن هشدار SMART هارد به‌زودی خراب می‌شود
خطای 1779 آرایه ناقص است دیسک از دست رفته را برگردانید
خطای 1786 نیاز به بازسازی مراحل بازیابی را دنبال کنید
دو هارد همزمان کهربایی در RAID 5 آرایه از کار افتاده هیچ کاری نکنید و مشاوره بگیرید

مهم‌ترین قانون: اگر بیش از یک هارد در یک آرایه خراب شده، سرور را ری‌استارت نکنید و هیچ هاردی را جابه‌جا نکنید. هر اقدام اشتباه در این وضعیت می‌تواند بازیابی اطلاعات هارد سرور را غیرممکن کند.

معنی چراغ‌های هارد در سرورهای HP ProLiant

هر هارد Hot-Plug در سرورهای اچ پی دو چراغ دارد. ترکیب این دو، وضعیت هارد را نشان می‌دهد.

وضعیت چراغ معنی
سبز ثابت هارد سالم و در حال کار
سبز چشمک‌زن نامنظم فعالیت خواندن و نوشتن، طبیعی است
آبی ثابت هارد توسط نرم‌افزار شناسایی شده (حالت Identify)
آبی چشمک‌زن در حال بازسازی یا انتقال داده
کهربایی ثابت هارد خراب است و از آرایه خارج شده
کهربایی چشمک‌زن هشدار خرابی قریب‌الوقوع (Predictive Failure)
سبز و کهربایی متناوب هارد در حال بازسازی است
خاموش کامل هارد شناسایی نشده، یا در حالت آماده‌باش

نکته مهم: چراغ کهربایی چشمک‌زن با چراغ کهربایی ثابت فرق اساسی دارد. چشمک‌زن یعنی هارد هنوز کار می‌کند اما در آستانه خرابی است — این بهترین فرصت شماست برای تعویض بدون ریسک. ثابت یعنی کار از کار گذشته و هارد از آرایه خارج شده است.

کدهای خطای هنگام روشن شدن سرور (POST)

اگر هنگام بوت سرور با کد خطا مواجه شدید، این جدول معنی آن را نشان می‌دهد:

کد معنی وخامت
1720 هشدار SMART — هارد پیش‌بینی خرابی می‌کند متوسط: هنوز کار می‌کند
1779 آرایه شناسایی شد اما یک یا چند دیسک غایب است بالا
1783 خطای کنترلر دیسک بالا
1784 خرابی دیسک در آرایه بالا
1785 آرایه به‌درستی پیکربندی نشده بالا
1786 آرایه نیاز به بازسازی دارد متوسط
1787 آرایه در حالت تخریب‌شده کار می‌کند بالا
1789 دیسک پاسخ نمی‌دهد بالا

خطای ۱۷۲۰ چه می‌گوید:

این پرتکرارترین خطایی است که مدیران سرور با آن روبه‌رو می‌شوند و اغلب اشتباه فهمیده می‌شود.

خطای ۱۷۲۰ یعنی هارد هنوز کار می‌کند، اما سیستم SMART داخلی آن گزارش داده که در آستانه خرابی است — مثلاً تعداد سکتورهای معیوب از حد مجاز گذشته یا خطاهای خواندن افزایش یافته.

این خطا را نادیده نگیرید. هارد ممکن است چند هفته دیگر کار کند یا فردا از کار بیفتد. برنامه تعویض را همین حالا شروع کنید، در حالی که آرایه هنوز سالم است و بازسازی بدون ریسک انجام می‌شود.

خطای ۱۷۸۶ و بازسازی:

این خطا یعنی آرایه تشخیص داده که به بازسازی نیاز دارد. معمولاً پس از تعویض هارد یا پس از قطعی برق ناگهانی ظاهر می‌شود.

پیش از تأیید بازسازی، مطمئن شوید که هارد جایگزین سالم است و ظرفیت آن حداقل برابر با هارد قبلی است.

خواندن لاگ خطا در iLO:

سریع‌ترین راه فهمیدن اینکه دقیقاً چه اتفاقی افتاده، بررسی لاگ iLO است. برای این کار نیازی به خاموش کردن یا حتی دسترسی فیزیکی به سرور ندارید.

مراحل:

  1. با مرورگر به آدرس IP کارت iLO وارد شوید.
  2. وارد بخش Information و سپس Integrated Management Log شوید.
  3. رویدادها را بر اساس تاریخ مرتب کنید و به دنبال موارد با شدت Critical یا Caution بگردید.

پیام‌هایی که باید دنبالشان بگردید:

  • پیام‌هایی درباره خرابی درایو فیزیکی همراه با شماره پورت و باکس و بی
  • هشدارهای مربوط به پیش‌بینی خرابی (Predictive Failure)
  • رویدادهای مربوط به تخریب یا از کار افتادن درایو منطقی
  • خطاهای مربوط به باتری یا خازن ماژول کش کنترلر

لاگ iLO دقیقاً به شما می‌گوید کدام هارد در کدام موقعیت فیزیکی مشکل دارد. این اطلاعات را یادداشت کنید — موقع تعویض به آن نیاز دارید.

بررسی دقیق‌تر با Smart Storage Administrator

اگر می‌خواهید وضعیت کامل آرایه و سلامت تک‌تک دیسک‌ها را ببینید، ابزار HPE Smart Storage Administrator (نسخه‌های قدیمی‌تر: Array Configuration Utility) بهترین گزینه است.

این ابزار به سه صورت در دسترس است: نصب روی سیستم‌عامل، اجرا از طریق محیط Intelligent Provisioning هنگام بوت، یا از طریق ISO قابل بوت.

در این ابزار چه چیزهایی را بررسی کنید:

  • وضعیت هر درایو فیزیکی: OK، Predictive Failure یا Failed
  • وضعیت درایو منطقی: OK، Interim Recovery (تخریب‌شده) یا Failed
  • شمارنده‌های SMART: تعداد سکتورهای تخصیص‌یافته مجدد، خطاهای خواندن، ساعات کارکرد
  • دمای دیسک‌ها: دمای بالا عمر هارد را کوتاه می‌کند
  • وضعیت ماژول کش و باتری کنترلر

اگر یک دیسک وضعیت Predictive Failure دارد اما هنوز کار می‌کند، شما در بهترین موقعیت ممکن هستید: فرصت دارید بدون فشار زمانی و بدون ریسک، هارد را تعویض کنید.

مراحل صحیح تعویض هارد

ترتیب این مراحل مهم است. رعایت نکردنشان می‌تواند به از دست رفتن اطلاعات منجر شود.

۱. اول بکاپ بگیرید

حتی اگر RAID دارید. RAID جایگزین بکاپ نیست — RAID شما را در برابر خرابی یک دیسک محافظت می‌کند، نه در برابر خرابی همزمان چند دیسک، خطای انسانی، یا خرابی کنترلر.

اگر آرایه در وضعیت تخریب‌شده است، احتمال خرابی دیسک دوم در حین بازسازی وجود دارد. بکاپ گرفتن پیش از شروع بازسازی، مهم‌ترین کاری است که می‌توانید انجام دهید.

۲. هارد معیوب را دقیقاً شناسایی کنید

از لاگ iLO یا Smart Storage Administrator، شماره پورت، باکس و بی هارد معیوب را پیدا کنید. سپس با استفاده از قابلیت Identify، چراغ آن هارد را روشن کنید تا از نظر فیزیکی مطمئن شوید.

هرگز بر اساس حدس هارد را بیرون نکشید. کشیدن هارد سالم از یک آرایه تخریب‌شده، آرایه را کاملاً از کار می‌اندازد.

۳. هارد جایگزین مناسب انتخاب کنید

ویژگی الزام
ظرفیت حداقل برابر با هارد قبلی، ترجیحاً یکسان
نوع رابط همان نوع (SAS یا SATA)
سرعت چرخش ترجیحاً یکسان
فرم‌فاکتور همان اندازه (۲.۵ یا ۳.۵ اینچ)
کدی کدی سازگار با نسل سرور

نکته مهم درباره کدی (Caddy): کدی سرورهای Gen8 با Gen9 و Gen10 فرق دارد. اگر هارد را بدون کدی می‌خرید، مطمئن شوید کدی موجود شما با نسل سرورتان سازگار است.

۴. هارد را تعویض کنید

هاردهای Hot-Plug را می‌توان بدون خاموش کردن سرور تعویض کرد. دستگیره را آزاد کنید، هارد را بیرون بکشید، چند ثانیه صبر کنید و هارد جدید را جا بزنید.

۵. بازسازی را زیر نظر بگیرید

بازسازی معمولاً به‌صورت خودکار شروع می‌شود. مدت زمان آن به ظرفیت هارد، سطح RAID و بار کاری سرور بستگی دارد — از چند ساعت تا بیش از یک روز.

در حین بازسازی:

  • سرور را ری‌استارت نکنید
  • هاردهای دیگر را جابه‌جا نکنید
  • تا حد امکان بار کاری سنگین روی سرور نگذارید
  • پیشرفت را در Smart Storage Administrator یا iLO دنبال کنید

وقتی هارد جدید شناسایی نمی‌شود

اگر هارد جایگزین را نصب کردید و سرور آن را نمی‌بیند، به ترتیب این موارد را بررسی کنید:

  1. نشستن فیزیکی هارد. هارد را بیرون بکشید و دوباره محکم جا بزنید. گاهی کانکتور به‌درستی درگیر نشده است.
  2. سلامت خود هارد جایگزین. هارد را در بی‌دیگری امتحان کنید. اگر آنجا هم شناسایی نشد، مشکل از خود هارد است.
  3. بک‌پلین. اگر یک بی‌مشخص هیچ هاردی را نمی‌شناسد اما بقیه بی‌ها کار می‌کنند، احتمالاً بک‌پلین یا کابل آن مشکل دارد.
  4. فریمور هارد. برخی هاردها با فریمور قدیمی روی کنترلرهای جدیدتر مشکل شناسایی دارند.
  5. سازگاری هارد. در سرورهای Gen8 و بالاتر، هاردهایی که فریمور اچ پی ندارند ممکن است پیام هشدار سازگاری بدهند یا اطلاعات سلامت کامل ارائه نکنند.

وقتی مشکل از خود هارد نیست

  • گاهی چند هارد همزمان خطا می‌دهند یا خطاها بی‌دلیل تکرار می‌شوند. در این حالت احتمال دارد مشکل از قطعه دیگری باشد:
  • بک‌پلین معیوب. اگر خطاها روی بی‌های مجاور و پشت سر هم رخ می‌دهند، بک‌پلین مظنون اصلی است.
  • کابل SAS شل یا معیوب. به‌خصوص پس از جابه‌جایی فیزیکی سرور یا کار کردن داخل شاسی.
  • کنترلر RAID. اگر تمام هاردها همزمان ناپدید شدند یا آرایه اصلاً شناسایی نمی‌شود، کنترلر را بررسی کنید.
  • باتری یا خازن ماژول کش. وقتی باتری کنترلر خراب می‌شود، کش نوشتن غیرفعال می‌شود. اطلاعات از بین نمی‌رود اما سرعت نوشتن به‌شدت افت می‌کند. اگر ناگهان سرور کند شده، این را بررسی کنید.
  • تغذیه ناپایدار. قطعی‌های مکرر برق یا پاور معیوب می‌تواند باعث خطاهای پراکنده و غیرقابل توضیح دیسک شود.
  • دمای بالا. اگر فن‌ها درست کار نمی‌کنند یا فیلتر هوا گرفته است، دمای دیسک‌ها بالا می‌رود و عمرشان به‌شدت کوتاه می‌شود.

پیشگیری: کاری که باید قبل از خرابی بکنید

  1. هشدارهای iLO را فعال کنید. iLO می‌تواند هنگام بروز خطا ایمیل بفرستد یا SNMP trap ارسال کند. این کار چند دقیقه وقت می‌برد و می‌تواند شما را از یک بحران نجات دهد.
  2. لاگ را به‌صورت دوره‌ای بررسی کنید. ماهی یک بار سری به IML و وضعیت آرایه بزنید. خرابی هارد معمولاً هفته‌ها قبل علائم می‌دهد.
  3. هارد یدکی داشته باشید. به‌خصوص در ایران که تأمین قطعه ممکن است زمان‌بر باشد. یک هارد یدکی در کشو، تفاوت بین چند ساعت و چند هفته توقف است.
  4. Hot Spare تعریف کنید. اگر بی‌خالی دارید، یک هارد را به‌عنوان یدک آنلاین تعریف کنید. در صورت خرابی، بازسازی خودکار و فوری شروع می‌شود بدون اینکه منتظر حضور شما بماند.
  5. فریمور را به‌روز نگه دارید. بسیاری از مشکلات شناخته‌شده دیسک با به‌روزرسانی فریمور کنترلر و هارد برطرف می‌شوند.
  6. دما را رصد کنید. دمای دیسک بالای حد مجاز، مستقیم‌ترین عامل کوتاه شدن عمر هارد است.

سؤالات متداول

چراغ کهربایی روی هارد سرور یعنی چه؟ چراغ کهربایی ثابت یعنی هارد خراب شده و از آرایه خارج شده است. چراغ کهربایی چشمک‌زن یعنی هارد هنوز کار می‌کند اما سیستم SMART پیش‌بینی خرابی کرده — در این حالت فرصت دارید بدون ریسک هارد را تعویض کنید.

خطای ۱۷۲۰ در سرور HP یعنی چه؟ این خطا یعنی هارد گزارش SMART مبنی بر احتمال خرابی داده است. هارد هنوز کار می‌کند اما باید هرچه زودتر تعویض شود. نادیده گرفتن این هشدار معمولاً به خرابی کامل منجر می‌شود.

آیا می‌توانم بدون خاموش کردن سرور هارد را عوض کنم؟ بله، اگر هارد از نوع Hot-Plug باشد و آرایه شما افزونگی داشته باشد (RAID ۱.۵، ۶.۱۰). در آرایه‌های بدون افزونگی مثل RAID 0، تعویض هارد به معنی از دست رفتن کل اطلاعات آرایه است.

بازسازی آرایه چقدر طول می‌کشد؟ بسته به ظرفیت هارد، سطح RAID و بار کاری سرور، از چند ساعت تا بیش از یک روز. در حین بازسازی سرور را ری‌استارت نکنید و هاردهای دیگر را جابه‌جا نکنید.

اگر دو هارد همزمان در RAID 5 خراب شوند چه کنم؟ هیچ کاری نکنید. سرور را ری‌استارت نکنید، هاردها را جابه‌جا نکنید و بازسازی را شروع نکنید. RAID ۵ فقط خرابی یک دیسک را تحمل می‌کند. در این وضعیت هر اقدام اشتباه می‌تواند بازیابی اطلاعات را غیرممکن کند. با متخصص تماس بگیرید.

آیا هارد معمولی کامپیوتر روی سرور کار می‌کند؟ از نظر فنی ممکن است شناسایی شود، اما توصیه نمی‌شود. هاردهای سروری برای کارکرد ۲۴ ساعته، تحمل لرزش در محیط چند دیسکی و رفتار صحیح در برابر خطا طراحی شده‌اند. همچنین در سرورهای Gen8 و بالاتر، هاردهای بدون فریمور اچ پی ممکن است اطلاعات سلامت کامل ارائه ندهند.

RAID جای بکاپ را می‌گیرد؟ خیر. RAID شما را در برابر خرابی سخت‌افزاری یک دیسک محافظت می‌کند، اما در برابر حذف اشتباهی فایل، ویروس، خرابی کنترلر یا خرابی همزمان چند دیسک محافظتی ندارد. بکاپ جداگانه الزامی است.

هارد جدید نصب کردم اما سرور نمی‌شناسد، چه کنم؟ به ترتیب بررسی کنید: نشستن فیزیکی هارد، سلامت خود هارد در بی‌دیگر، سالم بودن بک‌پلین و کابل، و نسخه فریمور. اگر یک بی‌مشخص هیچ هاردی را نمی‌شناسد، احتمالاً بک‌پلین مشکل دارد.

چطور بفهمم کدام هارد خراب شده؟ از لاگ iLO در بخش Integrated Management Log یا از ابزار Smart Storage Administrator استفاده کنید. این ابزارها شماره پورت، باکس و بی‌هارد معیوب را دقیقاً نشان می‌دهند. سپس با قابلیت Identify چراغ همان هارد را روشن کنید تا از نظر فیزیکی مطمئن شوید.

جمع‌بندی

تشخیص و رفع خرابی هارد سرور یکی از مهم‌ترین اقداماتی است که برای حفظ سلامت داده‌ها و جلوگیری از از کار افتادن سیستم‌ها باید به آن توجه ویژه داشت. پیش از انتخاب هارد مناسب، مطالعه راهنمای خرید هارد سرور توصیه می‌شود. خرابی هارد می‌تواند منجر به از دست رفتن اطلاعات حیاتی، کاهش کارایی سرور و حتی توقف کامل خدمات شبکه شود. با استفاده از ابزارهای مانیتورینگ مانند HPE Smart Storage Administrator و برنامه‌های بررسی سلامت هارد مثل HP Tune یا Sea Tools، می‌توان به‌موقع نشانه‌های خرابی را شناسایی و اقدامات لازم را انجام داد. همچنین داشتن استراتژی بکاپ‌گیری منظم و نظارت دوره‌ای بر سلامت هاردها، نقش کلیدی در پیشگیری از مشکلات جدی دارد.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *