اگر همین الان مشکل دارید
قبل از هر کاری، این جدول را ببینید:
| وضعیتی که میبینید | معنی | اقدام فوری |
|---|---|---|
| چراغ کهربایی ثابت روی یک هارد | هارد خراب شده | هارد را تعویض کنید |
| چراغ کهربایی چشمکزن (یک بار در ثانیه) | هشدار خرابی قریبالوقوع | از اطلاعات بکاپ بگیرید، هارد را تعویض کنید |
| چراغ آبی چشمکزن | هارد در حال بازسازی (Rebuild) | دست نزنید تا کامل شود |
| خطای 1720 هنگام روشن شدن | هشدار SMART | هارد بهزودی خراب میشود |
| خطای 1779 | آرایه ناقص است | دیسک از دست رفته را برگردانید |
| خطای 1786 | نیاز به بازسازی | مراحل بازیابی را دنبال کنید |
| دو هارد همزمان کهربایی در RAID 5 | آرایه از کار افتاده | هیچ کاری نکنید و مشاوره بگیرید |
مهمترین قانون: اگر بیش از یک هارد در یک آرایه خراب شده، سرور را ریاستارت نکنید و هیچ هاردی را جابهجا نکنید. هر اقدام اشتباه در این وضعیت میتواند بازیابی اطلاعات هارد سرور را غیرممکن کند.
معنی چراغهای هارد در سرورهای HP ProLiant
هر هارد Hot-Plug در سرورهای اچ پی دو چراغ دارد. ترکیب این دو، وضعیت هارد را نشان میدهد.
| وضعیت چراغ | معنی |
|---|---|
| سبز ثابت | هارد سالم و در حال کار |
| سبز چشمکزن نامنظم | فعالیت خواندن و نوشتن، طبیعی است |
| آبی ثابت | هارد توسط نرمافزار شناسایی شده (حالت Identify) |
| آبی چشمکزن | در حال بازسازی یا انتقال داده |
| کهربایی ثابت | هارد خراب است و از آرایه خارج شده |
| کهربایی چشمکزن | هشدار خرابی قریبالوقوع (Predictive Failure) |
| سبز و کهربایی متناوب | هارد در حال بازسازی است |
| خاموش کامل | هارد شناسایی نشده، یا در حالت آمادهباش |
نکته مهم: چراغ کهربایی چشمکزن با چراغ کهربایی ثابت فرق اساسی دارد. چشمکزن یعنی هارد هنوز کار میکند اما در آستانه خرابی است — این بهترین فرصت شماست برای تعویض بدون ریسک. ثابت یعنی کار از کار گذشته و هارد از آرایه خارج شده است.
کدهای خطای هنگام روشن شدن سرور (POST)
اگر هنگام بوت سرور با کد خطا مواجه شدید، این جدول معنی آن را نشان میدهد:
| کد | معنی | وخامت |
|---|---|---|
| 1720 | هشدار SMART — هارد پیشبینی خرابی میکند | متوسط: هنوز کار میکند |
| 1779 | آرایه شناسایی شد اما یک یا چند دیسک غایب است | بالا |
| 1783 | خطای کنترلر دیسک | بالا |
| 1784 | خرابی دیسک در آرایه | بالا |
| 1785 | آرایه بهدرستی پیکربندی نشده | بالا |
| 1786 | آرایه نیاز به بازسازی دارد | متوسط |
| 1787 | آرایه در حالت تخریبشده کار میکند | بالا |
| 1789 | دیسک پاسخ نمیدهد | بالا |
خطای ۱۷۲۰ چه میگوید:
این پرتکرارترین خطایی است که مدیران سرور با آن روبهرو میشوند و اغلب اشتباه فهمیده میشود.
خطای ۱۷۲۰ یعنی هارد هنوز کار میکند، اما سیستم SMART داخلی آن گزارش داده که در آستانه خرابی است — مثلاً تعداد سکتورهای معیوب از حد مجاز گذشته یا خطاهای خواندن افزایش یافته.
این خطا را نادیده نگیرید. هارد ممکن است چند هفته دیگر کار کند یا فردا از کار بیفتد. برنامه تعویض را همین حالا شروع کنید، در حالی که آرایه هنوز سالم است و بازسازی بدون ریسک انجام میشود.
خطای ۱۷۸۶ و بازسازی:
این خطا یعنی آرایه تشخیص داده که به بازسازی نیاز دارد. معمولاً پس از تعویض هارد یا پس از قطعی برق ناگهانی ظاهر میشود.
پیش از تأیید بازسازی، مطمئن شوید که هارد جایگزین سالم است و ظرفیت آن حداقل برابر با هارد قبلی است.
خواندن لاگ خطا در iLO:
سریعترین راه فهمیدن اینکه دقیقاً چه اتفاقی افتاده، بررسی لاگ iLO است. برای این کار نیازی به خاموش کردن یا حتی دسترسی فیزیکی به سرور ندارید.
مراحل:
- با مرورگر به آدرس IP کارت iLO وارد شوید.
- وارد بخش Information و سپس Integrated Management Log شوید.
- رویدادها را بر اساس تاریخ مرتب کنید و به دنبال موارد با شدت Critical یا Caution بگردید.
پیامهایی که باید دنبالشان بگردید:
- پیامهایی درباره خرابی درایو فیزیکی همراه با شماره پورت و باکس و بی
- هشدارهای مربوط به پیشبینی خرابی (Predictive Failure)
- رویدادهای مربوط به تخریب یا از کار افتادن درایو منطقی
- خطاهای مربوط به باتری یا خازن ماژول کش کنترلر
لاگ iLO دقیقاً به شما میگوید کدام هارد در کدام موقعیت فیزیکی مشکل دارد. این اطلاعات را یادداشت کنید — موقع تعویض به آن نیاز دارید.
بررسی دقیقتر با Smart Storage Administrator
اگر میخواهید وضعیت کامل آرایه و سلامت تکتک دیسکها را ببینید، ابزار HPE Smart Storage Administrator (نسخههای قدیمیتر: Array Configuration Utility) بهترین گزینه است.
این ابزار به سه صورت در دسترس است: نصب روی سیستمعامل، اجرا از طریق محیط Intelligent Provisioning هنگام بوت، یا از طریق ISO قابل بوت.
در این ابزار چه چیزهایی را بررسی کنید:
- وضعیت هر درایو فیزیکی: OK، Predictive Failure یا Failed
- وضعیت درایو منطقی: OK، Interim Recovery (تخریبشده) یا Failed
- شمارندههای SMART: تعداد سکتورهای تخصیصیافته مجدد، خطاهای خواندن، ساعات کارکرد
- دمای دیسکها: دمای بالا عمر هارد را کوتاه میکند
- وضعیت ماژول کش و باتری کنترلر
اگر یک دیسک وضعیت Predictive Failure دارد اما هنوز کار میکند، شما در بهترین موقعیت ممکن هستید: فرصت دارید بدون فشار زمانی و بدون ریسک، هارد را تعویض کنید.
مراحل صحیح تعویض هارد
ترتیب این مراحل مهم است. رعایت نکردنشان میتواند به از دست رفتن اطلاعات منجر شود.
۱. اول بکاپ بگیرید
حتی اگر RAID دارید. RAID جایگزین بکاپ نیست — RAID شما را در برابر خرابی یک دیسک محافظت میکند، نه در برابر خرابی همزمان چند دیسک، خطای انسانی، یا خرابی کنترلر.
اگر آرایه در وضعیت تخریبشده است، احتمال خرابی دیسک دوم در حین بازسازی وجود دارد. بکاپ گرفتن پیش از شروع بازسازی، مهمترین کاری است که میتوانید انجام دهید.
۲. هارد معیوب را دقیقاً شناسایی کنید
از لاگ iLO یا Smart Storage Administrator، شماره پورت، باکس و بی هارد معیوب را پیدا کنید. سپس با استفاده از قابلیت Identify، چراغ آن هارد را روشن کنید تا از نظر فیزیکی مطمئن شوید.
هرگز بر اساس حدس هارد را بیرون نکشید. کشیدن هارد سالم از یک آرایه تخریبشده، آرایه را کاملاً از کار میاندازد.
۳. هارد جایگزین مناسب انتخاب کنید
| ویژگی | الزام |
|---|---|
| ظرفیت | حداقل برابر با هارد قبلی، ترجیحاً یکسان |
| نوع رابط | همان نوع (SAS یا SATA) |
| سرعت چرخش | ترجیحاً یکسان |
| فرمفاکتور | همان اندازه (۲.۵ یا ۳.۵ اینچ) |
| کدی | کدی سازگار با نسل سرور |
نکته مهم درباره کدی (Caddy): کدی سرورهای Gen8 با Gen9 و Gen10 فرق دارد. اگر هارد را بدون کدی میخرید، مطمئن شوید کدی موجود شما با نسل سرورتان سازگار است.
۴. هارد را تعویض کنید
هاردهای Hot-Plug را میتوان بدون خاموش کردن سرور تعویض کرد. دستگیره را آزاد کنید، هارد را بیرون بکشید، چند ثانیه صبر کنید و هارد جدید را جا بزنید.
۵. بازسازی را زیر نظر بگیرید
بازسازی معمولاً بهصورت خودکار شروع میشود. مدت زمان آن به ظرفیت هارد، سطح RAID و بار کاری سرور بستگی دارد — از چند ساعت تا بیش از یک روز.
در حین بازسازی:
- سرور را ریاستارت نکنید
- هاردهای دیگر را جابهجا نکنید
- تا حد امکان بار کاری سنگین روی سرور نگذارید
- پیشرفت را در Smart Storage Administrator یا iLO دنبال کنید
وقتی هارد جدید شناسایی نمیشود
اگر هارد جایگزین را نصب کردید و سرور آن را نمیبیند، به ترتیب این موارد را بررسی کنید:
- نشستن فیزیکی هارد. هارد را بیرون بکشید و دوباره محکم جا بزنید. گاهی کانکتور بهدرستی درگیر نشده است.
- سلامت خود هارد جایگزین. هارد را در بیدیگری امتحان کنید. اگر آنجا هم شناسایی نشد، مشکل از خود هارد است.
- بکپلین. اگر یک بیمشخص هیچ هاردی را نمیشناسد اما بقیه بیها کار میکنند، احتمالاً بکپلین یا کابل آن مشکل دارد.
- فریمور هارد. برخی هاردها با فریمور قدیمی روی کنترلرهای جدیدتر مشکل شناسایی دارند.
- سازگاری هارد. در سرورهای Gen8 و بالاتر، هاردهایی که فریمور اچ پی ندارند ممکن است پیام هشدار سازگاری بدهند یا اطلاعات سلامت کامل ارائه نکنند.
وقتی مشکل از خود هارد نیست
- گاهی چند هارد همزمان خطا میدهند یا خطاها بیدلیل تکرار میشوند. در این حالت احتمال دارد مشکل از قطعه دیگری باشد:
- بکپلین معیوب. اگر خطاها روی بیهای مجاور و پشت سر هم رخ میدهند، بکپلین مظنون اصلی است.
- کابل SAS شل یا معیوب. بهخصوص پس از جابهجایی فیزیکی سرور یا کار کردن داخل شاسی.
- کنترلر RAID. اگر تمام هاردها همزمان ناپدید شدند یا آرایه اصلاً شناسایی نمیشود، کنترلر را بررسی کنید.
- باتری یا خازن ماژول کش. وقتی باتری کنترلر خراب میشود، کش نوشتن غیرفعال میشود. اطلاعات از بین نمیرود اما سرعت نوشتن بهشدت افت میکند. اگر ناگهان سرور کند شده، این را بررسی کنید.
- تغذیه ناپایدار. قطعیهای مکرر برق یا پاور معیوب میتواند باعث خطاهای پراکنده و غیرقابل توضیح دیسک شود.
- دمای بالا. اگر فنها درست کار نمیکنند یا فیلتر هوا گرفته است، دمای دیسکها بالا میرود و عمرشان بهشدت کوتاه میشود.
پیشگیری: کاری که باید قبل از خرابی بکنید
- هشدارهای iLO را فعال کنید. iLO میتواند هنگام بروز خطا ایمیل بفرستد یا SNMP trap ارسال کند. این کار چند دقیقه وقت میبرد و میتواند شما را از یک بحران نجات دهد.
- لاگ را بهصورت دورهای بررسی کنید. ماهی یک بار سری به IML و وضعیت آرایه بزنید. خرابی هارد معمولاً هفتهها قبل علائم میدهد.
- هارد یدکی داشته باشید. بهخصوص در ایران که تأمین قطعه ممکن است زمانبر باشد. یک هارد یدکی در کشو، تفاوت بین چند ساعت و چند هفته توقف است.
- Hot Spare تعریف کنید. اگر بیخالی دارید، یک هارد را بهعنوان یدک آنلاین تعریف کنید. در صورت خرابی، بازسازی خودکار و فوری شروع میشود بدون اینکه منتظر حضور شما بماند.
- فریمور را بهروز نگه دارید. بسیاری از مشکلات شناختهشده دیسک با بهروزرسانی فریمور کنترلر و هارد برطرف میشوند.
- دما را رصد کنید. دمای دیسک بالای حد مجاز، مستقیمترین عامل کوتاه شدن عمر هارد است.
سؤالات متداول
چراغ کهربایی روی هارد سرور یعنی چه؟ چراغ کهربایی ثابت یعنی هارد خراب شده و از آرایه خارج شده است. چراغ کهربایی چشمکزن یعنی هارد هنوز کار میکند اما سیستم SMART پیشبینی خرابی کرده — در این حالت فرصت دارید بدون ریسک هارد را تعویض کنید.
خطای ۱۷۲۰ در سرور HP یعنی چه؟ این خطا یعنی هارد گزارش SMART مبنی بر احتمال خرابی داده است. هارد هنوز کار میکند اما باید هرچه زودتر تعویض شود. نادیده گرفتن این هشدار معمولاً به خرابی کامل منجر میشود.
آیا میتوانم بدون خاموش کردن سرور هارد را عوض کنم؟ بله، اگر هارد از نوع Hot-Plug باشد و آرایه شما افزونگی داشته باشد (RAID ۱.۵، ۶.۱۰). در آرایههای بدون افزونگی مثل RAID 0، تعویض هارد به معنی از دست رفتن کل اطلاعات آرایه است.
بازسازی آرایه چقدر طول میکشد؟ بسته به ظرفیت هارد، سطح RAID و بار کاری سرور، از چند ساعت تا بیش از یک روز. در حین بازسازی سرور را ریاستارت نکنید و هاردهای دیگر را جابهجا نکنید.
اگر دو هارد همزمان در RAID 5 خراب شوند چه کنم؟ هیچ کاری نکنید. سرور را ریاستارت نکنید، هاردها را جابهجا نکنید و بازسازی را شروع نکنید. RAID ۵ فقط خرابی یک دیسک را تحمل میکند. در این وضعیت هر اقدام اشتباه میتواند بازیابی اطلاعات را غیرممکن کند. با متخصص تماس بگیرید.
آیا هارد معمولی کامپیوتر روی سرور کار میکند؟ از نظر فنی ممکن است شناسایی شود، اما توصیه نمیشود. هاردهای سروری برای کارکرد ۲۴ ساعته، تحمل لرزش در محیط چند دیسکی و رفتار صحیح در برابر خطا طراحی شدهاند. همچنین در سرورهای Gen8 و بالاتر، هاردهای بدون فریمور اچ پی ممکن است اطلاعات سلامت کامل ارائه ندهند.
RAID جای بکاپ را میگیرد؟ خیر. RAID شما را در برابر خرابی سختافزاری یک دیسک محافظت میکند، اما در برابر حذف اشتباهی فایل، ویروس، خرابی کنترلر یا خرابی همزمان چند دیسک محافظتی ندارد. بکاپ جداگانه الزامی است.
هارد جدید نصب کردم اما سرور نمیشناسد، چه کنم؟ به ترتیب بررسی کنید: نشستن فیزیکی هارد، سلامت خود هارد در بیدیگر، سالم بودن بکپلین و کابل، و نسخه فریمور. اگر یک بیمشخص هیچ هاردی را نمیشناسد، احتمالاً بکپلین مشکل دارد.
چطور بفهمم کدام هارد خراب شده؟ از لاگ iLO در بخش Integrated Management Log یا از ابزار Smart Storage Administrator استفاده کنید. این ابزارها شماره پورت، باکس و بیهارد معیوب را دقیقاً نشان میدهند. سپس با قابلیت Identify چراغ همان هارد را روشن کنید تا از نظر فیزیکی مطمئن شوید.
جمعبندی
تشخیص و رفع خرابی هارد سرور یکی از مهمترین اقداماتی است که برای حفظ سلامت دادهها و جلوگیری از از کار افتادن سیستمها باید به آن توجه ویژه داشت. پیش از انتخاب هارد مناسب، مطالعه راهنمای خرید هارد سرور توصیه میشود. خرابی هارد میتواند منجر به از دست رفتن اطلاعات حیاتی، کاهش کارایی سرور و حتی توقف کامل خدمات شبکه شود. با استفاده از ابزارهای مانیتورینگ مانند HPE Smart Storage Administrator و برنامههای بررسی سلامت هارد مثل HP Tune یا Sea Tools، میتوان بهموقع نشانههای خرابی را شناسایی و اقدامات لازم را انجام داد. همچنین داشتن استراتژی بکاپگیری منظم و نظارت دورهای بر سلامت هاردها، نقش کلیدی در پیشگیری از مشکلات جدی دارد.










