خطاهای سرور HP یا HPE ProLiant میتوانند به بخشهای مختلفی مانند حافظه RAM، هارد و کنترلر ذخیرهسازی، منبع تغذیه، فن و دمای سیستم، پردازنده، درگاههای PCIe یا Firmware مربوط باشند. این خطاها معمولاً از طریق مرحله POST، لاگ مدیریتی IML، پنل مدیریتی iLO، چراغهای وضعیت سرور و ابزارهایی مانند HPE Smart Storage Administrator قابل بررسی هستند.
نکته مهم این است که مشاهده نام یک قطعه در Error Message همیشه به این معنی نیست که همان قطعه باید فوراً تعویض شود. HPE توصیه میکند قبل از جابهجایی، تعویض یا تغییر قطعات، اطلاعات خطا ثبت و در صورت امکان Active Health System Log دریافت شود.
انواع خطاهای سرور HP در یک نگاه
خطاهای سرور اچ پی در جدول زیر گرداوری شده اند:
خطاهای سرور اچ پی
| دسته خطا | نمونه خطا یا وضعیت | بخش مرتبط |
|---|---|---|
| Memory Error | Correctable Memory Error Threshold Exceeded | RAM / DIMM |
| Uncorrectable Memory Error | Uncorrectable Memory Error Threshold Exceeded | RAM / DIMM |
| Drive Error | Drive status changed to Failed | HDD / SSD / NVMe |
| RAID / Volume Error | Volume status changed to Degraded یا Failed | RAID / Storage |
| Power Error | Power Supply Failure / Redundancy Lost | Power Supply |
| Fan Error | Fan Failure / Fans Not Redundant | سیستم خنککننده |
| Thermal Error | Over Temperature / Temperature Threshold | دمای سرور |
| PCIe Error | Uncorrectable PCI Express Error | کارت یا دستگاه PCIe |
| Machine Check | Uncorrectable Machine Check Exception | CPU / Platform / I/O |
| Firmware Error | Firmware Requires Update | Firmware / System ROM |
خطاهای سرور HP را از کجا مشاهده کنیم؟
برای تشخیص مشکل سرور فقط نباید به یک چراغ یا یک پیام روی صفحه اکتفا کرد. HPE چند منبع مختلف برای بررسی وضعیت سرور در اختیار مدیر شبکه قرار میدهد.
- Integrated Management Log یا IML: یکی از مهمترین منابع عیبیابی سرور HPE است. رویدادهای سختافزاری و پیامهای مربوط به بخشهایی مانند Memory، Processor، Storage، Power و سایر اجزای سرور میتوانند در این Log ثبت شوند.
- HPE iLO: از طریق iLO میتوان وضعیت سلامت سرور و Logهای مرتبط را بررسی کرد. HPE در روش رسمی عیبیابی از راه دور نیز توصیه میکند ابتدا وارد iLO شوید و Server Health Information و Logها را بررسی کنید.
- POST Error: برخی خطاها هنگام روشنشدن سرور و در مرحله Power-On Self-Test یا POST نمایش داده میشوند. HPE توصیه میکند قبل از ایجاد تغییر در سختافزار، POST Error Messageها نیز ثبت شوند.
- Active Health System Log: اطلاعات تشخیصی سرور را در اختیار مدیر یا تیم پشتیبانی قرار میدهد. بهتر است قبل از تغییر قطعات سرور این Log دانلود شود.
رایجترین خطاهای سرور HP و روش تشخیص آنها
در ادامه خطاهای رایج سرور اچ اپی را به همراه روش تشخیص آنها مورد بررسی قرار داده ایم:
1. خطاهای RAM و Memory در سرور HP
خطاهای حافظه در سرورهای HPE میتوانند شامل DIMM Configuration Error، Correctable Memory Error Threshold Exceeded و Uncorrectable Memory Error باشند.
در حالت Correctable، خطا توسط ECC اصلاح شده اما عبور تعداد خطاها از Threshold نیاز به بررسی دارد؛
- در خطاهای Uncorrectable نیز ممکن است DIMM از Memory Map خارج شود و نیاز به تعویض داشته باشد.
- قبل از تعویض RAM، Error Code، IML، نسخه Firmware و System ROM بررسی شوند، چون برخی خطاهای Memory میتوانند به Firmware مرتبط باشند.
2. خطاهای هارد، SSD و RAID در سرور اچ پی
خطاهای Storage میتوانند مربوط به Physical Drive، SSD، Storage Controller یا RAID Volume باشند و با پیامهایی مانند Drive status changed to Failed یا Volume status changed to Degraded نمایش داده شوند.
وضعیت Degraded به معنی خارج شدن Storage از حالت عادی است، اما الزاماً به معنی خرابی مستقیم هارد نیست؛ بنابراین توصیه میشود وضعیت Drive، Controller، Volume، IML و گزارشهای HPE Smart Storage Administrator همزمان بررسی شوند.
3. خطاهای Power Supply در سرور HP
خطاهای Power ممکن است به خرابی Power Supply، قطع برق ورودی، از بین رفتن Redundancy، ناسازگاری پاورها یا کافی نبودن توان سیستم مربوط باشند.
در برخی مدلهای HPE، وضعیت Amber یا Red در Health LED نیز میتواند نشاندهنده Degraded یا Critical بودن سیستم باشد. به همین دلیل، قبل از تعویض پاور باید اتصالات، منبع برق، LED پاورها، وضعیت Redundancy و IML یا iLO بررسی شوند.
4. خطاهای فن و افزایش دما
خطاهای خنککننده با پیامهایی مانند Fan Failure، Fans Not Redundant و System Overheating ظاهر میشوند. در برخی سرورهای HPE نیز Amber شدن Fan LED میتواند نشاندهنده Fan Failed یا Missing باشد و Over Temp LED افزایش دمای سیستم را نشان دهد.
برای تشخیص صحیح، وضعیت فن، سنسورهای دما، مسیر جریان هوا، نحوه نصب فن و لاگهای IML و iLO را بررسی کنید. افزایش دور فن بهتنهایی به معنی خرابی آن نیست.
5. خطای Uncorrectable PCI Express Error
خطای Uncorrectable PCI Express Error Detected به یکی از تجهیزات متصل به PCIe مربوط میشود و ممکن است اطلاعاتی مانند Slot، Bus، Device و Function را نمایش دهد.
در برخی Error Codeها علت میتواند قدیمی بودن Firmware یا Fail شدن Device باشد؛ به همین دلیل ابتدا Firmware دستگاه باید بررسی و بهروزرسانی شود و در صورت ادامه خطا، تعویض Device مطرح میشود.
6. خطای Uncorrectable Machine Check Exception
خطای UMCE یا Uncorrectable Machine Check Exception اطلاعاتی مانند Processor، Bank، Status و Address را در IML ثبت میکند، اما مشاهده نام CPU بهتنهایی به معنی خرابی پردازنده نیست.
برای تشخیص باید متن کامل خطا، Bank، Status، Firmwareها، IML و AHS Log بررسی شوند.
7. خطاهای Firmware و System ROM
برخی خطاهای سرور HPE مستقیماً به Firmware یا System ROM مربوط هستند و الزاماً سختافزاری نیستند. برای مثال پیام Server Platform Services Firmware requires update میتواند زمانی ثبت شود که Firmware جدیدی در دسترس باشد یا Firmware Update قبلی کامل نشده باشد.
در چنین شرایطی باید نسخه Firmware، System ROM و Advisoryهای رسمی HPE بررسی و در صورت نیاز Firmware مربوطه بهروزرسانی شود.
8. چراغ خطای سرور HP
چراغهای Health برای نمایش سریع وضعیت کلی سرور استفاده میشوند. برای نمونه، در برخی مدلهای Gen11، سبز ثابت نشاندهنده وضعیت عادی است، چراغ Amber چشمکزن وضعیت Degraded را نشان میدهد و چراغ قرمز چشمکزن به وضعیت Critical اشاره دارد.
با این حال، LED فقط وضعیت کلی را مشخص میکند و برای تشخیص دقیق باید لاگ IML یا بخش سلامت سیستم در iLO بررسی شود. همچنین معنی چراغها ممکن است بین مدلهای مختلف متفاوت باشد و بهتر است راهنمای کاربری همان مدل سرور بررسی شود.
هنگام مشاهده ارور سرور HP چه کار کنیم؟
قبل از تغییر یا تعویض قطعات بهتر است ابتدا اطلاعات مربوط به خطا جمعآوری شود. مسیر پیشنهادی شامل این موارد است:
- پیام خطا را ثبت کنید: Error Message، Error Code و زمان وقوع مشکل را یادداشت کنید.
- LEDهای سرور را بررسی کنید: وضعیت Health LED و LED قطعه مرتبط را بررسی کنید.
- IML را چک کنید: رخدادهای ثبتشده قبل و بعد از خطا را در Integrated Management Log ببینید.
- وارد HPE iLO شوید: بخشهای Server Health، System Information و Logها را بررسی کنید.
- AHS Log را دریافت کنید: پیش از تغییر سختافزار، Active Health System Log را ذخیره کنید.
- برای Storage از HPE SSA استفاده کنید: وضعیت Drive، Logical Drive و Storage Controller را بررسی کنید.
- مستندات همان مدل سرور را ببینید: روش Troubleshooting و Hardware Optionها میتوانند بین مدلها متفاوت باشند.
- Firmware و Advisoryها را بررسی کنید: بهخصوص در خطاهای Memory، Storage، PCIe و Machine Check.
- قبل از Reseat یا Replace قطعه، هشدارهای HPE را بخوانید: Warning و Cautionهای User Guide همان مدل باید قبل از هر تغییر سختافزاری بررسی شوند.
آیا با مشاهده خطای سرور HP باید فوراً قطعه را تعویض کنیم؟
خیر. بعضی خطاهای سرور HPE ممکن است به Firmware، System ROM یا Configuration مربوط باشند و لزوماً نشاندهنده خرابی فیزیکی قطعه نیستند.
برای مثال، HPE در برخی مدلها خطاهای UMCE، Drive Failed و PCIe Error را به نسخه Firmware یا System ROM مرتبط دانسته است. بنابراین قبل از تعویض قطعه باید IML، Error Code، مدل سرور، نسخه Firmware و Recommended Action رسمی HPE بررسی شوند.
جمع بندی
خطاهای سرور HP میتوانند از Memory، Storage، Power، Cooling، PCIe، Processor یا Firmware منشأ بگیرند. اما مهمتر از نام Error، روش صحیح تشخیص آن است.
هنگام مشاهده یک Error بهتر است قبل از تعویض قطعه، Error Code، Logها، Firmware Version و مستندات اختصاصی همان مدل سرور بررسی شوند.
جدول مسیر تشخیص خطاهای سرور HP
| اگر این خطا را دیدید | ابتدا چه چیزی را بررسی کنید؟ | ابزار یا منبع |
|---|---|---|
| Memory / DIMM Error | DIMM مشخصشده و متن کامل Error | IML / iLO |
| Drive Failed | Physical Drive، Controller و Volume | iLO / HPE SSA |
| Volume Degraded | Driveها و Storage Controller | HPE SSA / IML |
| Power Error | Power LED، منبع برق و Redundancy | iLO / LED / IML |
| Fan Error | Fan Status و نصب Fan | iLO / Systems Insight Display |
| Over Temperature | Temperature Sensor و Airflow | iLO |
| PCIe Error | Slot، Device و Firmware | IML |
| UMCE | Bank، Status، Firmware و AHS | IML / AHS |
| Firmware Error | نسخه Firmware و Recommended Action | HPE Support |
این جدول یک جمعبندی از مسیرهای تشخیصی ذکر شده در راهنماهای رسمی HPE است؛ برای اقدام نهایی باید Error Message مربوط به مدل و نسل همان سرور بررسی شود.
برای انتخاب و خرید انواع سرور HPE میتوانید با کارشناسان تتیسنت تماس بگیرید و پیش از خرید، درباره انتخاب مدل و قطعات سازگار مشاوره دریافت کنید.
سوالات متداول خطاهای سرور HP
1. از کجا بفهمیم مشکل مربوط به کدام قطعه است؟
ابتدا Health LED، پیام خطا، IML و iLO را بررسی کنید. در برخی مدلها Systems Insight Display نیز قطعه دارای مشکل را مشخص میکند.
2. آیا چراغ نارنجی یعنی قطعه خراب شده است؟
خیر. چراغ Amber معمولاً نشاندهنده Degraded State است و برای تشخیص علت باید IML یا iLO بررسی شود.
3. آیا Memory Error همیشه یعنی RAM خراب است؟
خیر. بعضی خطاهای Memory ممکن است به DIMM، Firmware یا System ROM مربوط باشند؛ بنابراین Error Code باید بررسی شود.
4. آیا Drive Failed یعنی هارد باید تعویض شود؟
نه همیشه. قبل از تعویض، وضعیت Drive، Controller، Volume، Firmware و Configuration را بررسی کنید.

