انواع خطاهای سرور HP؛ معنی ارورها و روش تشخیص آن‌ها

انواع خطاهای سرور HP؛ معنی ارورها و روش تشخیص آن‌ها

خطاهای سرور HP یا HPE ProLiant می‌توانند به بخش‌های مختلفی مانند حافظه RAM، هارد و کنترلر ذخیره‌سازی، منبع تغذیه، فن و دمای سیستم، پردازنده، درگاه‌های

15 مهر 1405
نویسنده:فائزه کریمی
انواع خطاهای سرور HP؛ معنی ارورها و روش تشخیص آن‌ها

انواع خطاهای سرور HP؛ معنی ارورها و روش تشخیص آن‌ها

خطاهای سرور HP یا HPE ProLiant می‌توانند به بخش‌های مختلفی مانند حافظه RAM، هارد و کنترلر ذخیره‌سازی، منبع تغذیه، فن و دمای سیستم، پردازنده، درگاه‌های PCIe یا Firmware مربوط باشند. این خطاها معمولاً از طریق مرحله POST، لاگ مدیریتی IML، پنل مدیریتی iLO، چراغ‌های وضعیت سرور و ابزارهایی مانند HPE Smart Storage Administrator قابل بررسی هستند.

نکته مهم این است که مشاهده نام یک قطعه در Error Message همیشه به این معنی نیست که همان قطعه باید فوراً تعویض شود. HPE توصیه می‌کند قبل از جابه‌جایی، تعویض یا تغییر قطعات، اطلاعات خطا ثبت و در صورت امکان Active Health System Log دریافت شود.

انواع خطاهای سرور HP در یک نگاه

خطاهای سرور اچ پی در جدول زیر گرداوری شده اند:

خطاهای سرور اچ پی

دسته خطا نمونه خطا یا وضعیت بخش مرتبط
Memory Error Correctable Memory Error Threshold Exceeded RAM / DIMM
Uncorrectable Memory Error Uncorrectable Memory Error Threshold Exceeded RAM / DIMM
Drive Error Drive status changed to Failed HDD / SSD / NVMe
RAID / Volume Error Volume status changed to Degraded یا Failed RAID / Storage
Power Error Power Supply Failure / Redundancy Lost Power Supply
Fan Error Fan Failure / Fans Not Redundant سیستم خنک‌کننده
Thermal Error Over Temperature / Temperature Threshold دمای سرور
PCIe Error Uncorrectable PCI Express Error کارت یا دستگاه PCIe
Machine Check Uncorrectable Machine Check Exception CPU / Platform / I/O
Firmware Error Firmware Requires Update Firmware / System ROM

خطاهای سرور HP را از کجا مشاهده کنیم؟

برای تشخیص مشکل سرور فقط نباید به یک چراغ یا یک پیام روی صفحه اکتفا کرد. HPE چند منبع مختلف برای بررسی وضعیت سرور در اختیار مدیر شبکه قرار می‌دهد.

  • Integrated Management Log یا IML: یکی از مهم‌ترین منابع عیب‌یابی سرور HPE است. رویدادهای سخت‌افزاری و پیام‌های مربوط به بخش‌هایی مانند Memory، Processor، Storage، Power و سایر اجزای سرور می‌توانند در این Log ثبت شوند.
  • HPE iLO: از طریق iLO می‌توان وضعیت سلامت سرور و Logهای مرتبط را بررسی کرد. HPE در روش رسمی عیب‌یابی از راه دور نیز توصیه می‌کند ابتدا وارد iLO شوید و Server Health Information و Logها را بررسی کنید.
  • POST Error: برخی خطاها هنگام روشن‌شدن سرور و در مرحله Power-On Self-Test یا POST نمایش داده می‌شوند. HPE توصیه می‌کند قبل از ایجاد تغییر در سخت‌افزار، POST Error Messageها نیز ثبت شوند.
  • Active Health System Log: اطلاعات تشخیصی سرور را در اختیار مدیر یا تیم پشتیبانی قرار می‌دهد. بهتر است قبل از تغییر قطعات سرور این Log دانلود شود.

رایج‌ترین خطاهای سرور HP و روش تشخیص آن‌ها

در ادامه خطاهای رایج سرور اچ اپی را به همراه روش تشخیص آنها مورد بررسی قرار داده ایم:

1. خطاهای RAM و Memory در سرور HP

خطاهای حافظه در سرورهای HPE می‌توانند شامل DIMM Configuration Error، Correctable Memory Error Threshold Exceeded و Uncorrectable Memory Error باشند.

در حالت Correctable، خطا توسط ECC اصلاح شده اما عبور تعداد خطاها از Threshold نیاز به بررسی دارد؛

  • در خطاهای Uncorrectable نیز ممکن است DIMM از Memory Map خارج شود و نیاز به تعویض داشته باشد.
  • قبل از تعویض RAM، Error Code، IML، نسخه Firmware و System ROM بررسی شوند، چون برخی خطاهای Memory می‌توانند به Firmware مرتبط باشند.

2. خطاهای هارد، SSD و RAID در سرور اچ پی

خطاهای Storage می‌توانند مربوط به Physical Drive، SSD، Storage Controller یا RAID Volume باشند و با پیام‌هایی مانند Drive status changed to Failed یا Volume status changed to Degraded نمایش داده شوند.

وضعیت Degraded به معنی خارج شدن Storage از حالت عادی است، اما الزاماً به معنی خرابی مستقیم هارد نیست؛ بنابراین توصیه می‌شود وضعیت Drive، Controller، Volume، IML و گزارش‌های HPE Smart Storage Administrator هم‌زمان بررسی شوند.

3. خطاهای Power Supply در سرور HP

خطاهای Power ممکن است به خرابی Power Supply، قطع برق ورودی، از بین رفتن Redundancy، ناسازگاری پاورها یا کافی نبودن توان سیستم مربوط باشند.

در برخی مدل‌های HPE، وضعیت Amber یا Red در Health LED نیز می‌تواند نشان‌دهنده Degraded یا Critical بودن سیستم باشد. به همین دلیل، قبل از تعویض پاور باید اتصالات، منبع برق، LED پاورها، وضعیت Redundancy و IML یا iLO بررسی شوند.

4. خطاهای فن و افزایش دما

خطاهای خنک‌کننده با پیام‌هایی مانند Fan Failure، Fans Not Redundant و System Overheating ظاهر می‌شوند. در برخی سرورهای HPE نیز Amber شدن Fan LED می‌تواند نشان‌دهنده Fan Failed یا Missing باشد و Over Temp LED افزایش دمای سیستم را نشان دهد.

برای تشخیص صحیح، وضعیت فن، سنسورهای دما، مسیر جریان هوا، نحوه نصب فن و لاگ‌های IML و iLO را بررسی کنید. افزایش دور فن به‌تنهایی به معنی خرابی آن نیست.

5. خطای Uncorrectable PCI Express Error

خطای Uncorrectable PCI Express Error Detected به یکی از تجهیزات متصل به PCIe مربوط می‌شود و ممکن است اطلاعاتی مانند Slot، Bus، Device و Function را نمایش دهد.

در برخی Error Codeها علت می‌تواند قدیمی بودن Firmware یا Fail شدن Device باشد؛ به همین دلیل ابتدا Firmware دستگاه باید بررسی و به‌روزرسانی شود و در صورت ادامه خطا، تعویض Device مطرح می‌شود.

6. خطای Uncorrectable Machine Check Exception

خطای UMCE یا Uncorrectable Machine Check Exception اطلاعاتی مانند Processor، Bank، Status و Address را در IML ثبت می‌کند، اما مشاهده نام CPU به‌تنهایی به معنی خرابی پردازنده نیست.

برای تشخیص باید متن کامل خطا، Bank، Status، Firmwareها، IML و AHS Log بررسی شوند.

7. خطاهای Firmware و System ROM

برخی خطاهای سرور HPE مستقیماً به Firmware یا System ROM مربوط هستند و الزاماً سخت‌افزاری نیستند. برای مثال پیام Server Platform Services Firmware requires update می‌تواند زمانی ثبت شود که Firmware جدیدی در دسترس باشد یا Firmware Update قبلی کامل نشده باشد.

در چنین شرایطی باید نسخه Firmware، System ROM و Advisoryهای رسمی HPE بررسی و در صورت نیاز Firmware مربوطه به‌روزرسانی شود.

8. چراغ خطای سرور HP

چراغ‌های Health برای نمایش سریع وضعیت کلی سرور استفاده می‌شوند. برای نمونه، در برخی مدل‌های Gen11، سبز ثابت نشان‌دهنده وضعیت عادی است، چراغ Amber چشمک‌زن وضعیت Degraded را نشان می‌دهد و چراغ قرمز چشمک‌زن به وضعیت Critical اشاره دارد.

با این حال، LED فقط وضعیت کلی را مشخص می‌کند و برای تشخیص دقیق باید لاگ IML یا بخش سلامت سیستم در iLO بررسی شود. همچنین معنی چراغ‌ها ممکن است بین مدل‌های مختلف متفاوت باشد و بهتر است راهنمای کاربری همان مدل سرور بررسی شود.

هنگام مشاهده ارور سرور HP چه کار کنیم؟

قبل از تغییر یا تعویض قطعات بهتر است ابتدا اطلاعات مربوط به خطا جمع‌آوری شود. مسیر پیشنهادی شامل این موارد است:

  • پیام خطا را ثبت کنید: Error Message، Error Code و زمان وقوع مشکل را یادداشت کنید.
  • LEDهای سرور را بررسی کنید: وضعیت Health LED و LED قطعه مرتبط را بررسی کنید.
  • IML را چک کنید: رخدادهای ثبت‌شده قبل و بعد از خطا را در Integrated Management Log ببینید.
  • وارد HPE iLO شوید: بخش‌های Server Health، System Information و Logها را بررسی کنید.
  • AHS Log را دریافت کنید: پیش از تغییر سخت‌افزار، Active Health System Log را ذخیره کنید.
  • برای Storage از HPE SSA استفاده کنید: وضعیت Drive، Logical Drive و Storage Controller را بررسی کنید.
  • مستندات همان مدل سرور را ببینید: روش Troubleshooting و Hardware Optionها می‌توانند بین مدل‌ها متفاوت باشند.
  • Firmware و Advisoryها را بررسی کنید: به‌خصوص در خطاهای Memory، Storage، PCIe و Machine Check.
  • قبل از Reseat یا Replace قطعه، هشدارهای HPE را بخوانید: Warning و Cautionهای User Guide همان مدل باید قبل از هر تغییر سخت‌افزاری بررسی شوند.

آیا با مشاهده خطای سرور HP باید فوراً قطعه را تعویض کنیم؟

خیر. بعضی خطاهای سرور HPE ممکن است به Firmware، System ROM یا Configuration مربوط باشند و لزوماً نشان‌دهنده خرابی فیزیکی قطعه نیستند.

برای مثال، HPE در برخی مدل‌ها خطاهای UMCE، Drive Failed و PCIe Error را به نسخه Firmware یا System ROM مرتبط دانسته است. بنابراین قبل از تعویض قطعه باید IML، Error Code، مدل سرور، نسخه Firmware و Recommended Action رسمی HPE بررسی شوند.

جمع بندی

خطاهای سرور HP می‌توانند از Memory، Storage، Power، Cooling، PCIe، Processor یا Firmware منشأ بگیرند. اما مهم‌تر از نام Error، روش صحیح تشخیص آن است.

هنگام مشاهده یک Error بهتر است قبل از تعویض قطعه، Error Code، Logها، Firmware Version و مستندات اختصاصی همان مدل سرور بررسی شوند.

جدول مسیر تشخیص خطاهای سرور HP

اگر این خطا را دیدید ابتدا چه چیزی را بررسی کنید؟ ابزار یا منبع
Memory / DIMM Error DIMM مشخص‌شده و متن کامل Error IML / iLO
Drive Failed Physical Drive، Controller و Volume iLO / HPE SSA
Volume Degraded Driveها و Storage Controller HPE SSA / IML
Power Error Power LED، منبع برق و Redundancy iLO / LED / IML
Fan Error Fan Status و نصب Fan iLO / Systems Insight Display
Over Temperature Temperature Sensor و Airflow iLO
PCIe Error Slot، Device و Firmware IML
UMCE Bank، Status، Firmware و AHS IML / AHS
Firmware Error نسخه Firmware و Recommended Action HPE Support

این جدول یک جمع‌بندی از مسیرهای تشخیصی ذکر شده در راهنماهای رسمی HPE است؛ برای اقدام نهایی باید Error Message مربوط به مدل و نسل همان سرور بررسی شود.

برای انتخاب و خرید انواع سرور HPE می‌توانید با کارشناسان تتیس‌نت تماس بگیرید و پیش از خرید، درباره انتخاب مدل و قطعات سازگار مشاوره دریافت کنید.

سوالات متداول خطاهای سرور HP

1. از کجا بفهمیم مشکل مربوط به کدام قطعه است؟

ابتدا Health LED، پیام خطا، IML و iLO را بررسی کنید. در برخی مدل‌ها Systems Insight Display نیز قطعه دارای مشکل را مشخص می‌کند.

2. آیا چراغ نارنجی یعنی قطعه خراب شده است؟

خیر. چراغ Amber معمولاً نشان‌دهنده Degraded State است و برای تشخیص علت باید IML یا iLO بررسی شود.

3. آیا Memory Error همیشه یعنی RAM خراب است؟

خیر. بعضی خطاهای Memory ممکن است به DIMM، Firmware یا System ROM مربوط باشند؛ بنابراین Error Code باید بررسی شود.

4. آیا Drive Failed یعنی هارد باید تعویض شود؟

نه همیشه. قبل از تعویض، وضعیت Drive، Controller، Volume، Firmware و Configuration را بررسی کنید.

اشتراک گذاری در:

نویسنده:فائزه کریمی
تاریخ انتشار:1405/07/15
مدت مطالعه:9 دقیقه
دسته بندی:اچ پی

نظرات کاربران

0 0 امتیازها
امتیازدهی به مقاله
مشترک شوید
اطلاع از
0 نظرات
قدیمی ترین
جدید ترین دیدگاه با تعداد رای زیاد
بازخورد (Feedback) های اینلاین
نمایش تمام دیدگاه ها
0
دوست داریم نظرتونو بدونیم ، لطفا دیدگاهی بنویسیدx