فشل قرص واحد لا يعني أن كل شيء انتهى.
استعادة بيانات RAID والسيرفرات للشركات
عند تعطل RAID أو توقف السيرفر عن قراءة البيانات، إعادة التشغيل المتكرر أو بدء Rebuild جديد دون فحص قد يضاعف المشكلة.
- +25
- سنة خبرة
- +50K
- حالة تم التعامل معها
- 99%
- نسبة نجاح بعد التشخيص
لا تبدأ Rebuild قبل فهم المصفوفة.
متى تحتاج الشركة إلى فحص RAID؟
- 01
فشل قرص أو أكثر
ظهور قرص Failed أو Degraded داخل مصفوفة RAID.
- 02
توقف الوصول للملفات
المجلدات المشتركة أو خدمات السيرفر لم تعد متاحة.
- 03
فشل Rebuild أو NAS
فشل إعادة البناء أو توقف NAS وSAN عن قراءة البيانات.
كل قرص يحمل جزءاً من القصة.
استعادة بيانات RAID
البيانات موزعة بين أكثر من قرص. نبدأ بفهم بنية التخزين، عدد الأقراص، نوع RAID ورسائل الخطأ، ثم نحدد المسار المناسب مع الحفاظ على ترتيب الأقراص والإعدادات.
فحص الحالة
تحديد المسار
استعادة آمنة
الأجهزة والماركات المدعومة
السيرفرات وأنظمة التخزين التي نتعامل معها
لكل متحكم RAID طريقة خاصة في كتابة البيانات وترتيبها على الأقراص. هذه أكثر البيئات التي تصل المختبر، وما الذي يتغيّر في التعامل مع كل واحدة منها.
سيرفرات Dell PowerEdge
متحكمات PERC تحفظ إعدادات المصفوفة على المتحكم وعلى الأقراص معاً. استيراد Foreign Config أو مسحه قد يعيد كتابة هذه الإعدادات، لذلك نقرأ الأقراص خارج المتحكم أولاً.
سيرفرات HP ProLiant
متحكمات Smart Array تكتب بيانات وصفية خاصة في بداية كل قرص، ومكان القرص داخل الرف جزء من الحل. نوثّق موضع كل قرص قبل إخراجه من الجهاز.
أجهزة Synology NAS
تعتمد على mdadm وLVM فوقهما نظام ملفات Btrfs أو ext4، وقد يجمع SHR أحجام أقراص مختلفة في أكثر من مستوى مصفوفة. يجب فهم البنية كاملة قبل أي تجميع.
أجهزة QNAP NAS
الأقسام الرقيقة (Thin Volumes) واللقطات تضيف طبقة فوق المصفوفة نفسها. تلف هذه الطبقة قد يمنع الوصول إلى الملفات حتى لو كانت كل الأقراص تُقرأ بشكل سليم.
RAID البرمجي
Storage Spaces في Windows وmdadm في Linux تحفظ تعريف المصفوفة داخل النظام لا في عتاد مستقل. عند فقد النظام تُستنتج البنية من الأقراص نفسها.
أنظمة SAN وأرفف التخزين
وحدات LUN وأنظمة VMFS وملفات الأقراص الافتراضية تعني مصفوفة داخل مصفوفة. نعيد بناء الطبقة السفلى أولاً، ثم نفتح الأقراص الافتراضية المخزّنة داخلها.
كيف نتعامل مع مصفوفة متوقفة
- 01
توثيق المصفوفة قبل لمسها
نسجّل نوع RAID، عدد الأقراص، رقم كل منفذ، موديل المتحكم ورسائل السجل. يُوسم ترتيب الأقراص فيزيائياً، ولا تُكتب أي بيانات على قرص عضو.
- 02
نسخ كل قرص قراءة فقط
يُنسخ كل قرص قطاعاً بقطاع عبر واجهة قراءة فقط داخل المختبر. الأقراص الضعيفة تُعالج أولاً بقراءة متدرجة، وكل العمل بعدها يتم على النسخ لا على الأصل.
- 03
إعادة بناء المصفوفة افتراضياً
من النسخ نحدد حجم الشريحة (Stripe)، ترتيب الكتل، دوران التماثل ونقطة البداية، ونحدد القرص الذي خرج من المصفوفة أولاً حتى لا تدخل بياناته القديمة في الحساب.
- 04
استخراج البيانات والتحقق منها
يُقرأ نظام الملفات من المصفوفة المعاد بناؤها، ثم نفتح عينات من قواعد البيانات والأقراص الافتراضية والمجلدات المشتركة للتأكد من سلامتها قبل التسليم على وسيط منفصل.
قرار الساعة الأولى
متى يجب إيقاف النظام؟
كل كتابة جديدة على مصفوفة متضرّرة تُصعّب الاستعادة. هذه المؤشّرات تستدعي التوقّف والتوثيق قبل أي إجراء.
- المصفوفة أصبحت Degraded وظهر قرص ثانٍ بأخطاء قراءة.
- بدأ Rebuild ثم توقّف أو تراجع الأداء بصورة شديدة.
- اختفى Volume أو تغيّر إلى RAW أو Unmounted.
- طلب المتحكّم Initialize أو Create New Array أو Import Foreign Configuration.
- تغيّر ترتيب الأقراص أو نُقلت إلى جهاز آخر.
- توقّف NAS أو SAN أو خادم الملفات بعد انقطاع كهرباء.
- لم تعد آلات VMware أو Hyper-V أو قواعد البيانات قابلة للفتح.
- توجد مؤشّرات تشفير أو حذف جماعي — وهنا تُعامَل الحالة كحادث أمني أيضًا.
للتوجيه لا للتقنية
دليل مبسّط لمستويات RAID
شرح موجز يساعدك على وصف حالتك. الإعدادات الفعلية تُقرأ من بيانات الأقراص لا من التخمين.
يوزّع البيانات بين قرصين أو أكثر لتحسين الأداء بلا تكرار. فقدان جزء من قرص قد يؤثّر على الملفات الممتدّة عبر المصفوفة كلها، ويحتاج التحليل جميع الأقراص وترتيبها ومعاملات التوزيع.
ينشئ نسخة متطابقة عادةً. ورغم ذلك قد تنتقل أخطاء الحذف أو التلف المنطقي إلى النسختين، وقد لا تكون الأقراص متزامنة تمامًا بعد عطل أو Rebuild.
يستخدم Parity موزّعًا ويتحمّل عادةً فشل قرص واحد في الحالة السليمة. الخطر يظهر عندما يكون قرص آخر ضعيفًا أو عندما يبدأ Rebuild على أقراص قديمة.
يستخدم Parity مزدوجًا ويتحمّل أعطالًا أكثر ضمن تصميمه، لكن فساد البيانات أو ترتيبًا خاطئًا أو فشل عدّة أقراص أثناء إعادة البناء قد يجعل الاستعادة معقّدة.
يجمع بين المرايا والتوزيع. النتيجة تعتمد على أي الأقراص فشلت وعلى أزواج المرايا الفعلية، لا على عدد الأقراص المعطّلة وحده.
ما الذي نفعله قبل فتح الملفات؟
- 01
توثيق البنية
يُسجَّل ترتيب الأقراص وحالة كل قرص وموديل المتحكّم ورسائل النظام وأي Rebuild أو استبدال حدث. صور الـBays وواجهة الإدارة أدقّ من الذاكرة بعد أيام.
- 02
نسخة مستقلّة لكل قرص
يُفحص كل قرص منفردًا وتُؤخذ نسخة قطاعية متى أمكن. لا يُكتب على الأقراص الأصلية ولا يُعتمد على قرص واحد ليمثّل مصفوفة موزّعة.
- 03
تحديد معاملات المصفوفة
يُحلَّل ترتيب الأقراص وحجم Stripe واتجاه Parity والـOffset وحالة الأقراص البديلة أو القديمة، ثم تُبنى مصفوفة افتراضية على النسخ.
- 04
فحص نظام الملفات والخدمات
بعد ظهور الـVolume منطقيًّا تُراجَع بنية الملفات ومخازن الآلات الافتراضية وقواعد البيانات. نجاح إعادة بناء RAID لا يعني تلقائيًّا أن كل ملف سليم.
- 05
ترتيب الأولويات والتحقّق
تُستعاد الأنظمة والملفات بحسب أثرها على العمل، ثم تُفتح عيّنة من المستندات والفيديوهات وقواعد البيانات للتحقّق قبل التسليم.
بين الطرفين
حالات شائعة ونتائج محتملة
- 01
فشل قرص ثم فشل Rebuild
قد يكون القرص البديل سليمًا بينما يحتوي قرص آخر على قطاعات متعثّرة لا تظهر أثناء التشغيل العادي. احتفظ بالقرص الأصلي والبديل معًا؛ قد تلزم مقارنة حالتيهما.
- 02
NAS يظهر Volume غير مركّب
قد تكون الأقراص سليمة نسبيًّا والمشكلة في بنية RAID أو نظام الملفات أو إعداد الجهاز. لا تنشئ Storage Pool جديدًا ولا تهيّئ الأقراص.
- 03
تبدّل المتحكّم أو السيرفر
قد يقرأ المتحكّم الجديد البيانات بطريقة مختلفة أو يطلب Initialize. لا توافق. يلزم طراز المتحكّم القديم والجديد ونسخة من الإعدادات إن وُجدت.
- 04
VMware أو Hyper-V لا ترى الآلات
قد تكون المصفوفة قابلة لإعادة البناء بينما تضرّرت ملفات VMDK أو VHDX أو بنية Datastore. النتيجة قد تكون آلة كاملة، أو أقراصًا افتراضية جزئية، أو استخراج ملفات مهمّة فقط.
- 05
قاعدة بيانات لا تبدأ بعد عودة التخزين
عودة الـVolume لا تثبت اتّساق قاعدة البيانات. تُفحص ملفات البيانات والسجلّات وتُنسخ قبل أي Repair يكتب عليها.
الأكثر ضررًا
تجنّب هذه الخطوات
- لا تبدأ Rebuild ثانيًا ولا تعمل Initialize.
- لا تغيّر ترتيب الأقراص ولا منصّات الـBay.
- لا تستبدل أكثر من قرص دفعة واحدة.
- لا تجبر قرصًا Offline على Online ولا تمسح Foreign Configuration.
- لا تحدّث Firmware للمتحكّم أو NAS أثناء الحادث.
- لا تعد الأقراص القديمة إلى Pool يعمل قبل حفظ نسخ منها.
- لا تستعيد النسخ الاحتياطية فوق النظام المتضرّر قبل معرفة سبب العطل.
- لا تفترض أن Hot Spare يحتوي على نسخة كاملة؛ دوره يعتمد على حالة إعادة البناء.
ما نحتاجه من مسؤول النظام
- 01
الجهاز والمتحكّم
الشركة والطراز للسيرفر أو NAS أو SAN، وطراز المتحكّم.
- 02
إعداد المصفوفة
مستوى RAID المتوقّع وعدد الأقراص وسعة كل قرص.
- 03
صور الـBays
صور واضحة للأقراص داخل مواضعها قبل إخراجها.
- 04
حالة كل قرص
Online أو Failed أو Degraded أو Foreign أو Rebuilding.
- 05
تسلسل الأحداث بالتوقيت
أول إنذار، استبدال، Rebuild، انقطاع طاقة أو تحديث.
- 06
ما أُخرج أو أُضيف
أي قرص أُخرج أو أُضيف، وأيّها يظنّ الفريق أنه قديم.
- 07
الأنظمة والخدمات
نظام التشغيل ونظام الملفات والخدمات المهمّة.
- 08
التشفير
وجود تشفير، ومكان مفاتيح BitLocker أو تشفير NAS.
- 09
البيئات الافتراضية
وجود VMware أو Hyper-V أو قواعد بيانات، وأسماء الأنظمة الحرجة.
- 10
النسخ الاحتياطية
حالتها وآخر اختبار استعادة ناجح.
- 11
مؤشّرات أمنية
هل توجد شبهة فدية أو وصول غير مصرّح به.
الأسئلة الشائعة
الترتيب والنوع والحالة تحسم المسار.
يعتمد ذلك على نوع RAID، عدد الأقراص المتضررة وحالة البيانات في كل قرص.
نعم، يمكن فحص NAS عند تعطل الأقراص أو تلف نظام الملفات.
أوقف المحاولة، لا تغيّر ترتيب الأقراص واطلب فحصاً متخصصاً.
كل كتابة جديدة وقراءة مكثّفة تزيد الضغط. نسّق حفظ الحالة وإيقافًا آمنًا بحسب أهمّية الخدمة، ولا تبدأ Rebuild تلقائيًّا قبل تقييم الأقراص.
لا. هو قرص احتياطي يدخل في إعادة البناء، وليس نسخة احتياطية مستقلّة. قد يفشل Rebuild أو تُنقَل إليه بيانات تالفة.
قد يمكن استنتاج الترتيب من البيانات، لكن ذلك يزيد التعقيد. أرسل جميع الأقراص والصور والسجلّات ولا تجرّب ترتيبات عشوائية.
لا. البيانات موزّعة بين المجموعة، ونحتاج غالبًا كل الأقراص — إضافة إلى أي قرص أُزيل أو استُبدل أثناء الحادث.
الأفضل التسليم إلى تخزين منفصل أو بيئة نظيفة. الكتابة على المصفوفة الأصلية قبل التحقّق قد تضيّع فرصة الرجوع.
يمكن جمع الصور والسجلّات والمعلومات عن بُعد، لكن فحص الأقراص وأخذ نسخ منها قد يتطلّب استلام الوسائط أو وصولًا منظّمًا إلى البيئة.
يعتمد على عدد الأقراص وسعتها وحالتها وسرعة القراءة وبنية الخدمات. نعطي التقدير بعد فحص المجموعة، لا من مستوى RAID وحده.
ليس بالضرورة. إعادة بناء التخزين خطوة، واتّساق قاعدة البيانات خطوة أخرى تحتاج فحص الملفات والسجلّات أو نسخة التطبيق.
نتعامل مع RAID 0 و1 و5 و6 و10 وأنظمة NAS وSAN، مع إعادة بناء منطقي للمصفوفة دون الكتابة على الأقراص الأصلية.
أرسل كل أقراص المصفوفة مع ترقيمها بترتيبها الأصلي؛ استعادة RAID تحتاج قراءة الأقراص مجتمعة لفهم توزيع البيانات.
أوقف السيرفر فوراً؛ الاستمرار في التشغيل أو إعادة البناء التلقائي قد يضاعف الضرر. نعمل على نسخ من الأقراص لا على الأصل.
الخطوة التالية
أرسل تفاصيل الحالةأوقف النظام قبل أن يصبح العطل مضاعفاً.
أرسل نوع RAID، عدد الأقراص ورسائل الخطأ. نراجع الحالة قبل أي خطوة قد تغيّر بنية البيانات.