
MetaRoCE: بروتوكول النقل الجديد من Meta الذي يعيد تصميم شبكات الذكاء الاصطناعي
مقدمة: لماذا أصبحت الشبكة قلب البنية التحتية للذكاء الاصطناعي؟
يعتمد تدريب نماذج الذكاء الاصطناعي المتقدمة وتشغيلها بشكل جوهري على شبكات سريعة وموثوقة قادرة على نقل البيانات بين وحدات المعالجة الرسومية (GPU) دون إهدار دورات المعالجة الثمينة. فكلما زاد حجم النماذج وتعقيدها، أصبحت الشبكة عنصرًا حاسمًا في المسار الحرج للأداء، بحيث لا يقل تأثيرها عن قوة المعالجات نفسها. ومن هنا جاء ابتكار MetaRoCE، بروتوكول النقل الجديد من شركة Meta المصمم من الصفر لخدمة أعباء عمل الذكاء الاصطناعي على شبكات Ethernet القياسية.
يمثّل هذا الإعلان خطوة مهمة في مسار طويل تقوده Meta لدفع الصناعة نحو اعتماد Ethernet كنسيج أساسي للبنية التحتية للذكاء الاصطناعي، بدلاً من الاعتماد على تقنيات شبكية مغلقة ومكلفة.
ما هو MetaRoCE ولماذا يُعد نقلة نوعية؟
يُعرّف MetaRoCE بأنه بروتوكول نقل من فئة RDMA (الوصول المباشر إلى الذاكرة عن بُعد) صُمّم بشكل كامل ومن دون أي إرث تقني سابق يقيّده، وذلك خصيصًا ليعمل على شبكات Ethernet التجارية الشائعة. الفكرة الجوهرية هنا هي تمكين المعالجات من تبادل البيانات فيما بينها بأقل تأخير ممكن وبأعلى إنتاجية، مع تحرير وحدة المعالجة المركزية من عبء إدارة عمليات النقل.
تقنية RDMA ليست جديدة في حد ذاتها، لكن تطبيقها على نطاق يضم ملايين المعالجات الرسومية يطرح تحديات هائلة لم تكن البروتوكولات التقليدية مصممة لمواجهتها. وهنا يأتي دور MetaRoCE بوصفه محاولة لإعادة التفكير في أسس النقل الشبكي بما يتناسب مع طبيعة الحوسبة الحديثة للذكاء الاصطناعي.
تحدي النطاق: عناقيد بمئات الآلاف من المعالجات
نجحت Meta في توسيع نطاق عناقيد الحوسبة الخاصة بها لتضم مئات الآلاف من وحدات المعالجة الرسومية، موزّعة عبر مراكز بيانات ومناطق جغرافية متعددة. وسواء كانت هذه العناقيد تعمل على تدريب الجيل التالي من النماذج المتقدمة أو على تقديم خدمات الاستدلال على نطاق عالمي، فإن الشبكة تظل دائمًا في قلب المسار الحرج للعمليات.
ولفهم حجم التحدي، يمكن تلخيص أبرز النقاط التي تجعل الشبكة عاملاً فارقًا فيما يلي:
- عمليات التزامن الجماعية: تعتمد عمليات مثل all-reduce وall-to-all على مزامنة آلاف المسرّعات في الوقت نفسه أثناء التدريب.
- قاعدة أبطأ عملية نقل: في هذه العمليات الجماعية، تحدّد أبطأ عملية نقل وتيرة المهمة بأكملها، مما يعني أن أي بطء بسيط قد يعطّل النظام كله.
- حساسية الاستدلال للتأخير: في مرحلة الاستدلال، يؤثر التواصل منخفض التأخير بين أجزاء النموذج الموزّعة تأثيرًا مباشرًا على أزمنة الاستجابة لمئات الملايين من المستخدمين.
- إهدار الطاقة الحوسبية: حتى القدر البسيط من الاحتكاك الشبكي قد يؤدي إلى تعطيل قدرة حوسبية كبيرة وإبقائها عاطلة عن العمل.
الفرق الجوهري بين MetaRoCE وبروتوكول RoCE القياسي
يكمن جزء كبير من ابتكار MetaRoCE في الطريقة التي يتعامل بها مع حركة البيانات مقارنةً ببروتوكول RoCE التقليدي. فالبروتوكول القياسي يفترض أن الشبكة ستوصل كل إطار بيانات بالترتيب الصحيح، معتمدًا على آلية التحكم بالتدفق المعروفة باسم PFC، ومثبّطًا لأسلوب توزيع الحزم (packet spraying) الذي يوفّر أداءً عاليًا في الشبكات متعددة المستويات وواسعة النطاق.
هذا الافتراض يعمل جيدًا في الشبكات الأصغر حجمًا، لكنه يصبح عائقًا حقيقيًا عند التوسع إلى مستوى ملايين المعالجات. لذلك صُمّم MetaRoCE ليتجاوز هذه القيود ويقدّم مجموعة من المزايا الأساسية:
- إنتاجية عالية: القدرة على نقل كميات ضخمة من البيانات دون اختناقات.
- تأخير طرفي منخفض: تقليل زمن التأخير في أسوأ الحالات، وهو ما يُعرف بـ tail latency، الذي يمثّل عائقًا كبيرًا في العمليات الجماعية.
- بساطة تشغيلية: الحفاظ على سهولة الإدارة حتى مع نمو الشبكة وزيادة أعداد المسرّعات المتصلة بها.
هذا التصميم يجعل البروتوكول أكثر مرونة في التعامل مع الشبكات الضخمة، ويسمح باستغلال أساليب توزيع الحمل الحديثة بدلاً من الاعتماد الصارم على ترتيب الحزم.
الانفتاح عبر مشروع Open Compute Project
من أبرز ما يميّز هذا ال




