Olmo-core 3 من AI2: بنية تدريب مفتوحة لنماذج MoE حتى 2.38 تريليون معامل
⚡ خبر عاجل
Hugging Face
2 أكتوبر 20265 دقائق2

Olmo-core 3 من AI2: بنية تدريب مفتوحة لنماذج MoE حتى 2.38 تريليون معامل

العودة للأخبار
❝

أطلقت AI2 إطار Olmo-core 3 لتدريب نماذج mixture-of-experts مفتوحة المصدر قابلة للتوسع حتى 2.38 تريليون معامل. حقق الإطار إنتاجية أعلى بـ2.7× مقارنة بالتنفيذ السابق على 8 وحدات NVIDIA B300، ورفع الإنتاجية 21% عبر MXFP8 مع خفض الذاكرة من 103 إلى 95 جيجابايت.

الموجز الإحصائي السريع

أعلن معهد Allen Institute for AI (AI2) رسمياً عبر مدونة Hugging Face إطلاق Olmo-core 3، وهو ترقية جوهرية لإطار تطوير النماذج اللغوية الكبيرة، يتضمن نظام تدريب مفتوح معاد التصميم لنماذج mixture-of-experts (MoE). الإطار متاح فوراً عبر GitHub مع تقرير تقني وعرض تفاعلي، ومصمم للتوسع حتى نطاق تريليون معامل مع الحفاظ على الكفاءة الحسابية.

📊 بطاقة البيانات والمواصفات التقنية الرسمية

المحور التقنيالبيانات الرسمية المؤكدة
💰 الأسعار وتكلفة الاستخداممفتوح المصدر بالكامل ومتاح مجاناً على GitHub. لا توجد طبقات اشتراك أو تسعير بالتوكنز؛ التكلفة تقع على عاتق المستخدم في استئجار وحدات GPU. البنشماركات الرسمية أُجريت على NVIDIA B300.
🌐 المنصات والتوفر الفوريمتاح فوراً عبر GitHub (كود مفتوح) وHugging Face (تقرير تقني + عرض تفاعلي). يعمل على مجموعات NVIDIA B300 GPU. قابل للتكيف مع أجهزة مختلفة وفق البيان الرسمي.
⚡ الأداء ومؤشرات السرعة52,000 توكن/ثانية/GPU على 8 وحدات B300 مقابل 19,400 سابقاً (2.7× إنتاجية). MXFP8 يرفع الإنتاجية 21% مقابل BF16. أعلى إنتاجية مُقاسة: 858 TFLOP/s/GPU على 512 وحدة B300. توسيع مجمع الخبراء من 8 إلى 128 خفّض الإنتاجية بأقل من 5%.
🛡️ الأمان ومقاومة الاختراقلم يتضمن البيان الرسمي معايير أمنية أو حماية من Prompt Injection؛ التركيز منصب على بنية التدريب والكفاءة الحسابية.
🧠 سياق الذاكرة (Context Window)لم يُحدد رقم نافذة سياق في هذا الإعلان. البيان يذكر أن الجيل القادم من Olmo سيُدرَّب بـ"أطول نافذة سياق" في تاريخ Olmo دون رقم محدد.
🌍 دعم اللغة العربية والمنطقةالإطار بنية تدريب وليس نموذجاً جاهزاً؛ دعم اللغة يعتمد على بيانات التدريب التي يختارها المطور. متاح عالمياً عبر GitHub دون قيود جغرافية، ما يتيح للباحثين العرب بناء نماذج MoE عربية مخصصة.

تفاصيل الإعلان والميزات التقنية الجديدة

يمثل Olmo-core 3 تحولاً معمارياً في طريقة تدريب نماذج MoE داخل عائلة Olmo. بينما استخدم OlmoE السابق معمارية MoE بـ64 خبيراً موجهاً، واعتمد Olmo 3 معمارية dense، يأتي Olmo-core 3 بنظام تدريب مصمم خصيصاً لنماذج MoE الأكبر بكثير. التحول الأبرز هو الانتقال من fully sharded data parallelism (FSDP) إلى distributed data parallelism (DDP)، حيث تُبقى الأوزان مقيمة على وحدات GPU وتُوجَّه البيانات إليها، ما يلغي إعادة تجميع الأوزان المتكررة لكل دفعة صغيرة.

يدمج الإطار ثلاث تقنيات لتوزيع النموذج: expert parallelism لتوزيع الخبراء عبر وحدات GPU، وpipeline parallelism لتقسيم الطبقات عبر مجموعات GPU، وdistributed optimizer لتوزيع حالة المحسّن بدلاً من تكرارها. كما يضيف تحسينات تشغيلية: rowwise expert parallelism لوضع البيانات الموجّهة مباشرة في مخازن إدخال الخبراء، وGPU-resident routing لإبقاء بيانات التوجيه على GPU، وgrouped GEMM لدمج حسابات الخبراء الصغيرة. ويدعم الإطار MXFP8، وهو تنسيق رقمي منخفض الدقة يقلل الحساب وحركة البيانات بين وحدات GPU.

في بنشمارك موسّع، رفع الفريق مجمع الخبراء من 8 إلى 128 مع اختيار 4 خبراء فقط لكل توكن، مع تثبيت المعاملات النشطة عند نحو 3.2 مليار. نما إجمالي سعة المعاملات من 4.6 مليار إلى 47 مليار، بينما انخفضت إنتاجية التدريب بأقل من 5% فقط — وهو دليل قوي على كفاءة التوسع.

المقارنة المعيارية والأداء التنافسي

يُقارن Olmo-core 3 مباشرة بـNVIDIA Megatron-Core، وهو الخيار الراسخ لتدريب نماذج MoE الكبيرة. ميزة Olmo-core 3 هي تقديم حزمة تدريب MoE متكاملة داخل الإطار المفتوح خلف Olmo، مع تحسين الإنتاجية على التنفيذ السابق القائم على FSDP. في اختبار أولي على 8 وحدات NVIDIA B300، سجّل نموذج MoE بـ47 مليار معامل 52,000 توكن/ثانية/GPU مقابل 19,400 في التنفيذ القديم — أي 2.7× إنتاجية. وعلى 4 وحدات B300، رفع MXFP8 الإنتاجية 21% مقابل BF16 مع خفض الذاكرة النشطة القصوى من 103 إلى 95 جيجابايت، وجاء معظم التحسن من حسابات feed-forward ونقل البيانات بين الخبراء. وعلى نطاق 512 وحدة B300، بلغ أعلى إنتاجية مُلاحَظة 858 TFLOP/s/GPU على نموذج بـ1.2 تريليون معامل و58.36 مليار معامل نشط لكل توكن.

ماذا يعني هذا للمطور والمستخدم العربي؟ (The Localization Edge)

Olmo-core 3 ليس نموذجاً جاهزاً بل بنية تدريب مفتوحة، وهذا يمنح المطور العربي فرصة استراتيجية لبناء نماذج MoE عربية مخصصة بكفاءة توكنز عالية. قدرة الإطار على توسيع مجمع الخبراء من 8 إلى 128 بخسارة أقل من 5% في الإنتاجية تعني أن الفرق العربية الناشئة يمكنها تدريب نماذج متعددة الخبراء متخصصة في الفصحى واللهجات دون مضاعفة تكاليف GPU. دعم MXFP8 يقلل الذاكرة النشطة من 103 إلى 95 جيجابايت ويرفع الإنتاجية 21%، ما يخفض تكلفة الساعة السحابية على منصات مثل AWS وGoogle Cloud. عملياً، يمكن لمشاريع المعالجة اللغوية العربية استخدام الإطار لتدريب نماذج توجيه ذكي للنصوص القانونية أو الطبية أو التعليمية، مع تحكم كامل في توزيع الخبراء حسب المجالات اللغوية.

الخلاصة والتطلعات القادمة

يمثل Olmo-core 3 خطوة جوهرية في استراتيجية AI2 لفتح البنية التحتية للتدريب وليس فقط أوزان النماذج. الأداء المُقاس — 2.7× إنتاجية، 21% تحسن عبر MXFP8، وتوسع حتى 2.38 تريليون معامل — يضعه كبديل مفتوح جدي لـMegatron-Core. الخطوة التالية هي الجيل القادم من Olmo بمعمارية MoE، مدرب على أكبر مجموعة بيانات وأطول نافذة سياق في تاريخ العائلة، وهو ما سيكون اختباراً حقيقياً لقدرة الإطار على إنتاج نماذج تنافسية على نطاق الإنتاج.

المصدر الإعلامي: Hugging Face | البيان الرسمي للشركة: المصدر الأصلي | تدقيق وتحليل البيانات: AI Tools Oasis

المصدر الأصلي:Hugging Faceتمت صياغة هذا الخبر بناءً على تغطية Hugging Face

أسئلة شائعة

AI Tools Oasis

فريق AI Tools Oasis

نقدم لك أحدث الأخبار والتحليلات في عالم الذكاء الاصطناعي بدقة ومصداقية. تابعنا للحصول على كل جديد.

أخبار ذات صلة