فالكون-إماراتي 7B: نموذج يتقن اللهجة الإماراتية بدقة 84.83% على معيار Alyah
أعلن معهد الابتكار التكنولوجي (TII) عن إطلاق Falcon-Emirati-7B، نموذج متخصص في اللهجة الإماراتية مبني على معمارية Falcon-H1 الهجينة (Mamba + Transformer). حقق النموذج 84.83% على معيار Alyah المرجعي، متفوقاً على نماذج أكبر منه حجماً، مع فارق حاسم في دقة اللهجة (0.52 مقابل 0.05 لأقرب منافس). يهم هذا السوق العربي لأنه يغلق فجوة الفهم الثقافي واللغوي التي تعجز عنها النماذج العامة.
الموجز الإحصائي السريع
أعلن معهد الابتكار التكنولوجي (TII) في الإمارات عن إطلاق Falcon-Emirati-7B، نموذج لغوي متخصص في اللهجة الإماراتية مبني على عائلة Falcon-H1-Arabic. حقق النموذج 84.83% على معيار Alyah المرجعي، مع دقة لهجة بلغت 0.52 مقابل 0.05 لأقرب منافس، مما يمثل فارقاً يقارب عشرين ضعفاً في القدرة على الرد باللهجة الإماراتية بدلاً من الفصحى.
📊 بطاقة البيانات والمواصفات التقنية الرسمية
| المحور التقني | البيانات الرسمية المؤكدة |
|---|---|
| 💰 الأسعار وتكلفة الاستخدام | النموذج مفتوح المصدر ومتاح مجاناً عبر Hugging Face. لا توجد تسعيرة رسمية منشورة للـ Tokens في البيان الصحفي؛ يُنصح بالرجوع إلى صفحة النموذج الرسمية للحصول على أحدث تفاصيل الترخيص والاستخدام التجاري. |
| 🌐 المنصات والتوفر الفوري | Hugging Face (منصة الإطلاق الرسمية). النموذج متاح للتحميل والاستخدام المباشر عبر الرابط: https://huggingface.co/blog/tiiuae/falcon-emirati |
| ⚡ الأداء ومؤشرات السرعة | دقة 84.83% على معيار Alyah (1,173 عينة متعددة الخيارات). دقة اللهجة 0.52 (ائتمان جزئي) مقابل 0.05 لـ ALLaM، 0.03 لـ gemma-3-27b-it، 0.02 لـ Jais-2-8B-Chat، و0.00 لـ Fanar-2-27B-Instruct. معدل الامتناع عن الإجابة: أقل من 5% لـ Falcon-Emirati-7B مقابل 26.2% لـ Fanar-2-27B-Instruct. |
| 🛡️ الأمان ومقاومة الاختراق | لم يذكر البيان الرسمي معايير أمان محددة أو تقييمات مقاومة Prompt Injection. يُوصى بمراجعة بطاقة النموذج على Hugging Face للحصول على تفاصيل السلامة والاستخدام المسؤول. |
| 🧠 سياق الذاكرة (Context Window) | حتى 128K و256K رمزاً (Token) موروثة من عائلة Falcon-H1-Arabic (أحجام 3B، 7B، 34B). |
| 🌍 دعم اللغة العربية والمنطقة | دعم متخصص للهجة الإماراتية (Gulf dialect) مع فهم ثقافي للتراث والشعر النبطي والأمثال. مبني على Falcon-H1-Arabic المدرب على مزيج من الفصحى واللهجات الخليجية والشامية والمصرية والمغاربية والإنجليزية. |
تفاصيل الإعلان والميزات التقنية الجديدة
يأتي Falcon-Emirati-7B كخطوة متخصصة فوق عائلة Falcon-H1-Arabic التي سبق أن حققت معايير قياسية في اللغة العربية. يعتمد النموذج على معمارية Falcon-H1 الهجينة التي تجمع بين نماذج فضاء الحالة (Mamba) وآلية الانتباه (Transformer Attention) بالتوازي داخل كل كتلة، مع دمج المخرجات قبل الإسقاط. يمنح هذا التصميم كفاءة خطية للسلاسل الطويلة مع الحفاظ على دقة الانتباه للاعتماديات البعيدة، وهو أمر بالغ الأهمية للغة العربية ذات الصرف الغني. تم اختيار حجم 7B تحديداً لأنه يمثل نقطة التوازن المثلى بين القدرة على استيعاب الفروق الدقيقة في اللهجة، وبين كفاءة التدريب والاستدلال العملي. النموذج الأكبر 34B قد يرفع الجودة قليلاً لكن بتكلفة تدريب وتشغيل غير مبررة لنموذج محادثة متخصص بلهجة، بينما 3B لا يوفر العمق الكافي للفهم الثقافي واللغوي المطلوب.
تم بناء خط أنابيب بيانات إماراتي مخصص يعتمد على ثلاثة مصادر متكاملة: أولاً، بيانات ويب أصلية باللهجة الإماراتية تم جمعها من مواقع ومنتديات إماراتية مكتوبة أصلاً باللهجة وليس مترجمة من الفصحى، وهي مصدر الحقيقة الأرضية للعبارات اليومية والتعبيرات العامية. ثانياً، بيانات بالفصحى عن الثقافة والهوية الإماراتية تشمل العادات والقيم والتاريخ والمعايير الاجتماعية، لتعليم النموذج السياق الثقافي وليس فقط اللغة. ثالثاً، بيانات تركيبية ضخمة مولدة وفق قواعد صارمة ومعاجم ومصطلحات مخصصة للمفردات والقواعد الإماراتية، مما يضمن أصالة المخرجات بدلاً من العربية الخليجية العامة. تم إجراء تجارب استئصال (Ablations) لتحديد أفضل مزيج من البيانات ومراحل التدريب، مع الاعتماد على مزيج من التقييم الآلي ومراجعة الناطقين الأصليين.
المقارنة المعيارية والأداء التنافسي
على معيار Alyah المكون من 1,173 عينة متعددة الخيارات تم جمعها يدوياً من متحدثين إماراتيين أصليين، حقق Falcon-Emirati-7B دقة 84.83%، متقدماً على جميع النماذج العربية ومتعددة اللغات التي تمت مقارنته بها، بما في ذلك نماذج أكبر منه حجماً. في تقييم LLM-as-Judge للتوليد المفتوح على نفس الأسئلة، سجل Falcon-Emirati-7B دقة لهجة 0.52 (ائتمان جزئي) مقابل 0.05 لـ ALLaM-7B-Instruct-preview، و0.03 لـ gemma-3-27b-it، و0.02 لـ Jais-2-8B-Chat، و0.00 لـ Fanar-2-27B-Instruct. هذا الفارق يقارب عشرين ضعفاً في أدنى المستويات، ويعني عملياً أن النماذج الأخرى غالباً ما تعرف الإجابة الصحيحة لكنها تقدمها بالفصحى افتراضياً حتى عند السؤال باللهجة الإماراتية. كما سجل Fanar-2-27B-Instruct أعلى معدل امتناع عن الإجابة بلغ 26.2% مقابل أقل من 5% لجميع النماذج الأخرى، مما يشير إلى محدودية قدرته على التفاعل مع المحتوى الإماراتي.
ماذا يعني هذا للمطور والمستخدم العربي؟ (The Localization Edge)
يمثل Falcon-Emirati-7B نقلة نوعية في كفاءة التوكنز للنصوص العربية واللهجية، حيث يقلل الحاجة إلى إعادة الصياغة أو الترجمة الوسيطة التي تستهلك توكنز إضافية وتفقد الدقة الثقافية. بالنسبة للمشاريع الناشئة في العالم العربي، يوفر النموذج بديلاً مفتوح المصدر بحجم 7B يمكن تشغيله بتكلفة استدلال معقولة على بنية تحتية محلية أو سحابية، مما يخفض تكاليف التطوير مقارنة بالنماذج التجارية الكبيرة. تشمل حالات الاستخدام العملية: تطبيقات خدمة العملاء باللهجة الإماراتية، منصات المحتوى الثقافي والتراثي، أدوات التعليم التفاعلي، وتحليل المشاعر في وسائل التواصل الاجتماعي الإماراتية. كما يفتح الباب أمام تطوير نماذج لهجية مماثلة للهجات الخليجية والشامية والمغاربية باستخدام نفس المنهجية.
الخلاصة والتطلعات القادمة
يثبت Falcon-Emirati-7B أن الكفاءة اللهجية لا تُشترى بالحجم وحده، بل تتطلب تدريباً موجهاً وبيانات أصلية وتقييماً متخصصاً. النتائج على معيار Alyah تُظهر أن النماذج العامة، حتى العملاقة منها، تتراجع بشكل كبير عند الانتقال إلى المحتوى اللهجي والثقافي المدمج. الخطوة التالية المتوقعة هي توسيع هذه المنهجية لتشمل لهجات عربية أخرى، وتطوير نماذج أكبر حجماً مع الحفاظ على كفاءة الاستدلال، وربما إطلاق واجهات API رسمية ونماذج مضبوطة تعليمياً (Instruction-Tuned) للاستخدام التجاري المباشر.
المصدر الإعلامي: Hugging Face | البيان الرسمي للشركة: المصدر الأصلي | تدقيق وتحليل البيانات: AI Tools Oasis
أسئلة شائعة

فريق AI Tools Oasis
نقدم لك أحدث الأخبار والتحليلات في عالم الذكاء الاصطناعي بدقة ومصداقية. تابعنا للحصول على كل جديد.