NVIDIA Kumo Tabular: نموذج تأسيسي مفتوح للبيانات الجدولية بتصنيف أول في 4 معايير
⚡ خبر عاجل
Hugging Face
29 سبتمبر 20264 دقائق2

NVIDIA Kumo Tabular: نموذج تأسيسي مفتوح للبيانات الجدولية بتصنيف أول في 4 معايير

العودة للأخبار
❝

أطلقت NVIDIA نموذج Kumo Tabular المفتوح للتنبؤ بالبيانات الجدولية على Hugging Face بثلاثة أحجام (28M إلى 215M معامل) دون تدريب أو ضبط أو هندسة ميزات. يتصدر النموذج أربعة معايير قياسية (TabArena، BeyondArena، TALENT، ScoringBench) بدرجة ELO 1950 وأسرع 17 مرة من LimiX-2، بترخيص OpenMDW-1.1 للاستخدام التجاري.

الموجز الإحصائي السريع

أعلنت NVIDIA رسمياً عن إطلاق NVIDIA Kumo Tabular، نموذج تأسيسي مفتوح للبيانات الجدولية، متاحاً فوراً على Hugging Face ضمن مجموعة NVIDIA Kumo Structured. النموذج يتنبأ بتسميات الصفوف الجديدة في تمريرة أمامية واحدة دون تدريب أو ضبط أو هندسة ميزات، ويتصدر أربعة معايير قياسية عالمية.

📊 بطاقة البيانات والمواصفات التقنية الرسمية

المحور التقنيالبيانات الرسمية المؤكدة
💰 الأسعار وتكلفة الاستخداممجاني بالكامل — نموذج مفتوح المصدر بترخيص OpenMDW-1.1 للاستخدام التجاري دون رسوم ترخيص. التكلفة الوحيدة هي استهلاك GPU للتشغيل (متوافق مع RTX 6000 Pro).
🌐 المنصات والتوفر الفوريHugging Face (الأوزان: huggingface.co/nvidia/Kumo-Tabular)، GitHub (الكود: github.com/NVIDIA/structured-data-models)، مكتبة NVIDIA GPU-native للبيانات المهيكلة، تشغيل محلي عبر GPU.
⚡ الأداء ومؤشرات السرعةELO 1950 على TabArena (المركز الأول)، أسرع 17 مرة من LimiX-2 على RTX 6000 Pro، ELO 1418 على BeyondArena مع Improvability 7.78%، المركز الأول على TALENT وScoringBench.
🛡️ الأمان ومقاومة الاختراقيتبع سياسات NVIDIA Trustworthy AI. لا يعالج نصوصاً حرة (فقط أعمدة رقمية وفئوية) مما يقلل سطح هجوم Prompt Injection. يُنصح بالتحقق من الدقة والمعايرة على بيانات محجوزة قبل النشر.
🧠 سياق الذاكرة (Context Window)يتعامل مع جداول سياق تصل إلى 60,000 صف و100 عمود في مرحلة التدريب الثالثة. التمريرة الواحدة تغطي حتى 10 فئات، وتُوسَّع لأي عدد فئات عبر Error-Correcting Output Codes.
🌍 دعم اللغة العربية والمنطقةلا يدعم النصوص الخام مباشرة (رقمي وفئوي فقط). يمكن ترميز النصوص العربية كأعمدة فئوية أو ميزات رقمية عبر وصفات المعالجة المدمجة. متاح عالمياً بما يشمل المنطقة العربية عبر Hugging Face.

تفاصيل الإعلان والميزات التقنية الجديدة

يأتي Kumo Tabular بمعمارية Transformer مبنية حول بنية الجدول نفسها، تستخدم انتباه الأعمدة والصفوف والسياق المستمد من TabICL وTabPFN. يتكون النموذج من ثلاث مراحل: تضمين الخلايا (Cell Embedding) حيث تتحول مجموعة الخلايا إلى رمز عبر Fourier features مع أوزان منفصلة للقيم الرقمية والفئوية، وتضمين الصفوف (Row Embedding) عبر تناوب انتباه الأعمدة (بتكلفة خطية مع عدد الصفوف) وانتباه الصفوف مع 4 رموز [CLS] قابلة للتعلم، وأخيراً التعلم السياقي (In-context Learning) حيث تتعامل صفوف الاستعلام مع صفوف السياق فقط مما يسمح بإعادة استخدام المفاتيح والقيم للتنبؤات اللاحقة عبر Test-GQA.

من الابتكارات الجوهرية ميزة Length-aware Attention Temperature التي تعالج تلاشي الانتباه مع نمو الجداول: يتم قياس كل استعلام بدرجة حرارة تنمو لوغاريتمياً مع عدد المفاتيح، بمعامل يُتعلم منفصلاً لكل رأس انتباه. النموذج دُرّب حصرياً على جداول اصطناعية مولّدة من Structural Causal Model (SCM) عبر ست خطوات، ورأى Kumo Tabular-Small/Medium/Large حوالي 35/71/137 مليون جدول اصطناعي على التوالي. للانحدار، يُخرج النموذج 999 كمية (quantile) لاشتقاق التنبؤ النقطي وتقدير عدم اليقين.

المقارنة المعيارية والأداء التنافسي

على معيار TabArena، حقق Kumo Tabular المركز الأول بدرجة ELO 1950 متفوقاً على الأشجار المعززة المضبوطة وAutoGluon وأحدث النماذج التأسيسية الجدولية، مع سرعة تفوق LimiX-2 بـ 17 مرة في إعداد تقييم موحد على RTX 6000 Pro. على BeyondArena، بلغ ELO 1418 مع درجة Improvability 7.78% محتلاً الصدارة. على TALENT، حقق أفضل ترتيب عام بمتوسط رتب 6.67 لدقة التصنيف و3.98 لـ log-loss التصنيف و4.22 لـ RMSE الانحدار. على ScoringBench المخصص للتوزيعات التنبؤية، احتل Kumo Tabular-Large وMedium المركزين الأول والثاني بمتوسط الترتيب.

ماذا يعني هذا للمطور والمستخدم العربي؟ (The Localization Edge)

رغم أن Kumo Tabular لا يعالج النصوص العربية الخام مباشرة، إلا أن قيمته للمطور العربي تكمن في كفاءة التوكنز والاستدلال: تمريرة أمامية واحدة على جداول تصل إلى 60,000 صف تعني أن تكلفة التطوير تنخفض جذرياً مقارنة بتدريب نماذج مخصصة لكل مهمة. بالنسبة للشركات الناشئة في العالم العربي التي تعمل على بيانات العملاء والمعاملات والطلبات، يمكن ترميز النصوص العربية كأعمدة فئوية (مثل تصنيفات المنتجات أو المحافظات) والاستفادة من النموذج للتنبؤ بالتسرب أو الطلب أو التصنيف الائتماني دون بنية تحتية ضخمة. الترخيص التجاري المجاني عبر OpenMDW-1.1 يزيل حاجز التكلفة أمام المشاريع العربية، بينما تبقى الحاجة لتحقق محلي من الدقة والمعايرة على البيانات الإقليمية أمراً ضرورياً قبل النشر الإنتاجي.

الخلاصة والتطلعات القادمة

يمثل Kumo Tabular نقلة نوعية في مسار البيانات الجدولية من نماذج تُدرَّب من الصفر لكل مهمة إلى نموذج تأسيسي واحد يتعلم سياقياً. مع تصدره أربعة معايير وترخيص تجاري مفتوح، يضع NVIDIA معياراً جديداً على حدود الدقة-الكفاءة. الخطوة التالية المنتظرة هي إطلاق وصفات التدريب ومولّدات البيانات الاصطناعية التي أعلنت NVIDIA أنها ستنشرها قريباً، مما سيتيح للمجتمع البحثي بناء نماذج جدولية مخصصة.

المصدر الإعلامي: Hugging Face | البيان الرسمي للشركة: المصدر الأصلي | تدقيق وتحليل البيانات: AI Tools Oasis

المصدر الأصلي:Hugging Faceتمت صياغة هذا الخبر بناءً على تغطية Hugging Face

أسئلة شائعة

AI Tools Oasis

فريق AI Tools Oasis

نقدم لك أحدث الأخبار والتحليلات في عالم الذكاء الاصطناعي بدقة ومصداقية. تابعنا للحصول على كل جديد.

أخبار ذات صلة