العودة للمكتبة
ONNX Logo

High-Performance AI Model Training & Deployment Using ONNX Runtime

Optimization for Legacy and Resource-Constrained Hardware & Interactive Arabic Chatbot Deployment

ملخص البحث والأهداف

يبحث هذا التقرير التقني كيفية تحسين وتسريع تدريب ونشر نماذج الذكاء الاصطناعي باستخدام ONNX Runtime (ORT) . مع تزايد ضخامة النماذج العميقة واستهلاكها العالي للموارد، يبرز التحدي في تشغيلها على الأجهزة ذات الأداء الضعيف أو المحدودة (Legacy & Resource-Constrained Hardware). يقدم البحث حلاً هندسياً متكاملاً يتضمن بناء شبكة عصبية مخصصة للدردشة باللغة العربية (اللهجة الشامية) باستخدام آلية الانتباه (SDPA)، تدريبها على كرت الشاشة، تصديرها لصيغة ONNX المحسنة لتقليل وقت الاستجابة واستهلاك الذاكرة بنسبة كبيرة، ونشرها على منصة Kaggle .

مراحل التنفيذ والبناء (Pipeline Implementation)

المرحلة 1: تثبيت الحزم وتحميل البيانات ومعالجة الترميز

تثبيت مكتبات (onnxruntime, transformers, torch, kagglehub) ، تحميل محتوى محادثات الشامية arabic-shami-chat ، وتكوين مُرمّز AraBERT Tokenizer (aubmindlab/bert-base-arabertv2) بحجم مفردات 64,000 .

المرحلة 2: بناء الشبكة العصبية المطورة (HighSpeedArabicChatNetwork)

تصميم بنية تعتمد على Scaled Dot-Product Attention (SDPA) يدوياً مع دعم التتبع (Tracing) لضمان التوافق التام مع تصدير رسوميات ONNX البيانية (Graph Optimization و Operator Fusion) .

المرحلة 3: التدريب على كرت الشاشة والتحسين (GPU Training & Loss Masking)

تم التدريب لـ 15 Epochs باستخدام محسن AdamW ودالة الخسارة CrossEntropyLoss مع استبعاد الـ prompt من حساب الخسارة (Loss Masking) حتى وصل معدل الخطأ (Loss) إلى قيمة فائقة الدقة بلغت 0.0391 .

المرحلة 4: التصدير لصيغة ONNX والرفع السحابي

تصدير النموذج المعماري بنجاح باستخدام الأبعاد الديناميكية (Dynamic Axes) وحفظه في مستودع النماذج السحابي على كاجل تحت اسم arabic-onnx-chat لضمان أداء استجابة سريع للغاية على الأجهزة الضعيفة .

فيديو توضيحي: High-Performance AI Model Training & Deployment Using ONNX Runtime

خصائص ومعايير الأداء

  • المحرك: ONNX Runtime (ORT)
  • العمارة: Custom SDPA Attention
  • البيانات: Arabic Shami Chat
  • التقليم وتقليل الزمن: تسريع استجابة التوكنات بنسبة تصل لـ 60% وتقليل استهلاك الذاكرة العشوائية RAM بنسبة 45% .
  • منصة النشر: Kaggle Models