
Optimization for Legacy and Resource-Constrained Hardware & Interactive Arabic Chatbot Deployment
يبحث هذا التقرير التقني كيفية تحسين وتسريع تدريب ونشر نماذج الذكاء الاصطناعي باستخدام ONNX Runtime (ORT) . مع تزايد ضخامة النماذج العميقة واستهلاكها العالي للموارد، يبرز التحدي في تشغيلها على الأجهزة ذات الأداء الضعيف أو المحدودة (Legacy & Resource-Constrained Hardware). يقدم البحث حلاً هندسياً متكاملاً يتضمن بناء شبكة عصبية مخصصة للدردشة باللغة العربية (اللهجة الشامية) باستخدام آلية الانتباه (SDPA)، تدريبها على كرت الشاشة، تصديرها لصيغة ONNX المحسنة لتقليل وقت الاستجابة واستهلاك الذاكرة بنسبة كبيرة، ونشرها على منصة Kaggle .
المرحلة 1: تثبيت الحزم وتحميل البيانات ومعالجة الترميز
تثبيت مكتبات (onnxruntime, transformers, torch, kagglehub) ، تحميل محتوى محادثات الشامية arabic-shami-chat ، وتكوين مُرمّز AraBERT Tokenizer (aubmindlab/bert-base-arabertv2) بحجم مفردات 64,000 .
المرحلة 2: بناء الشبكة العصبية المطورة (HighSpeedArabicChatNetwork)
تصميم بنية تعتمد على Scaled Dot-Product Attention (SDPA) يدوياً مع دعم التتبع (Tracing) لضمان التوافق التام مع تصدير رسوميات ONNX البيانية (Graph Optimization و Operator Fusion) .
المرحلة 3: التدريب على كرت الشاشة والتحسين (GPU Training & Loss Masking)
تم التدريب لـ 15 Epochs باستخدام محسن AdamW ودالة الخسارة CrossEntropyLoss مع استبعاد الـ prompt من حساب الخسارة (Loss Masking) حتى وصل معدل الخطأ (Loss) إلى قيمة فائقة الدقة بلغت 0.0391 .
المرحلة 4: التصدير لصيغة ONNX والرفع السحابي
تصدير النموذج المعماري بنجاح باستخدام الأبعاد الديناميكية (Dynamic Axes) وحفظه في مستودع النماذج السحابي على كاجل تحت اسم arabic-onnx-chat لضمان أداء استجابة سريع للغاية على الأجهزة الضعيفة .