Engine for Resource-Constrained Deployment (k3rf-hybrid-arabic Project)
يقدم هذا البحث محرك K3-RAG، وهو محرك استرجاع وتوليد معزز (RAG) خفيف الوزن مصمم للعمل بالكامل على الأجهزة الضعيفة وموارد الحوسبة المحدودة (مثل جلسات الـ CPU المنفردة أو كرت الشاشة المجاني برام ضئيلة) . لا يعتمد النظام على نشر نموذج Kimi K3 الضخم بالكامل (الذي يضم 2.8 تريليون بارامتر)، بل يستخلص الصياغة الرياضية الجوهرية لـ Kimi Delta Attention (KDA) ويطبقها على شبكة مصغرة من طبقتين و128 بعداً، قابلة للتصدير لصيغة ONNX .

بنية شبكة Kimi K3 الأصلية
.png)
بنية شبكة K3RF المبتكرة (Hybrid Arabic)
* توضح الصور أعلاه الانتقال من التعقيد الهائل في نموذج Kimi K3 إلى التبسيط الهيكلي المعتمد في محرك K3-RAG الخاص بنا.
1. معمارية K3RFDeltaEncoder واستخدام ONNX
بناء وحدة ترميز بـ PyTorch مع 4 رؤوس انتباه (Attention Heads) وطبقتين، ثم تصديرها لصيغة k3rf_encoder.onnx لتعتمد على محرك التشغيل السريع ONNX Runtime عبر الـ CPU Execution Provider دون الحاجة لكرت شاشة أثناء الاستعلام .
2. الاسترجاع الهجين (Hybrid Retrieval) وإعادة الترتيب (Random Forest)
دمج مطابقة الكلمات المباشرة (TF-IDF N-grams) مع تشابه المتجهات الناتجة عن نموذج KDA بنسبة ترجيح (0.7 TF-IDF + 0.3 Vector Similarity)، مع استخدام خوارزمية Random Forest Regressor لإعادة ترتيب النتائج بدقة عالية .