العودة للمكتبة

K3-RAG: A Lightweight, Kimi-Delta-Attention-Inspired Retrieval-Augmented Generation Engine

Engine for Resource-Constrained Deployment (k3rf-hybrid-arabic Project)

ملخص البحث والأهداف

يقدم هذا البحث محرك K3-RAG، وهو محرك استرجاع وتوليد معزز (RAG) خفيف الوزن مصمم للعمل بالكامل على الأجهزة الضعيفة وموارد الحوسبة المحدودة (مثل جلسات الـ CPU المنفردة أو كرت الشاشة المجاني برام ضئيلة) . لا يعتمد النظام على نشر نموذج Kimi K3 الضخم بالكامل (الذي يضم 2.8 تريليون بارامتر)، بل يستخلص الصياغة الرياضية الجوهرية لـ Kimi Delta Attention (KDA) ويطبقها على شبكة مصغرة من طبقتين و128 بعداً، قابلة للتصدير لصيغة ONNX .

المراجع المستوحى منها الفكرة (Kimi K3)

مقارنة البنية العصبية (Neural Network Architecture)

Kimi K3 Architecture

بنية شبكة Kimi K3 الأصلية

K3RF Hybrid Arabic Architecture

بنية شبكة K3RF المبتكرة (Hybrid Arabic)

* توضح الصور أعلاه الانتقال من التعقيد الهائل في نموذج Kimi K3 إلى التبسيط الهيكلي المعتمد في محرك K3-RAG الخاص بنا.

مراحل وبنية المحرك (Pipeline Architecture)

1. معمارية K3RFDeltaEncoder واستخدام ONNX

بناء وحدة ترميز بـ PyTorch مع 4 رؤوس انتباه (Attention Heads) وطبقتين، ثم تصديرها لصيغة k3rf_encoder.onnx لتعتمد على محرك التشغيل السريع ONNX Runtime عبر الـ CPU Execution Provider دون الحاجة لكرت شاشة أثناء الاستعلام .

2. الاسترجاع الهجين (Hybrid Retrieval) وإعادة الترتيب (Random Forest)

دمج مطابقة الكلمات المباشرة (TF-IDF N-grams) مع تشابه المتجهات الناتجة عن نموذج KDA بنسبة ترجيح (0.7 TF-IDF + 0.3 Vector Similarity)، مع استخدام خوارزمية Random Forest Regressor لإعادة ترتيب النتائج بدقة عالية .

فيديو توضيحي: K3-RAG Model Architecture & Execution

الموارد وكفاءة الأداء

  • استهلاك الذاكرة (RAM): ~1.6 GiB فقط (من أصل 30 GiB متاحة) .
  • استهلاك كرت الشاشة (GPU): 0.00% (يعتمد بالكامل على المعالج CPU لتخفيف الحمل) .
  • البيانات: Wikipedia-Abstract (Arabic subset) .
  • المحرك: ONNX Runtime CPU Execution Provider .