🧠 SL5 Aura: تكامل LLM متقدم دون اتصال بالإنترنت

                                **الحالة:** الإنتاج جاهز
                         **المحرك:** أولاما (لاما 3.2 3B)

زمن الوصول: فوري (<0.1 ثانية عند الوصول إلى ذاكرة التخزين المؤقت) / ~20 ثانية (الإنشاء على وحدة المعالجة المركزية)

     ## 1. فلسفة "المهندس المعماري والمتدرب".

تعمل Aura على نموذج هجين لتحقيق التوازن بين الدقة والمرونة:

  • المهندس المعماري (RegEx/Python): التنفيذ الحتمي والفوري لأوامر النظام (على سبيل المثال، “فتح المتصفح”، “رفع الصوت”).

  • المتدرب (ماجستير في القانون المحلي): يتعامل مع الاستفسارات الغامضة والتلخيص والمعرفة العامة. يتم تشغيله فقط في حالة عدم وجود تطابقات صارمة مع القواعد أو استخدام كلمات رئيسية محددة.

                                                                        ---
    
                                              ## 2. هندسة الأداء
    

لجعل LLM محليًا قابلاً للاستخدام على وحدات المعالجة المركزية القياسية دون تسريع وحدة معالجة الرسومات، قمنا بتنفيذ استراتيجية أداء ثلاثية الطبقات:

الطبقة الأولى: “الوضع الفوري” (الكلمات الرئيسية)

   * **Trigger:** كلمات مثل "Instant"، و"Schnell"، و"Sofort".
  • المنطق: يتجاوز LLM بالكامل. يقوم بمقارنة الكلمات الأساسية التي يدخلها المستخدم مع قاعدة بيانات SQLite المحلية باستخدام مجموعة التقاطع. * زمن الوصول: < 0.05 ثانية

الطبقة الثانية: ذاكرة التخزين المؤقت الذكية (SQLite)

  • المنطق: يتم تجزئة كل مطالبة (SHA256). قبل أن نسأل أولاما، نقوم بالتحقق من llm_cache.db.

  • ميزة “التباين النشط”: حتى في حالة وجود نتيجة لذاكرة التخزين المؤقت، يقوم النظام أحيانًا (باحتمال 20%) بإنشاء متغير جديد لتعلم عبارات مختلفة لنفس السؤال. من الناحية المثالية، نقوم بتخزين حوالي 5 متغيرات لكل سؤال.

  • ميزة “التجزئة الدلالية”: بالنسبة للأسئلة الطويلة (> 50 حرفًا)، نستخدم LLM لاستخراج الكلمات الرئيسية أولاً (على سبيل المثال، “دليل التثبيت”) وتجزئة تلك الكلمات بدلاً من الجملة الكاملة. يتطابق هذا مع “كيف أقوم بالتثبيت؟” مع “تعليمات التثبيت من فضلك”. * زمن الوصول: ~0.1 ثانية

الطبقة الثالثة: إنشاء واجهة برمجة التطبيقات (الاحتياطي)

  • المنطق: في حالة عدم وجود ذاكرة تخزين مؤقت، فإننا نسمي واجهة برمجة تطبيقات Ollama (http://localhost:11434/api/generate). * تحسين:

  • الحدود الصارمة: num_predict=60 يفرض على النموذج التوقف بعد 40 كلمة تقريبًا.

  • أنابيب الإدخال: يتم تمرير النصوص الكبيرة (README) عبر STDIN لتجنب حدود وسيطات نظام التشغيل.

  • زمن الوصول: ~15-25 ثانية (يعتمد على وحدة المعالجة المركزية)

                                                                        ---
    
                    ## 3. نظام التأريض (مضاد للهلوسة)
    

تميل LLMs العامة إلى اختراع عناصر واجهة المستخدم الرسومية (الأزرار والقوائم). نقوم بإدخال AURA_TECH_PROFILE الصارم في كل مطالبة النظام:

  1. لا توجد واجهة مستخدم رسومية: Aura هي خدمة CLI مقطوعة الرأس.

  2. لا توجد ملفات تكوين: المنطق هو كود Python، وليس .json/.xml.

  3. المشغلات: يعمل التحكم الخارجي من خلال إنشاء الملفات (touch /tmp/sl5_record.trigger)، وليس واجهات برمجة التطبيقات.

  4. التثبيت: يستغرق من 10 إلى 20 دقيقة بسبب تنزيلات طراز 4 جيجابايت (يمنع كذبة “يتم التثبيت في 3 ثوانٍ”).

                                                                       ---
    
                              ## 4. جسر الحافظة (أمان Linux)
    

لا يمكن لخدمات الخلفية (systemd) الوصول إلى حافظة X11/Wayland مباشرة بسبب العزل الأمني.

  • الحل: يعكس البرنامج النصي لجلسة المستخدم (clipboard_bridge.sh) محتوى الحافظة إلى ملف قرص RAM (/tmp/aura_clipboard.txt).

  • Aura: يقرأ هذا الملف، ويتجاوز كافة مشكلات الأذونات.

                                                                        ---
    

5. التعلم الذاتي (تدفئة ذاكرة التخزين المؤقت)

          نحن نقدم البرنامج النصي "warm_up_cache.py".
                                  1. يقرأ المشروع `README.md`.
  1. يطلب من LLM أن يخترع أسئلة المستخدم المحتملة حول المشروع.

  2. يحاكي هذه الأسئلة ضد Aura لملء قاعدة البيانات مسبقًا.