🧠 SL5 Aura:高级离线 LLM 集成

状态: 生产就绪 发动机: Ollama (Llama 3.2 3B) 延迟: 即时(缓存命中时 <0.1 秒)/~20 秒(CPU 上生成)

1.“架构师+实习生”的理念

Aura 采用混合模型来平衡精确灵活性

  • 架构师 (RegEx/Python): 系统命令的确定性即时执行(例如,“打开浏览器”、“提高音量”)。

  • 实习生(本地法学硕士): 处理模糊查询、总结和常识。仅当没有严格规则匹配或使用特定关键字时才会触发。


2. 性能架构

为了使本地 LLM 可在没有 GPU 加速的标准 CPU 上使用,我们实施了 3 层性能策略

第 1 层:“即时模式”(关键词)

  • 触发: 像“Instant”、“Schnell”、“Sofort”这样的词。

  • 逻辑: 完全绕过法学硕士。它使用集合交集将用户输入关键字与本地 SQLite 数据库进行比较。

  • 延迟: < 0.05s

第 2 层:智能缓存 (SQLite)

  • 逻辑: 每个提示都经过哈希处理 (SHA256)。在询问 Ollama 之前,我们先检查“llm_cache.db”。

  • 功能“主动变体”: 即使存在缓存命中,系统有时(20% 的机会)也会生成新的变体来学习同一问题的不同措辞。理想情况下,我们为每个问题存储约 5 个变体。

  • 功能“语义哈希”: 对于长问题(> 50 个字符),我们首先使用 LLM 提取关键字(例如“安装指南”)并对这些关键字而不是完整的句子进行哈希处理。这与“如何安装?”相匹配。与“请安装说明”。

  • 延迟: ~0.1s

第 3 层:API 生成(后备)

  • 逻辑: 如果不存在缓存,我们调用 Ollama API (http://localhost:11434/api/generate)。

  • 优化:

  • 硬限制: num_predict=60 强制模型在大约 40 个单词后停止。

  • 输入管道: 大文本(自述文件)通过 STDIN 传递,以避免操作系统参数限制。

  • 延迟: ~15-25s(取决于 CPU)


3.系统接地(防幻觉)

通用法学硕士倾向于发明 GUI 元素(按钮、菜单)。我们将严格的 AURA_TECH_PROFILE 注入到每个系统提示符中:

  1. 无 GUI: Aura 是一项无头 CLI 服务。

  2. 无配置文件: 逻辑是Python代码,而不是.json/.xml

  3. 触发器: 外部控制通过文件创建(touch /tmp/sl5_record.trigger)而不是 API 来工作。

  4. 安装: 由于需要 4GB 模型下载,因此需要 10-20 分钟(防止“3 秒内安装”谎言)。


4. 剪贴板桥(Linux 安全)

由于安全隔离,后台服务(systemd)无法直接访问X11/Wayland剪贴板。

  • 解决方案: 用户会话脚本 (clipboard_bridge.sh) 将剪贴板内容镜像到 RAM 磁盘文件 (/tmp/aura_clipboard.txt)。

  • Aura: 读取此文件,绕过所有权限问题。


5. 自学习(缓存预热)

我们提供了一个“warm_up_cache.py”脚本。

  1. 它读取项目README.md

  2. 它要求法学硕士提出有关该项目的可能的用户问题。 3.它针对Aura模拟这些问题来预填充数据库。