🧠 SL5 Aura:高级离线 LLM 集成¶
状态: 生产就绪 发动机: Ollama (Llama 3.2 3B) 延迟: 即时(缓存命中时 <0.1 秒)/~20 秒(CPU 上生成)
1.“架构师+实习生”的理念¶
Aura 采用混合模型来平衡精确和灵活性:
架构师 (RegEx/Python): 系统命令的确定性即时执行(例如,“打开浏览器”、“提高音量”)。
实习生(本地法学硕士): 处理模糊查询、总结和常识。仅当没有严格规则匹配或使用特定关键字时才会触发。
2. 性能架构¶
为了使本地 LLM 可在没有 GPU 加速的标准 CPU 上使用,我们实施了 3 层性能策略:
第 1 层:“即时模式”(关键词)¶
触发: 像“Instant”、“Schnell”、“Sofort”这样的词。
逻辑: 完全绕过法学硕士。它使用集合交集将用户输入关键字与本地 SQLite 数据库进行比较。
延迟: < 0.05s
第 2 层:智能缓存 (SQLite)¶
逻辑: 每个提示都经过哈希处理 (SHA256)。在询问 Ollama 之前,我们先检查“llm_cache.db”。
功能“主动变体”: 即使存在缓存命中,系统有时(20% 的机会)也会生成新的变体来学习同一问题的不同措辞。理想情况下,我们为每个问题存储约 5 个变体。
功能“语义哈希”: 对于长问题(> 50 个字符),我们首先使用 LLM 提取关键字(例如“安装指南”)并对这些关键字而不是完整的句子进行哈希处理。这与“如何安装?”相匹配。与“请安装说明”。
延迟: ~0.1s
第 3 层:API 生成(后备)¶
逻辑: 如果不存在缓存,我们调用 Ollama API (
http://localhost:11434/api/generate)。优化:
硬限制:
num_predict=60强制模型在大约 40 个单词后停止。输入管道: 大文本(自述文件)通过 STDIN 传递,以避免操作系统参数限制。
延迟: ~15-25s(取决于 CPU)
3.系统接地(防幻觉)¶
通用法学硕士倾向于发明 GUI 元素(按钮、菜单)。我们将严格的 AURA_TECH_PROFILE 注入到每个系统提示符中:
无 GUI: Aura 是一项无头 CLI 服务。
无配置文件: 逻辑是Python代码,而不是
.json/.xml。触发器: 外部控制通过文件创建(
touch /tmp/sl5_record.trigger)而不是 API 来工作。安装: 由于需要 4GB 模型下载,因此需要 10-20 分钟(防止“3 秒内安装”谎言)。
4. 剪贴板桥(Linux 安全)¶
由于安全隔离,后台服务(systemd)无法直接访问X11/Wayland剪贴板。
解决方案: 用户会话脚本 (
clipboard_bridge.sh) 将剪贴板内容镜像到 RAM 磁盘文件 (/tmp/aura_clipboard.txt)。Aura: 读取此文件,绕过所有权限问题。
5. 自学习(缓存预热)¶
我们提供了一个“warm_up_cache.py”脚本。
它读取项目
README.md。它要求法学硕士提出有关该项目的可能的用户问题。 3.它针对Aura模拟这些问题来预填充数据库。