🧠 SL5 Aura: 고급 오프라인 LLM 통합¶
상태: 생산 준비 완료 엔진: 올라마(Llama 3.2 3B) 지연 시간: 즉시(캐시 적중 시 <0.1초) / ~20초(CPU에서 생성)
1. ‘건축가 & 인턴’ 철학¶
Aura는 정밀도와 유연성의 균형을 맞추기 위해 하이브리드 모델을 운영합니다.
아키텍트(RegEx/Python): 시스템 명령(예: “브라우저 열기”, “볼륨 크게”)에 대한 결정적이고 즉각적인 실행입니다.
인턴(로컬 LLM): 퍼지 쿼리, 요약 및 일반 지식을 처리합니다. 엄격한 규칙 일치가 없거나 특정 키워드가 사용되는 경우에만 트리거됩니다.
2. 성능 아키텍처¶
GPU 가속 없이 표준 CPU에서 로컬 LLM을 사용할 수 있도록 하기 위해 3계층 성능 전략을 구현했습니다.
레이어 1: “인스턴트 모드”(키워드)¶
트리거: “Instant”, “Schnell”, “Sofort”와 같은 단어입니다.
논리: LLM을 완전히 우회합니다. 이는 교차 집합을 사용하여 사용자 입력 키워드를 로컬 SQLite 데이터베이스와 비교합니다.
지연 시간: < 0.05초
레이어 2: 스마트 캐시(SQLite)¶
논리: 모든 프롬프트는 해시됩니다(SHA256). Ollama에게 문의하기 전에
llm_cache.db를 확인합니다.“활성 변형” 기능: 캐시 적중이 존재하더라도 시스템은 때때로(20% 확률) 동일한 질문에 대해 다른 표현을 학습하기 위해 새 변형을 생성합니다. 이상적으로는 질문당 최대 5개의 변형을 저장합니다.
“의미적 해싱” 기능: 긴 질문(50자 이상)의 경우 LLM을 사용하여 먼저 키워드(예: “설치 가이드”)를 추출하고 전체 문장 대신 해시합니다. 이는 “어떻게 설치하나요?”와 일치합니다. “설치 지침을 알려주세요”라는 메시지가 표시됩니다.
지연 시간: ~0.1초
레이어 3: API 생성(대체)¶
논리: 캐시가 없으면 Ollama API(
http://localhost:11434/api/generate)를 호출합니다.최적화:
엄격한 제한:
num_predict=60을 입력하면 최대 40단어 후에 모델이 중지됩니다.입력 파이프: OS 인수 제한을 피하기 위해 큰 텍스트(README)가 STDIN을 통해 전달됩니다.
지연 시간: ~15~25초(CPU에 따라 다름)
3. 시스템 접지(환각 방지)¶
일반 LLM은 GUI 요소(버튼, 메뉴)를 만드는 경향이 있습니다. 우리는 모든 시스템 프롬프트에 엄격한 **AURA_TECH_PROFILE**을 삽입합니다.
GUI 없음: Aura는 헤드리스 CLI 서비스입니다.
구성 파일 없음: 로직은
.json/.xml이 아닌 Python 코드입니다.트리거: 외부 제어는 API가 아닌 파일 생성(
touch /tmp/sl5_record.trigger)을 통해 작동합니다.설치: 4GB 모델 다운로드로 인해 10~20분 정도 소요됩니다(“3초 안에 설치됩니다”라는 거짓말 방지).
4. 클립보드 브리지(Linux 보안)¶
보안 격리로 인해 백그라운드 서비스(systemd)는 X11/Wayland 클립보드에 직접 액세스할 수 없습니다.
해결책: 사용자 세션 스크립트(
clipboard_bridge.sh)는 클립보드 내용을 RAM 디스크 파일(/tmp/aura_clipboard.txt)로 미러링합니다.Aura: 모든 권한 문제를 우회하여 이 파일을 읽습니다.
5. 자가 학습(캐시 워밍)¶
우리는 warm_up_cache.py 스크립트를 제공합니다.
README.md프로젝트를 읽습니다.LLM에게 프로젝트에 관해 사용자가 예상할 수 있는 질문을 만들어내도록 요청합니다.
데이터베이스를 미리 채우기 위해 Aura에 대해 이러한 질문을 시뮬레이션합니다.