### FAQ(영어) 3.8.'2025일 **1. Q: SL5 Aura란 무엇입니까?** A: 시스템 전반에 걸친 오프라인 음성-텍스트 변환 프로그램입니다. 인터넷 연결 없이도 컴퓨터의 모든 응용 프로그램(Windows, macOS, Linux)에 지시할 수 있습니다. **2. Q: 왜 이것을 사용해야 합니까? 무엇이 특별합니까?** A: **개인 정보 보호.** 귀하의 음성 데이터는 로컬 컴퓨터에서 100% 처리되며 클라우드로 전송되지 않습니다. 이를 통해 완전히 비공개이며 GDPR을 준수합니다. **3. Q: 무료인가요?** A: 예, Community Edition은 완전 무료이며 오픈 소스입니다. GitHub: [https://github.com/sl5net/Vosk-System-Listener](https://github.com/sl5net/Vosk-System-Listener)에서 코드와 설치 프로그램을 찾을 수 있습니다. **4. Q: 사용하려면 무엇이 필요합니까?** A: 컴퓨터와 마이크입니다. 최고의 정확성을 위해서는 내장된 노트북 마이크보다 전용 헤드셋 마이크를 사용하는 것이 좋습니다. **5. Q: 정확도가 완벽하지 않습니다. 어떻게 개선할 수 있나요?** A: 일정한 크기와 속도로 명확하게 말하도록 노력하십시오. 배경 소음을 줄이고 더 좋은 마이크를 사용하는 것이 가장 큰 차이를 만듭니다. 소프트웨어 사용자 정의(고급 기능): 다음 단계의 정확성을 위해 SL5 Aura는 FuzzyMaps라는 강력한 기능을 사용합니다. 이것을 개인적이고 지능적인 사전이라고 생각하십시오. 일반적이고 반복되는 인식 오류를 수정하는 규칙이 포함된 간단한 텍스트 파일을 만들 수 있습니다. 예: 소프트웨어가 "GitHub" 대신 "get hap"을 자주 듣는 경우 이를 매번 자동으로 수정하는 규칙을 추가할 수 있습니다. 이점: 이를 통해 소프트웨어에 특정 기술 전문 용어, 제품 이름, 약어를 "교육"하거나 고유한 어휘에 대한 규칙 세트를 만들 수도 있습니다. 이러한 지도를 사용자 정의하면 특정 사용 사례에 대한 정확성을 크게 향상시킬 수 있습니다. *** #### **1부: 일반적인 질문** **Q: SL5 Auro가 무엇인가요?** A: SL5 Auro는 시스템 전반에 걸친 오프라인 음성-텍스트 변환 프로그램입니다. 인터넷 연결 없이도 컴퓨터의 모든 응용 프로그램(예: 이메일 클라이언트, 워드 프로세서, 코드 편집기)에 텍스트를 지시할 수 있습니다. **Q: "오프라인"은 무엇을 의미하며 왜 중요한가요?** A: "오프라인"은 모든 음성 처리가 컴퓨터에서 직접 이루어짐을 의미합니다. 귀하의 음성 데이터는 **절대** 클라우드 서버(예: Google, Amazon 또는 OpenAI)로 전송되지 않습니다. 이는 최대한의 개인 정보 보호 및 보안을 제공하여 기밀 정보(예: 변호사, 의사, 언론인)에 이상적이며 GDPR과 같은 데이터 보호 규정을 완벽하게 준수합니다. **Q: 정말 무료인가요? 문제는 무엇입니까?** A: "Community Edition"은 100% 무료이며 오픈 소스입니다. 캐치가 없습니다. 우리는 오픈 소스 도구의 힘을 믿습니다. 소프트웨어가 가치 있다고 생각하고 지속적인 개발을 지원하려는 경우 [Ko-fi page](https://ko-fi.com/sl5)를 통해 지원하실 수 있습니다. **Q: 이 소프트웨어는 누구를 위한 것인가요?** A: 작가, 학생, 프로그래머, 법률 및 의료 전문가, 신체적인 제약이 있는 사람, 또는 단순히 타이핑보다 말하기를 선호하는 사람 등 글을 많이 쓰고 효율성을 높이고 싶은 모든 사람을 위한 것입니다. #### **2부: 설치 및 설정** **Q: 어떤 운영 체제가 지원되나요?** A: 이 소프트웨어는 테스트를 거쳐 Windows 11, Manjaro Linux, Ubuntu 및 macOS에서 작동하는 것으로 확인되었습니다. **Q: Windows에 어떻게 설치하나요?** A: 우리는 간단한 원클릭 설치 프로그램을 제공합니다. 환경을 설정하고 필요한 모델을 다운로드하기 위해 관리 권한이 필요한 .Bat 스크립트입니다. 일단 실행하면 모든 것을 처리해 줍니다. **Q: 모델 다운로드 용량이 매우 큽니다. 왜?** A: 음성 인식 모델을 통해 소프트웨어가 오프라인으로 작동할 수 있습니다. 여기에는 AI가 귀하의 언어를 이해하는 데 필요한 모든 데이터가 포함되어 있습니다. 더 크고 더 정확한 모델의 크기는 수 기가바이트에 이를 수 있습니다. 우리의 새로운 다운로더는 이를 더 작고 검증 가능한 청크로 분할하여 안정적인 다운로드를 보장합니다. **질문: 저는 Linux를 사용하고 있습니다. 프로세스는 무엇입니까?** A: Linux에서는 일반적으로 GitHub에서 리포지토리를 복제하고 설정 스크립트를 실행합니다. 이 스크립트는 Python 가상 환경을 생성하고, 종속성을 설치하고, 받아쓰기 서비스를 시작합니다. **Q: Windows에서 '.py' 파일을 두 번 클릭하면 텍스트 편집기에서 열립니다. 어떻게 실행하나요?** A: 이는 '.py' 파일이 Python 인터프리터와 연결되지 않는 일반적인 Windows 문제입니다. 개별 Python 스크립트를 직접 실행하면 안 됩니다. 항상 제공된 기본 시작 스크립트(예: '.bat' 파일)를 사용하세요. 이렇게 하면 올바른 환경이 먼저 활성화됩니다. #### **파트 3: 사용법 및 기능** **Q: 받아쓰기를 위해 실제로 어떻게 사용하나요?** A: 먼저 적절한 스크립트를 실행하여 "받아쓰기 서비스"를 시작합니다. 백그라운드에서 실행됩니다. 그런 다음 트리거(예: 단축키 또는 전용 스크립트)를 사용하여 녹음을 시작하고 중지합니다. 그러면 인식된 텍스트가 현재 활성화된 창에 자동으로 입력됩니다. **Q: 정확도를 높이려면 어떻게 해야 하나요?** A: 1. **좋은 마이크를 사용하세요.** 헤드셋 마이크는 노트북에 내장된 마이크보다 훨씬 좋습니다. 2. **배경 소음 최소화:** 조용한 환경이 핵심입니다. 3. **명확하게 말하세요:** 일정한 속도와 크기로 말하세요. 중얼거리거나 서두르지 마세요. 소프트웨어 사용자 정의(고급 성능): 다음 단계의 정확성을 위해 SL5 Auro는 FuzzyMaps라는 강력한 기능을 사용합니다. 이것을 개인적이고 지능적인 사전이라고 생각하십시오. 일반적이고 반복되는 인식 오류를 수정하는 규칙이 포함된 간단한 텍스트 파일을 만들 수 있습니다. 예: 소프트웨어가 "GitHub" 대신 "get hap"을 자주 듣는 경우 이를 매번 자동으로 수정하는 규칙을 추가할 수 있습니다. 이점: 이를 통해 소프트웨어에 특정 기술 전문 용어, 제품 이름, 약어를 "교육"하거나 고유한 어휘에 대한 규칙 세트를 만들 수도 있습니다. 이러한 지도를 사용자 정의하면 특정 사용 사례에 대한 정확성을 크게 향상시킬 수 있습니다. **Q: 언어를 전환할 수 있나요?** 답: 그렇습니다. 시스템은 구성 파일의 실시간 "핫 리로드"를 지원합니다. 구성에서 언어 모델을 변경할 수 있으며 서비스는 다시 시작할 필요 없이 즉시 해당 모델로 전환됩니다. **Q: "LanguageTool"이 무엇인가요?** 답변: LanguageTool은 우리가 통합한 오픈 소스 문법 및 스타일 검사기입니다. 음성이 텍스트로 변환된 후 LanguageTool은 일반적인 전사 오류(예: "오른쪽" 대 "쓰기")를 자동으로 수정하고 구두점을 수정하여 최종 출력을 크게 향상시킵니다. #### **4부: 문제 해결 및 지원** **Q: 서비스를 시작했는데 받아쓰기를 하려고 해도 아무 반응이 없습니다.** 답변: 다음을 확인하세요. 1. 터미널/콘솔에서 서비스가 아직 실행되고 있나요? 오류 메시지를 찾아보세요. 2. 운영 체제에서 마이크가 기본 입력 장치로 올바르게 선택되어 있습니까? 3. 마이크가 음소거되었거나 볼륨이 너무 낮게 설정되어 있습니까? **Q: 버그를 발견했거나 새로운 기능에 대한 아이디어가 있습니다. 어떻게 해야 하나요?** A: 정말 좋아요! 버그를 보고하거나 기능을 제안할 수 있는 가장 좋은 장소는 [GitHub repository](https://github.com/sl5net/Vosk-System-Listener)에서 "문제"를 여는 것입니다. **5. Q: 정확도가 완벽하지 않습니다. 어떻게 개선할 수 있나요?** A: 정확도는 설정과 소프트웨어 사용자 정의에 따라 달라집니다. * **설정(기본):** 일정한 크기와 속도로 명확하게 말하도록 노력하십시오. 배경 소음을 줄이고 노트북에 내장된 마이크 대신 좋은 헤드셋 마이크를 사용하는 것은 큰 차이를 만듭니다. * **소프트웨어 사용자 정의(고급 기능):** 다음 단계의 정확성을 위해 SL5 Auro는 **FuzzyMaps**라는 강력한 기능을 사용합니다. 이것을 개인적이고 지능적인 사전이라고 생각하십시오. 일반적이고 반복되는 인식 오류를 수정하는 규칙이 포함된 간단한 텍스트 파일을 만들 수 있습니다. * **예:** 소프트웨어가 "GitHub" 대신 "get hap"을 자주 듣는 경우, 매번 이를 자동으로 수정하는 규칙을 추가할 수 있습니다. * **이점:** 이를 통해 소프트웨어에 특정 기술 전문 용어, 제품 이름, 약어를 "가르치거나" 고유한 어휘에 대한 규칙 세트를 만들 수도 있습니다. 이러한 지도를 사용자 정의하면 특정 사용 사례에 대한 정확성을 크게 향상시킬 수 있습니다. ### 건축 심층 분석: 지속적인 "워키토키" 스타일 녹음 달성 당사의 받아쓰기 서비스는 강력한 상태 기반 아키텍처를 구현하여 워키토키를 사용하는 것과 유사한 원활하고 지속적인 녹음 환경을 제공합니다. 시스템은 항상 오디오를 캡처할 준비가 되어 있지만 명시적으로 트리거된 경우에만 처리하여 높은 응답성과 낮은 리소스 사용량을 보장합니다. 이는 처리 스레드에서 오디오 청취 루프를 분리하고 'active_session' 이벤트 플래그와 OS 수준 마이크 제어를 위한 'audio_manager'라는 두 가지 주요 구성 요소로 시스템 상태를 관리함으로써 달성됩니다. **상태 머신 로직:** 시스템은 두 가지 기본 상태 사이를 전환하는 단일 단축키로 관리되는 영구 루프에서 작동합니다. 1. **LISTENING 상태(기본값/준비):** * **조건:** `active_session` 플래그가 `False`입니다. * **마이크 상태:** 마이크가 '마이크 음소거 해제()'로 **음소거**되었습니다. Vosk 리스너가 활성화되어 오디오 입력을 기다리고 있습니다. * **작업:** 사용자가 단축키를 누르면 상태가 전환됩니다. 'active_session' 플래그는 'True'로 설정되어 '실제' 받아쓰기의 시작을 알립니다. 2. **PROCESSING 상태(사용자가 말하기를 마쳤습니다):** * **조건:** `active_session` 플래그가 `True`인 동안 사용자가 단축키를 누릅니다. * **마이크 상태:** **첫 번째 작업**은 `mute_microphone()`을 통해 마이크를 즉시 **음소거**하는 것입니다. 그러면 Vosk 엔진으로의 오디오 스트림이 즉시 중단됩니다. * **행동:** * `active_session` 플래그가 `False`로 설정되었습니다. * 최종 인식된 오디오 청크는 Vosk에서 검색됩니다. * 처리 스레드는 이 최종 텍스트로 시작됩니다. * 결정적으로 'finally' 블록 내에서 처리 스레드는 완료 시 'unmute_microphone()'을 실행합니다. **음소거 해제 신호의 "마법":** 무한 루프의 핵심은 마지막 `unmute_microphone()` 호출입니다. 받아쓰기 'A' 처리가 완료되고 마이크의 음소거가 해제되자마자 시스템은 자동으로 즉시 **LISTENING** 상태로 되돌아갑니다. 인내심을 갖고 기다리던 Vosk 청취자는 즉시 오디오 수신을 다시 시작하여 'B' 받아쓰기를 캡처할 준비가 되었습니다. 이는 반응성이 뛰어난 주기를 생성합니다. `누르기 -> 말하기 -> 누르기 -> (음소거 및 처리) -> (음소거 해제 및 듣기)` 이 아키텍처는 텍스트 처리의 짧은 기간 동안만 마이크가 음소거되도록 보장하여 시스템이 사용자에게 즉각적인 느낌을 주면서 강력한 제어를 유지하고 폭주 녹음을 방지합니다.