常见问题解答(英文)3.8.’2025 星期日¶
1.问:SL5 Aura 是什么? 答:这是一个全系统的离线语音转文本程序。它允许您对计算机(Windows、macOS、Linux)上的任何应用程序进行口授,而无需互联网连接。
2.问:我为什么要使用这个?是什么让它特别? 答:隐私。 您的语音数据 100% 在本地计算机上处理,并且绝不会发送到云端。这使其完全私有且符合 GDPR。
3.问:免费吗? 答:是的,社区版是完全免费和开源的。您可以在我们的 GitHub 上找到代码和安装程序:https://github.com/sl5net/Vosk-System-Listener
4.问:我需要什么才能使用它? 答:一台电脑和一个麦克风。为了获得最佳准确性,我们强烈建议使用专用耳机麦克风,而不是内置笔记本电脑麦克风。
5.问:准确性并不完美。我该如何改进它? 答:尽量以一致的音量和语速清晰地说话。减少背景噪音和使用更好的麦克风会带来最大的不同。 软件定制(高级功能):为了实现更高水平的准确性,SL5 Aura 使用了名为 FuzzyMaps 的强大功能。将它们视为您的个人智能词典。您可以创建带有规则的简单文本文件,以修复常见的、重复出现的识别错误。
示例:如果软件经常听到“get hap”而不是“GitHub”,您可以添加一条规则,每次都会自动更正此问题。
好处:这允许您“教”软件您的特定技术术语、产品名称、缩写,甚至为独特的词汇表创建规则集。通过自定义这些地图,您可以显着提高特定用例的准确性。
第 1 部分:一般问题¶
问:SL5 Auro 是什么? 答:SL5 Auro 是一个全系统的离线语音转文本程序。它允许您将文本听写到计算机上的任何应用程序(例如,电子邮件客户端、文字处理器、代码编辑器)中,而无需互联网连接。
问:“离线”是什么意思以及为什么它很重要? 答:“离线”意味着所有语音处理都直接在您的计算机上进行。您的语音数据永远不会发送到云服务器(例如 Google、Amazon 或 OpenAI)。这提供了最大程度的隐私和安全性,使其成为机密信息(例如律师、医生、记者)的理想选择,并且完全符合 GDPR 等数据保护法规。
问:真的免费吗?有什么问题? 答:“社区版”是100%免费和开源的。没有什么问题。我们相信开源工具的力量。如果您发现该软件有价值并希望支持其持续开发,您可以通过我们的 Ko-fi page 来实现。
问:这个软件适合谁? 答:它适合任何经常写作并希望提高效率的人:作家、学生、程序员、法律和医疗专业人士、身体有缺陷的人或任何只是喜欢说话而不是打字的人。
第 2 部分:安装和设置¶
问:支持哪些操作系统? 答:该软件经过测试并确认可以在 Windows 11、Manjaro Linux、Ubuntu 和 macOS 上运行。
问:如何在 Windows 上安装它? 答:我们提供简单的一键安装程序。它是一个 .Bat 脚本,需要管理权限来设置环境并下载必要的模型。一旦运行,它将为您处理一切。
问:模型的下载量非常大。为什么? 答:语音识别模型使软件能够离线工作。它们包含人工智能理解您的语言所需的所有数据。更大、更精确的模型可能有几千兆字节。我们的新下载器将这些内容分割成更小的、可验证的块,以确保可靠的下载。
问:我使用的是 Linux。流程是怎样的? 答:在 Linux 上,您通常会从 GitHub 克隆存储库并运行安装脚本。此脚本创建 Python 虚拟环境、安装依赖项并启动听写服务。
问:当我在 Windows 上双击“.py”文件时,它会在文本编辑器中打开。我该如何运行它? 答:这是一个常见的 Windows 问题,其中“.py”文件与 Python 解释器没有关联。您不应直接运行单独的 Python 脚本。始终使用提供的主启动脚本(例如“.bat”文件),因为这可确保首先激活正确的环境。
第 3 部分:用法和功能¶
问:我如何实际使用它来听写? 答:首先,通过运行适当的脚本来启动“听写服务”。它将在后台运行。然后,您使用触发器(如热键或专用脚本)来开始和停止录制。然后,识别出的文本将自动输入到当前活动的窗口中。
问:如何提高准确性? 答:1. 使用好的麦克风: 耳机麦克风比笔记本电脑的内置麦克风好得多。 2. 最大限度地减少背景噪音: 安静的环境是关键。 3. 说话清晰: 以一致的速度和音量说话。不要咕哝或着急。 软件定制(高级功能):为了提高准确性,SL5 Auro 使用了名为 FuzzyMaps 的强大功能。将它们视为您的个人智能词典。您可以创建带有规则的简单文本文件,以修复常见的、重复出现的识别错误。
示例:如果软件经常听到“get hap”而不是“GitHub”,您可以添加一条规则,每次都会自动更正此问题。
好处:这允许您“教”软件您的特定技术术语、产品名称、缩写,甚至为独特的词汇表创建规则集。通过自定义这些地图,您可以显着提高特定用例的准确性。
问:我可以切换语言吗? 答:是的。系统支持配置文件的实时“热重载”。您可以在配置中更改语言模型,服务将立即切换到该语言模型,无需重新启动。
问:什么是“语言工具”? 答:LanguageTool 是我们集成的开源语法和风格检查器。将语音转换为文本后,LanguageTool 会自动更正常见的转录错误(例如“正确”与“书写”)并修复标点符号,从而显着改善最终输出。
第 4 部分:故障排除和支持¶
问:我启动了该服务,但当我尝试听写时没有任何反应。 答:检查以下内容:
该服务是否仍在您的终端/控制台中运行?查找任何错误消息。
您的麦克风是否正确选择为操作系统中的默认输入设备?
麦克风是否静音或音量设置太低?
问:我发现了一个错误或有一个新功能的想法。我应该怎么办? 答: 太好了!报告错误或建议功能的最佳位置是在我们的 GitHub repository 上打开“问题”。
5.问:准确性并不完美。我该如何改进它? 答:准确性取决于您的设置和软件定制。
您的设置(基础知识): 尝试以一致的音量和速度清晰地说话。减少背景噪音并使用优质的耳机麦克风而不是笔记本电脑的内置麦克风会产生巨大的差异。
软件定制(高级功能): 为了实现更高级别的准确性,SL5 Auro 使用名为 FuzzyMaps 的强大功能。将它们视为您的个人智能词典。您可以创建带有规则的简单文本文件,以修复常见的、重复出现的识别错误。
示例: 如果软件经常听到“get hap”而不是“GitHub”,您可以添加一条规则,每次都会自动更正此问题。
好处: 这允许您“教授”软件您的特定技术术语、产品名称、缩写,甚至为独特的词汇表创建规则集。通过自定义这些地图,您可以显着提高特定用例的准确性。
架构深入探究:实现连续的“对讲机”式录音¶
我们的听写服务实现了强大的、状态驱动的架构,以提供无缝、连续的录音体验,类似于使用对讲机。系统始终准备好捕获音频,但仅在明确触发时才对其进行处理,从而确保高响应能力和低资源使用率。
这是通过将音频监听循环与处理线程解耦并使用两个关键组件管理系统状态来实现的:“active_session”事件标志和用于操作系统级麦克风控制的“audio_manager”。
状态机逻辑:
该系统在永久循环中运行,由在两个主要状态之间切换的单个热键管理:
监听状态(默认/就绪):
条件:
active_session标志为False。麦克风状态:麦克风已静音至“取消麦克风静音()”。 Vosk 侦听器处于活动状态并等待音频输入。
操作: 当用户按下热键时,状态转换。 “active_session”标志设置为“True”,表示“真正”听写的开始。
PROCESSING状态(用户已发言完毕):
条件: 当“active_session”标志为“True”时,用户按下热键。
麦克风状态: 第一个操作是通过
mute_microphone()立即 静音 麦克风。这会立即停止流向 Vosk 引擎的音频流。行动:
active_session标志设置为False。最终识别的音频块是从 Vosk 检索的。
处理线程随此最终文本启动。
至关重要的是,在“finally”块中,处理线程在完成后执行“unmute_microphone()”。
取消静音信号的“魔力”:
无限循环的关键是最后的“unmute_microphone()”调用。一旦听写“A”的处理完成并且麦克风取消静音,系统会立即自动恢复到 LISTENING 状态。耐心等待的 Vosk 监听器立即再次开始接收音频,准备捕获听写“B”。
这创建了一个高度响应的循环:
按 -> 讲话 -> 按 -> (静音和处理) -> (取消静音和收听)
这种架构确保麦克风仅在文本处理的短暂时间内静音,使用户感觉系统是即时的,同时保持强大的控制并防止录音失控。