よくある質問 (英語) 2025 年 3 月 8 日 (日)

1. Q: SL5 オーラとは何ですか? A: これは、システム全体にわたるオフラインの音声テキスト変換プログラムです。インターネット接続を必要とせずに、コンピューター上の任意のアプリケーション (Windows、macOS、Linux) に音声入力することができます。

2. Q: なぜこれを使用する必要があるのですか?何が特別なのでしょうか? A: プライバシー 音声データは 100% ローカル マシンで処理され、クラウドに送信されることはありません。これにより、完全にプライベートになり、GDPR に準拠したものになります。

3. Q: 無料ですか? A: はい、Community Edition は完全に無料で、オープンソースです。コードとインストーラーは、GitHub: https://github.com/sl5net/Vosk-System-Listener で見つけることができます。

4. Q: 使用するには何が必要ですか? A: コンピューターとマイクです。最高の精度を得るには、ラップトップの内蔵マイクではなく、専用のヘッドセット マイクを強くお勧めします。

5. Q: 精度は完璧ではありません。どうすれば改善できますか? A: 一定の音量とペースではっきりと話すようにしてください。バックグラウンドノイズを低減し、より優れたマイクを使用すると、大きな違いが生まれます。 ソフトウェアのカスタマイズ (高度なパワー): 次のレベルの精度を実現するために、SL5 Aura は FuzzyMaps と呼ばれる強力な機能を使用します。これらを個人用のインテリジェントな辞書と考えてください。一般的な繰り返し発生する認識エラーを修正するためのルールを含む単純なテキスト ファイルを作成できます。

例: ソフトウェアが「GitHub」ではなく「get hap」を頻繁に聞く場合、これを毎回自動的に修正するルールを追加できます。

利点: これにより、特定の専門用語、製品名、略語をソフトウェアに「教える」ことができ、さらには固有の語彙のルールセットを作成することもできます。これらのマップをカスタマイズすると、特定のユースケースの精度を大幅に向上させることができます。


パート 1: 一般的な質問

Q: SL5 Auro とは何ですか? A: SL5 Auro は、システム全体にわたるオフラインの音声テキスト変換プログラムです。これを使用すると、インターネット接続を必要とせずに、コンピュータ上の任意のアプリケーション (電子メール クライアント、ワード プロセッサ、コード エディタなど) にテキストを書き込むことができます。

Q: 「オフライン」とは何を意味しますか?また、それがなぜ重要ですか? A: 「オフライン」とは、すべての音声処理がコンピュータ上で直接行われることを意味します。音声データがクラウド サーバー (Google、Amazon、OpenAI など) に送信されることは決してありません。これにより最大限のプライバシーとセキュリティが提供され、機密情報 (弁護士、医師、ジャーナリストなど) に最適であり、GDPR などのデータ保護規制に完全に準拠します。

Q: 本当に無料ですか?何が問題ですか? A: 「コミュニティ エディション」は完全に無料で、オープンソースです。引っかかりはありません。私たちはオープンソース ツールの力を信じています。ソフトウェアに価値があり、継続的な開発をサポートしたい場合は、Ko-fi page 経由でサポートできます。

Q: このソフトウェアは誰を対象としていますか? A: ライター、学生、プログラマー、法律専門家、医療専門家、身体的制限のある人、または単純にタイピングよりも話すことを好む人など、たくさんの文章を書く人、効率を上げたい人向けです。

パート 2: インストールとセットアップ

Q: どのオペレーティング システムがサポートされていますか? A: このソフトウェアは、Windows 11、Manjaro Linux、Ubuntu、macOS でテストされ、動作することが確認されています。

Q: Windows にインストールするにはどうすればよいですか? A: シンプルなワンクリックインストーラーを提供しています。これは、環境をセットアップし、必要なモデルをダウンロードするために管理者権限を必要とする .Bat スクリプトです。一度実行すると、すべてを処理してくれます。

Q: モデルのダウンロードは非常に大きくなります。なぜ? A: 音声認識モデルにより、ソフトウェアがオフラインで動作できるようになります。これらには、AI が言語を理解するために必要なすべてのデータが含まれています。より大きく、より正確なモデルのサイズは数ギガバイトになる場合があります。新しいダウンローダーは、信頼性の高いダウンロードを保証するために、これらを検証可能な小さなチャンクに分割します。

Q: Linux を使用しています。プロセスは何ですか? A: Linux では、通常、GitHub からリポジトリのクローンを作成し、セットアップ スクリプトを実行します。このスクリプトは、Python 仮想環境を作成し、依存関係をインストールし、ディクテーション サービスを開始します。

Q: Windows 上で「.py」ファイルをダブルクリックすると、テキスト エディタで開きます。どのように実行すればよいですか? A: これは、「.py」ファイルが Python インタープリターに関連付けられていないという Windows でよくある問題です。個々の Python スクリプトを直接実行しないでください。正しい環境が最初にアクティブ化されるようにするため、提供されているメインの起動スクリプト (「.bat」 ファイルなど) を常に使用してください。

パート 3: 使用法と機能

Q: 実際にディクテーションにどのように使用すればよいですか? A: まず、適切なスクリプトを実行して「ディクテーション サービス」を開始します。バックグラウンドで実行されます。次に、トリガー (ホットキーや専用スクリプトなど) を使用して録画を開始および停止します。認識されたテキストは、現在アクティブなウィンドウに自動的に入力されます。

Q: 精度を向上するにはどうすればよいですか? A: 1. 優れたマイクを使用する: ヘッドセット マイクはラップトップの内蔵マイクよりもはるかに優れています。 2. 周囲の騒音を最小限に抑える: 静かな環境が重要です。 3. はっきりと話す: 一定のペースと音量で話します。つぶやいたり、急かしたりしないでください。 ソフトウェアのカスタマイズ (高度なパワー): 次のレベルの精度を実現するために、SL5 Auro は FuzzyMaps と呼ばれる強力な機能を使用します。これらを個人用のインテリジェントな辞書と考えてください。一般的な繰り返し発生する認識エラーを修正するためのルールを含む単純なテキスト ファイルを作成できます。

例: ソフトウェアが「GitHub」ではなく「get hap」を頻繁に聞く場合、これを毎回自動的に修正するルールを追加できます。

利点: これにより、特定の専門用語、製品名、略語をソフトウェアに「教える」ことができ、さらには固有の語彙のルールセットを作成することもできます。これらのマップをカスタマイズすると、特定の使用例の精度を大幅に向上させることができます。

Q: 言語を切り替えることはできますか? A: はい。システムは、構成ファイルのライブ「ホットリロード」をサポートしています。構成で言語モデルを変更すると、サービスは再起動することなく即座にその言語モデルに切り替わります。

Q: 「LanguageTool」とは何ですか? A: LanguageTool は、私たちが統合したオープンソースの文法およびスタイル チェッカーです。スピーチがテキストに変換されると、LanguageTool は一般的な書き起こしエラー (「正しい」と「書く」など) を自動的に修正し、句読点を修正して、最終出力を大幅に改善します。

パート 4: トラブルシューティングとサポート

Q: サービスを開始しましたが、口述入力しても何も起こりません。 A: 以下を確認してください。

  1. サービスは端末/コンソールでまだ実行されていますか?エラー メッセージがないか探します。

  2. マイクはオペレーティング システムのデフォルトの入力デバイスとして正しく選択されていますか?

  3. マイクがミュートになっているか、音量の設定が低すぎませんか?

Q: バグを見つけたか、新しい機能のアイデアがあります。どうすればいいですか? A:それはすごいですね!バグを報告したり、機能を提案したりするには、GitHub repository で「問題」を開くのが最適です。

5. Q: 精度は完璧ではありません。どうすれば改善できますか? A: 精度はセットアップとソフトウェアのカスタマイズの両方に依存します。

  • 設定 (基本): 一定の音量とペースではっきりと話すようにしてください。バックグラウンドノイズを低減し、ラップトップの内蔵マイクの代わりに優れたヘッドセットマイクを使用すると、大きな違いが生じます。

  • ソフトウェア カスタマイズ (高度なパワー): 次のレベルの精度を実現するために、SL5 Auro は FuzzyMaps と呼ばれる強力な機能を使用します。これらを個人用のインテリジェントな辞書と考えてください。一般的な繰り返し発生する認識エラーを修正するためのルールを含む単純なテキスト ファイルを作成できます。

  • 例: ソフトウェアが「GitHub」ではなく「get hap」を頻繁に聞く場合は、これを毎回自動的に修正するルールを追加できます。

  • 利点: これにより、特定の専門用語、製品名、略語をソフトウェアに「教える」ことができ、さらには固有の語彙のルールセットを作成することもできます。これらのマップをカスタマイズすると、特定の使用例の精度を大幅に向上させることができます。

アーキテクチャの詳細: 連続的な「トランシーバー」スタイルの録音の実現

当社のディクテーション サービスは、堅牢な状態駆動型のアーキテクチャを実装し、トランシーバーを使用するのと同じような、シームレスで継続的な録音エクスペリエンスを提供します。システムは常にオーディオをキャプチャする準備ができていますが、明示的にトリガーされた場合にのみオーディオを処理するため、高い応答性とリソース使用量の削減が保証されます。

これは、オーディオ リスニング ループを処理スレッドから切り離し、2 つの主要なコンポーネント (「active_session」 イベント フラグと OS レベルのマイク制御用の「audio_manager」) でシステム状態を管理することによって実現されます。

ステート マシン ロジック:

システムは永続ループで動作し、次の 2 つの主な状態を切り替える単一のホットキーによって管理されます。

  1. リスニング状態 (デフォルト/準備完了):

  • 条件: active_session フラグは False です。

  • マイクのステータス: unmute Microphone() により、マイクは ミュートされています。 Vosk リスナーはアクティブで、音声入力を待っています。

  • アクション: ユーザーがホットキーを押すと、状態が遷移します。 「active_session」フラグが「True」に設定され、「実際の」ディクテーションの開始を通知します。

  1. PROCESSING 状態 (ユーザーが話し終えた):

  • 条件: active_session フラグが True であるときに、ユーザーがホットキーを押します。

  • マイクのステータス: 最初のアクションは、mute_microphone() を介してマイクを直ちに ミュートすることです。これにより、Vosk エンジンへのオーディオ ストリームが即座に停止されます。

  • アクション:

  • active_session フラグは False に設定されます。

  • 最終的に認識されたオーディオ チャンクは Vosk から取得されます。

  • 処理スレッドはこの最終テキストで起動されます。

  • 重要なのは、finally ブロック内で、処理スレッドは完了時に unmute_microphone() を実行することです。

ミュート解除信号の「魔法」:

無限ループの鍵は、最後の unmute_microphone() 呼び出しです。ディクテーション「A」の処理が完了し、マイクのミュートが解除されるとすぐに、システムは自動的かつ即座に LISTENING 状態に戻ります。辛抱強く待っていた Vosk リスナーは、すぐに再び音声の受信を開始し、ディクテーション ‘B’ をキャプチャする準備が整います。

これにより、応答性の高いサイクルが作成されます。 押す -> 話す -> 押す -> (ミュートして処理) -> (ミュートを解除して聞く)

このアーキテクチャにより、マイクはテキスト処理の短時間のみミュートされるため、堅牢な制御を維持し、暴走録音を防止しながら、システムがユーザーに瞬時に感じられるようになります。