コンテンツにスキップ

WhisperXの文字起こし

WhisperXは、初心者向けに推奨されるローカル文字起こしの方法です。

TomoriBotのリポジトリのルート(TomoriBotをクローンしたフォルダー)から以下のコマンドを実行します。最初のコマンドでSTTサーバーのフォルダーに移動します。

Terminal window
cd servers/stt
python -m venv .venv
.\.venv\Scripts\Activate.ps1
python -m pip install --upgrade pip
pip install -r requirements.txt
python whisperx_server.py
Terminal window
cd servers/stt
python3 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip
python -m pip install -r requirements.txt
python whisperx_server.py

TomoriBotがWhisperXを使用している間は、そのターミナルを開いたままにしてください。デフォルトのエンドポイントURLはhttp://127.0.0.1:8021です。

/provider custom-endpoint addを実行します。

  • capability: transcription
  • api_style: openai-compatible-transcription
  • endpoint_url: http://127.0.0.1:8021

モーダルで以下を設定します。

  • Transcription Model: large-v3、またはWHISPERX_MODELに設定されている値
  • Transcription Language: 任意の言語ヒント(例: enja

登録すると、エンドポイントはすぐに有効になります。今後、エンドポイントを切り替える場合にのみ/model transcriptionを使用します。

登録後、TomoriBotは音声添付ファイルをバックグラウンドで文字起こしし、チャットコンテキストにテキストを追加します。文字起こしをチャットに表示して投稿したい場合にのみ、/speech transcriptsを使用してください。