コンテンツにスキップ

whisper.cppの文字起こし

HTTPサーバーがOpenAI互換のPOST /v1/audio/transcriptionsエンドポイントを公開している場合、whisper.cppを使用できます。

whisper.cppのHTTPサーバーを起動し、OpenAI互換の文字起こしエンドポイントを公開していることを確認します。

  • POST /v1/audio/transcriptions
  • GET /v1/models または GET /models

TomoriBotが使用している間は、サーバーを実行したままにしてください。エンドポイントURLはサーバーのルート(例: http://127.0.0.1:8022)です。

whisper.cppのビルドが異なるエンドポイント形式を公開している場合は、リクエストをTomoriBotが想定するOpenAI互換の形式にマッピングする薄いラッパーをその前に配置してください。

/provider custom-endpoint addを実行します。

  • capability: transcription
  • api_style: openai-compatible-transcription
  • endpoint_url: whisper.cppサーバーのルートURL

モーダルで以下を設定します。

  • Transcription Model: サーバーが報告するモデル名
  • Transcription Language: 任意の言語ヒント(例: enja

登録すると、エンドポイントはすぐに有効になります。今後、エンドポイントを切り替える場合にのみ/model transcriptionを使用します。

登録後、TomoriBotは音声添付ファイルをバックグラウンドで文字起こしし、チャットコンテキストにテキストを追加します。文字起こしをチャットに表示して投稿したい場合にのみ、/speech transcriptsを使用してください。