音声文字起こし (TranscribeAudio)
概要 (What is it?)
TranscribeAudio(音声文字起こし)ノードは、OpenAI のモデルを使用してオーディオ音声をテキストに変換します。複数の文字起こしモデルをサポートしており、直接のモデル設定とエージェントベースの文字起こしの両方に対応しています。
使用する場面 (When would I use it?)
以下のような場面でこのノードを使用します:
- 音声をテキストに変換したい場合
- 録音された音声データを文字起こししたい場合
- オーディオファイルからテキスト情報を抽出したい場合
- 音声入力をテキスト形式で処理したい場合
- 音声コンテンツの書き起こしスクリプトを作成したい場合
使い方 (How to use it)
基本セットアップ
- ワークフローに TranscribeAudio ノードを追加します
- "audio" 入力にオーディオソースを接続します
- 文字起こしモデルを選択するか、エージェントを接続します
- ノードを実行して文字起こしテキストを生成します
パラメータ一覧 (Parameters)
- agent: 文字起こしに使用する既存のエージェント設定(オプション)
- model: 使用する文字起こしモデル(デフォルト: "gpt-4o-mini-transcribe")
- audio: 文字起こし対象のオーディオファイル(必須)
- output: 文字起こしされたテキスト出力
出力 (Outputs)
- output: 音声から文字起こしされたテキスト
- agent: 文字起こしに使用されたエージェントオブジェクト(他のノードに接続可能)
使用例 (Example)
音声を録音して文字起こしを行う完全なワークフロー:
- Microphone ノードを追加して音声を録音します
- Microphone の "audio" 出力を TranscribeAudio ノードの "audio" 入力に接続します
- 任意の文字起こしモデルを選択します
- ワークフローを実行します
- "output" パラメータに文字起こしされたテキストが表示されます
重要な注意点 (Important Notes)
- このノードを使用するには、環境変数
OPENAI_API_KEYとして有効な OpenAI API キーが設定されている必要があります - 利用可能なモデル:
gpt-4o-mini-transcribegpt-4o-transcribewhisper-1
- より高度な動作をカスタマイズするために、自身のエージェント設定を渡すことも可能です
- 文字起こしの品質は、元の音声の音質と選択したモデルに依存します
よくある問題 (Common Issues)
- API キーが見つからない: 環境変数に OpenAI API キーが正しく設定されているか確認してください
- オーディオが提供されていない: "audio" 入力ピンに有効なオーディオソースが接続されているか確認してください
- 文字起こしの精度が低い: 別のモデルを試すか、入力オーディオの録音品質を改善してください
- 処理エラー: 非常に長時間のオーディオファイルや極端にノイズが多い音声の場合、認識精度が低下したり処理エラーが発生したりする場合があります