コンテンツにスキップ

音声文字起こし (TranscribeAudio)

概要 (What is it?)

TranscribeAudio(音声文字起こし)ノードは、OpenAI のモデルを使用してオーディオ音声をテキストに変換します。複数の文字起こしモデルをサポートしており、直接のモデル設定とエージェントベースの文字起こしの両方に対応しています。

使用する場面 (When would I use it?)

以下のような場面でこのノードを使用します:

  • 音声をテキストに変換したい場合
  • 録音された音声データを文字起こししたい場合
  • オーディオファイルからテキスト情報を抽出したい場合
  • 音声入力をテキスト形式で処理したい場合
  • 音声コンテンツの書き起こしスクリプトを作成したい場合

使い方 (How to use it)

基本セットアップ

  1. ワークフローに TranscribeAudio ノードを追加します
  2. "audio" 入力にオーディオソースを接続します
  3. 文字起こしモデルを選択するか、エージェントを接続します
  4. ノードを実行して文字起こしテキストを生成します

パラメータ一覧 (Parameters)

  • agent: 文字起こしに使用する既存のエージェント設定(オプション)
  • model: 使用する文字起こしモデル(デフォルト: "gpt-4o-mini-transcribe")
  • audio: 文字起こし対象のオーディオファイル(必須)
  • output: 文字起こしされたテキスト出力

出力 (Outputs)

  • output: 音声から文字起こしされたテキスト
  • agent: 文字起こしに使用されたエージェントオブジェクト(他のノードに接続可能)

使用例 (Example)

音声を録音して文字起こしを行う完全なワークフロー:

  1. Microphone ノードを追加して音声を録音します
  2. Microphone の "audio" 出力を TranscribeAudio ノードの "audio" 入力に接続します
  3. 任意の文字起こしモデルを選択します
  4. ワークフローを実行します
  5. "output" パラメータに文字起こしされたテキストが表示されます

重要な注意点 (Important Notes)

  • このノードを使用するには、環境変数 OPENAI_API_KEY として有効な OpenAI API キーが設定されている必要があります
  • 利用可能なモデル:
    • gpt-4o-mini-transcribe
    • gpt-4o-transcribe
    • whisper-1
  • より高度な動作をカスタマイズするために、自身のエージェント設定を渡すことも可能です
  • 文字起こしの品質は、元の音声の音質と選択したモデルに依存します

よくある問題 (Common Issues)

  • API キーが見つからない: 環境変数に OpenAI API キーが正しく設定されているか確認してください
  • オーディオが提供されていない: "audio" 入力ピンに有効なオーディオソースが接続されているか確認してください
  • 文字起こしの精度が低い: 別のモデルを試すか、入力オーディオの録音品質を改善してください
  • 処理エラー: 非常に長時間のオーディオファイルや極端にノイズが多い音声の場合、認識精度が低下したり処理エラーが発生したりする場合があります