コンテンツにスキップ

音声の抽出 (ExtractAudio)

概要 (What is it?)

ExtractAudio ノードは、動画から音声トラック(オーディオ)を抽出し、ワークフロー内で使用できる独立したオーディオファイルとして出力します。複数のオーディオ形式や品質設定をサポートし、再エンコードなしのロスレスコピー抽出や各種フォーマットへの変換が可能です。

使用する場面 (When would I use it?)

以下のような場面でこのノードを使用します:

  • 音声処理パイプラインのために動画から音声成分を分離したい場合
  • 動画内の音声を異なるフォーマット(MP3, WAV, AAC など)に変換したい場合
  • 動画素材からポッドキャストなどの音声専用コンテンツを作成したい場合
  • 音声文字起こし(文字起こしノード TranscribeAudio など)や音声分析のためにオーディオを抽出したい場合
  • 再エンコードせずに元の音質を 100% 保持したまま高速に音声を抜き出したい場合

使い方 (How to use it)

基本セットアップ

  1. ワークフローに ExtractAudio ノードを追加します
  2. ビデオソースを "video" 入力に接続します
  3. 目的の音声フォーマット(audio_format)と品質(audio_quality)を選択します
  4. "extracted_audio" 出力を音声入力を必要とするノードに接続します

パラメータ一覧 (Parameters)

入力 (Input)

  • video: 音声を抽出するビデオコンテンツ(VideoArtifact および VideoUrlArtifact をサポート)

音声設定 (Audio Settings)

  • audio_format: 出力音声フォーマット

    • mp3(デフォルト): 幅広い互換性、高効率な圧縮
    • wav: 非圧縮、最高音質
    • aac: モダンな高圧縮標準規格
    • flac: 可逆圧縮(ロスレス)
    • ogg: オープンソースの高圧縮フォーマット
    • m4a: Apple エコシステムで標準的な AAC 形式
  • audio_quality: 音質 / ビットレート設定

    • high (128k): ほとんどの用途に適した高音質(デフォルト)
    • medium (96k): 音質とファイルサイズのバランス
    • low (64k): 音声(会話)中心でサイズを抑えたい場合
    • copy: 再エンコードなしで元の音声をそのままコピー抽出(最速・無劣化)

出力 (Outputs)

  • extracted_audio: 動画から抽出された音声(AudioUrlArtifact)
  • logs: 抽出処理の詳細ログ

使用例 (Example)

動画から音声を抽出して AI による自動文字起こしを行う例:

  1. ワークフローに ExtractAudio ノードを追加します
  2. ビデオソースを video 入力に接続します
  3. 文字起こしモデルとの互換性を高めるため audio_format を wav に設定します
  4. 高い認識精度を維持するため audio_quality を high に設定します
  5. extracted_audio 出力を TranscribeAudio ノードの入力に接続します
  6. ワークフローを実行すると、動画から音声が抽出され、即座に文字起こし処理へ送られます

重要な注意点 (Important Notes)

  • 音声トラックの検出: 入力動画内にオーディオストリームが存在するか自動的に検証します
  • 音声なしエラー: 入力動画が無音(音声トラックが存在しない)場合、エラーが報告されます
  • 再エンコードなし(copy)の推奨: フォーマット変換が不要な場合は、copy を選択すると品質劣化が一切なく、一瞬で抽出が完了します