コンテンツにスキップ

画像の説明・キャプション生成 (DescribeImage)

概要 (What is it?)

DescribeImage ノードは、AI を使用して入力された画像の詳細なテキスト説明(キャプション・詳細解説)を生成します。ビジョン認識能力を持つマルチモーダルモデルを活用し、プロンプトの指示に基づいて画像の内容を分析し、高度なテキスト説明を出力します。

使用する場面 (When would I use it?)

以下のような場面でこのノードを使用します:

  • 画像のテキスト説明を自動生成したい場合
  • 視覚的コンテンツから情報や特徴量を抽出したい場合
  • アクセシビリティ目的の代替テキスト(Alt テキスト)を作成したい場合
  • 写真、図表、ダイアグラムなどの視覚メディアの内容を分析したい場合
  • 視覚情報をテキスト形式に変換して、後続の LLM 処理ノードに渡したい場合

使い方 (How to use it)

基本セットアップ

  1. ワークフローに DescribeImage ノードを追加します
  2. 画像ソースを "image" 入力に接続します
  3. (任意)"prompt" フィールドに具体的な指示を入力します
  4. ノードを実行して画像の説明文を生成します

求める内容を具体的に指定する

プロンプトを作成する際は、注目したい要素を明確に記述してください。例えば:

  • 色彩情報が必要な場合: 「Describe the color palette, the color of light and shadow, the saturation and value(カラーパレット、光と影の色、彩度と明度を説明してください)」
  • キャラクターの詳細が必要な場合: 「Describe the character's gender, age, clothing, posture, demeanor, and actions(キャラクターの性別、年齢、服装、姿勢、雰囲気、行動を説明してください)」

プロンプトをより具体的に指定するほど、期待通りの出力が得られる可能性が高まります。

パラメータ一覧 (Parameters)

  • agent: 画像の説明生成に使用する任意のエージェント設定(接続されている場合、model 設定より優先されます)
  • model: ビジョン対応のプロンプトモデルを選択(または Prompt Model Config を接続)。agent が接続されている場合は無視されます
  • image: 説明・分析を行いたい対象の画像(必須)
  • prompt: 画像をどのように説明させたいかの指示テキスト(デフォルト: "Describe the image")
  • description_only: 有効にすると、会話の文脈を含めず説明文のみを返します
  • output_schema: 構造化出力のための任意の JSON Schema。JSON スキーマオブジェクトまたは JSON 文字列を受け付けます。接続された場合、output は JSON 出力に切り替わります

出力 (Outputs)

  • output: 生成された画像の説明。デフォルトでは text(文字列)を返し、output_schema が指定されている場合は JSON を返します
  • agent: 説明生成に使用されたエージェントオブジェクト(他のノードに接続可能)

使用例 (Example)

風景写真の詳細な説明を取得したい場合の例:

  1. ワークフローに DescribeImage ノードを追加します
  2. 他のノードからの画像出力を "image" 入力に接続します
  3. "prompt" フィールドに「Describe this landscape in detail, including colors, features, and mood」と入力します
  4. ノードを実行します
  5. "output" に風景写真の詳細な解説テキストが出力されます

構造化出力の例 (JSON)

特定の JSON フォーマットで出力を得たい場合:

  1. CreateAgentSchema ノードを追加し、目的の JSON 形状のサンプルを入力します
  2. CreateAgentSchema.schema を DescribeImage.output_schema に接続します
  3. DescribeImage を実行します
  4. output にスキーマに適合した JSON が出力されます(適合しない場合はバリデーションエラーになります)

重要な注意点 (Important Notes)

  • このノードは、環境変数 GT_CLOUD_API_KEY として有効な Griptape API キーが設定されている必要があります
  • デフォルトでは、Griptape Cloud API 経由で gpt-5.2 モデルを使用します
  • プロンプトが指定されていない場合、デフォルトの "Describe the image" が使用されます
  • 画像が提供されていない場合、出力は "No image provided" になります
  • より高度な動作をカスタマイズしたい場合は、独自のエージェント設定を渡すことができます
  • 生成される説明文の品質は、提供された画像の鮮明さや内容に依存します

よくある問題 (Common Issues)

  • API キーが見つからない: 環境変数 GT_CLOUD_API_KEY が正しく設定されているか確認してください
  • 画像が提供されていない: "image" 入力に有効な画像が接続されているか確認してください
  • 説明の質が不十分: プロンプトを工夫し、着目してほしい画像の要素を具体的に指示してください
  • 処理エラー: 画像が極端に複雑であったり一般的でないフォーマットの場合、認識精度が低下することがあります