画像の説明・キャプション生成 (DescribeImage)
概要 (What is it?)
DescribeImage ノードは、AI を使用して入力された画像の詳細なテキスト説明(キャプション・詳細解説)を生成します。ビジョン認識能力を持つマルチモーダルモデルを活用し、プロンプトの指示に基づいて画像の内容を分析し、高度なテキスト説明を出力します。
使用する場面 (When would I use it?)
以下のような場面でこのノードを使用します:
- 画像のテキスト説明を自動生成したい場合
- 視覚的コンテンツから情報や特徴量を抽出したい場合
- アクセシビリティ目的の代替テキスト(Alt テキスト)を作成したい場合
- 写真、図表、ダイアグラムなどの視覚メディアの内容を分析したい場合
- 視覚情報をテキスト形式に変換して、後続の LLM 処理ノードに渡したい場合
使い方 (How to use it)
基本セットアップ
- ワークフローに DescribeImage ノードを追加します
- 画像ソースを "image" 入力に接続します
- (任意)"prompt" フィールドに具体的な指示を入力します
- ノードを実行して画像の説明文を生成します
求める内容を具体的に指定する
プロンプトを作成する際は、注目したい要素を明確に記述してください。例えば:
- 色彩情報が必要な場合: 「Describe the color palette, the color of light and shadow, the saturation and value(カラーパレット、光と影の色、彩度と明度を説明してください)」
- キャラクターの詳細が必要な場合: 「Describe the character's gender, age, clothing, posture, demeanor, and actions(キャラクターの性別、年齢、服装、姿勢、雰囲気、行動を説明してください)」
プロンプトをより具体的に指定するほど、期待通りの出力が得られる可能性が高まります。
パラメータ一覧 (Parameters)
- agent: 画像の説明生成に使用する任意のエージェント設定(接続されている場合、model 設定より優先されます)
- model: ビジョン対応のプロンプトモデルを選択(または Prompt Model Config を接続)。agent が接続されている場合は無視されます
- image: 説明・分析を行いたい対象の画像(必須)
- prompt: 画像をどのように説明させたいかの指示テキスト(デフォルト: "Describe the image")
- description_only: 有効にすると、会話の文脈を含めず説明文のみを返します
- output_schema: 構造化出力のための任意の JSON Schema。JSON スキーマオブジェクトまたは JSON 文字列を受け付けます。接続された場合、output は JSON 出力に切り替わります
出力 (Outputs)
- output: 生成された画像の説明。デフォルトでは text(文字列)を返し、output_schema が指定されている場合は JSON を返します
- agent: 説明生成に使用されたエージェントオブジェクト(他のノードに接続可能)
使用例 (Example)
風景写真の詳細な説明を取得したい場合の例:
- ワークフローに DescribeImage ノードを追加します
- 他のノードからの画像出力を "image" 入力に接続します
- "prompt" フィールドに「Describe this landscape in detail, including colors, features, and mood」と入力します
- ノードを実行します
- "output" に風景写真の詳細な解説テキストが出力されます
構造化出力の例 (JSON)
特定の JSON フォーマットで出力を得たい場合:
CreateAgentSchemaノードを追加し、目的の JSON 形状のサンプルを入力しますCreateAgentSchema.schemaをDescribeImage.output_schemaに接続しますDescribeImageを実行しますoutputにスキーマに適合した JSON が出力されます(適合しない場合はバリデーションエラーになります)
重要な注意点 (Important Notes)
- このノードは、環境変数
GT_CLOUD_API_KEYとして有効な Griptape API キーが設定されている必要があります - デフォルトでは、Griptape Cloud API 経由で
gpt-5.2モデルを使用します - プロンプトが指定されていない場合、デフォルトの "Describe the image" が使用されます
- 画像が提供されていない場合、出力は "No image provided" になります
- より高度な動作をカスタマイズしたい場合は、独自のエージェント設定を渡すことができます
- 生成される説明文の品質は、提供された画像の鮮明さや内容に依存します
よくある問題 (Common Issues)
- API キーが見つからない: 環境変数
GT_CLOUD_API_KEYが正しく設定されているか確認してください - 画像が提供されていない: "image" 入力に有効な画像が接続されているか確認してください
- 説明の質が不十分: プロンプトを工夫し、着目してほしい画像の要素を具体的に指示してください
- 処理エラー: 画像が極端に複雑であったり一般的でないフォーマットの場合、認識精度が低下することがあります