v2 APIの変更: JSONスキーマ抽出はv2で完全にサポートされていますが、APIのフォーマットが変更されました。v2では、スキーマは
formats: [{type: "json", schema: {...}}] のようにフォーマットオブジェクト内に直接埋め込まれます。v1の jsonOptions パラメータはv2では廃止されています。Firecrawlで構造化データをスクレイプして抽出する
-
スキーマを設定(任意):
取得したいデータを指定するために(OpenAIの形式の)JSONスキーマを定義するか、厳密なスキーマが不要な場合はウェブページのURLと
promptだけを指定します。 - リクエストを送信: URLとスキーマを、JSONモードを用いて/scrape エンドポイントに送ります。詳しくはこちら: Scrape Endpoint Documentation
- データを取得: スキーマに一致するクリーンな構造化データが返ってきます。すぐに利用できます。
構造化データの抽出
/scrape による JSONモード
JSON
スキーマ不要の構造化データ
prompt を渡すだけで、スキーマなしで抽出できます。データの構造は LLM が決定します。
JSON
実例:企業情報の抽出
Output
JSON フォーマットのオプション
formats にスキーマを直接埋め込んだオブジェクトを含めます:
formats: [{ type: 'json', schema: { ... }, prompt: '...' }]
パラメータ:
schema: 取得したい構造化出力を記述する JSON Schema(スキーマベースの抽出では必須)。prompt: 抽出をガイドするための任意のプロンプト(スキーマなしの抽出でも使用)。
jsonOptions パラメータはありません。スキーマは formats 配列内のフォーマットオブジェクトに直接含める必要があります。
HTML 属性は JSON 抽出では利用できません。 JSON 抽出はページを markdown に変換した結果に対して実行され、この変換では表示テキストのみが保持されます。HTML 属性(例:
data-id、要素上のカスタム属性)は変換時に削除されるため、LLM からは参照できません。HTML 属性値を抽出する必要がある場合は、rawHtml フォーマットを使用してクライアント側で属性をパースするか、executeJavascript アクションを使って抽出前に属性値を表示テキストへ埋め込んでください。