Skip to main content
Changement de l’API v2 : L’extraction de schémas JSON est entièrement prise en charge en v2, mais le format de l’API a changé. En v2, le schéma est directement intégré dans l’objet formats sous la forme formats: [{type: "json", schema: {...}}]. Le paramètre jsonOptions de la v1 n’existe plus en v2.

Extraire et structurer des données avec Firecrawl

Firecrawl utilise l’IA pour obtenir des données structurées à partir de pages web en 3 étapes :
  1. Définir le schéma (optionnel) : Définissez un schéma JSON (au format OpenAI) pour préciser les données souhaitées, ou fournissez simplement un prompt si vous n’avez pas besoin d’un schéma strict, ainsi que l’URL de la page web.
  2. Envoyer la requête : Envoyez votre URL et votre schéma au point de terminaison /scrape en utilisant le mode JSON. Découvrez comment ici : Scrape Endpoint Documentation
  3. Récupérer vos données : Recevez des données propres et structurées correspondant à votre schéma, prêtes à l’emploi.
Cela rend l’obtention de données web, au format dont vous avez besoin, rapide et simple.

Extraire des données structurées

Mode JSON via /scrape

Permet d’extraire des données structurées à partir de pages explorées.
Résultat :
JSON

Données structurées sans schéma

Vous pouvez aussi extraire sans schéma en passant simplement un prompt au point de terminaison. Le LLM détermine la structure des données.
Résultat :
JSON

Exemple concret : extraction d’informations d’entreprise

Voici un exemple complet montrant comment extraire des informations structurées sur une entreprise à partir d’un site web :
Résultat :
Output

Options du format JSON

Lorsque vous utilisez le mode JSON dans la v2, incluez un objet dans formats avec le schéma directement intégré : formats: [{ type: 'json', schema: { ... }, prompt: '...' }] Paramètres :
  • schema : schéma JSON décrivant la sortie structurée souhaitée (obligatoire pour l’extraction basée sur un schéma).
  • prompt : invite facultative pour guider l’extraction (également utilisée pour l’extraction sans schéma).
Important : Contrairement à la v1, il n’existe pas de paramètre distinct jsonOptions dans la v2. Le schéma doit être inclus directement dans l’objet de format du tableau formats.
Les attributs HTML ne sont pas accessibles dans l’extraction JSON. L’extraction JSON s’applique à la conversion de la page en markdown, qui ne préserve que le contenu textuel visible. Les attributs HTML (par exemple, data-id, attributs personnalisés sur les éléments) sont supprimés lors de la conversion et le LLM ne peut pas les voir. Si vous devez extraire des valeurs d’attribut HTML, utilisez le format rawHtml et analysez les attributs côté client, ou utilisez une action executeJavascript pour injecter les valeurs d’attribut dans le texte visible avant l’extraction.