Skip to main content
Référence pour toutes les options disponibles sur les endpoints de scraping, crawling, mapping et agent de Firecrawl.

Scraping basique

Pour extraire une seule page et obtenir un contenu Markdown propre, utilisez le point de terminaison /scrape.

Extraction de PDF

Firecrawl prend en charge les PDF. Utilisez l’option parsers (par exemple parsers: ["pdf"]) lorsque vous voulez garantir l’analyse des PDF. Vous pouvez contrôler la stratégie d’analyse avec l’option mode :
  • auto (par défaut) — tente d’abord une extraction rapide basée sur le texte, puis bascule vers l’OCR si nécessaire.
  • fast — analyse basée uniquement sur le texte (texte intégré). La plus rapide, mais ignore les pages scannées ou très riches en images.
  • ocr — force l’analyse par OCR sur chaque page. À utiliser pour les documents numérisés ou lorsque auto classe mal une page.
{ type: "pdf" } et "pdf" utilisent tous les deux mode: "auto" par défaut.

Options d’extraction

Lorsque vous utilisez le point de terminaison /scrape, vous pouvez personnaliser la requête avec les options ci-dessous.

Formats (formats)

Le tableau formats contrôle les types de sortie que le scraper renvoie. Valeur par défaut : ["markdown"]. Formats de type chaîne de caractères : passez le nom directement (par ex. "markdown"). Formats objet : passez un objet avec type et des options supplémentaires.

Filtrage du contenu

Ces paramètres contrôlent quelles parties de la page apparaissent dans le résultat. onlyMainContent s’exécute en premier pour supprimer le boilerplate (navigation, pied de page, etc.), puis includeTags et excludeTags affinent davantage le résultat. Si vous définissez onlyMainContent: false, le HTML complet de la page est utilisé comme point de départ pour le filtrage par balises.

Timing et cache

Analyse de PDF

Actions

Exécutez des actions dans le navigateur avant le scraping. Cela est utile pour le contenu dynamique, la navigation ou les pages nécessitant une interaction utilisateur. Vous pouvez inclure jusqu’à 50 actions par requête, et le temps d’attente cumulé sur toutes les actions wait et waitFor ne doit pas dépasser 60 secondes.

Notes sur l’exécution des actions

  • Write nécessite un click préalable pour placer le focus sur l’élément cible.
  • Scroll accepte un selector optionnel pour faire défiler un élément spécifique plutôt que la page.
  • Wait accepte soit milliseconds (délai fixe), soit selector (attendre jusqu’à ce que l’élément soit visible).
  • Les actions s’exécutent séquentiellement : chaque étape se termine avant que la suivante ne commence.
  • Les actions ne sont pas prises en charge pour les PDF. Si l’URL renvoie vers un PDF, la requête échouera.

Exemples d’actions avancées

Prendre une capture d’écran :
cURL
Clic sur plusieurs éléments :
cURL
Générer un PDF :
cURL

Exemple d’extraction complète

La requête suivante combine plusieurs options d’extraction :
cURL
Cette requête renvoie du Markdown, du HTML, du HTML brut, des liens et une capture d’écran de la page entière. Elle limite le contenu à <h1>, <p>, <a> et .main-content tout en excluant #ad et #footer, attend 1 seconde avant l’extraction, définit un délai d’expiration de 15 secondes et active l’analyse des PDF. Consultez la référence complète de l’API Scrape pour plus de détails.

Extraction JSON via formats

Utilisez l’objet de format JSON dans formats pour extraire des données structurées en une seule fois :

Endpoint de l’agent

Utilisez l’endpoint /v2/agent pour effectuer une extraction autonome de données sur plusieurs pages. L’agent fonctionne de manière asynchrone : vous démarrez un job, puis interrogez périodiquement l’API pour récupérer les résultats.

Options de l’agent

Vérifier l’état de l’agent

Envoyez des requêtes GET /v2/agent/{jobId} pour suivre l’avancement. Le champ status de la réponse vaudra "processing", "completed" ou "failed".
cURL
Les SDK Python et Node fournissent également une méthode pratique (firecrawl.agent()) qui lance la tâche et interroge automatiquement son état jusqu’à son achèvement.

Explorer plusieurs pages

Pour explorer plusieurs pages, utilisez le point de terminaison /v2/crawl. L’exploration s’exécute de manière asynchrone et renvoie un ID de tâche.
cURL

Réponse

Vérifier l’état d’une tâche de crawl

Utilisez l’ID de la tâche pour vérifier l’état du crawl et récupérer ses résultats.
cURL
Si le contenu dépasse 10 Mo ou si la tâche de crawl est toujours en cours d’exécution, la réponse peut inclure un paramètre next contenant l’URL de la page suivante de résultats.

Aperçu du prompt et des paramètres de crawl

Vous pouvez fournir un prompt en langage naturel pour permettre à Firecrawl de déterminer les paramètres de crawl. Prévisualisez-les d’abord :
cURL

Options du crawler

Lorsque vous utilisez l’endpoint /v2/crawl, vous pouvez personnaliser le comportement du crawl à l’aide des options suivantes.

Filtrage des chemins

L’URL de départ est également vérifiée par rapport à includePaths. Si elle ne correspond à aucun motif, le crawl peut renvoyer 0 page.

Portée du crawl

Sitemap et déduplication

Options de scrape pour le crawl

Exemple de crawl

cURL
L’endpoint d’API /v2/map identifie les URL liées à un site web donné.
cURL

Options de mappage

Voici la référence de l’API correspondante : Documentation du point de terminaison /map

Autoriser Firecrawl

Autoriser Firecrawl à explorer votre site web

  • User Agent : Autorisez FirecrawlAgent dans votre pare-feu ou vos règles de sécurité.
  • Adresses IP : Firecrawl n’utilise pas un ensemble fixe d’adresses IP sortantes.

Autoriser votre application à appeler l’API Firecrawl

Si votre pare-feu bloque les requêtes sortantes de votre application vers des services externes, vous devez ajouter l’adresse IP du serveur de l’API Firecrawl à la liste d’autorisation afin que votre application puisse atteindre l’API Firecrawl (api.firecrawl.dev) :
  • Adresse IP : 35.245.250.27
Ajoutez cette adresse IP à la liste d’autorisation des connexions sortantes de votre pare-feu afin que votre backend puisse envoyer à Firecrawl des requêtes de scraping, de crawling, de mapping et des requêtes d’agent.