Scraping basique
/scrape.
Extraction de PDF
parsers (par exemple parsers: ["pdf"]) lorsque vous voulez garantir l’analyse des PDF. Vous pouvez contrôler la stratégie d’analyse avec l’option mode :
auto(par défaut) — tente d’abord une extraction rapide basée sur le texte, puis bascule vers l’OCR si nécessaire.fast— analyse basée uniquement sur le texte (texte intégré). La plus rapide, mais ignore les pages scannées ou très riches en images.ocr— force l’analyse par OCR sur chaque page. À utiliser pour les documents numérisés ou lorsqueautoclasse mal une page.
{ type: "pdf" } et "pdf" utilisent tous les deux mode: "auto" par défaut.
Options d’extraction
Formats (formats)
formats contrôle les types de sortie que le scraper renvoie. Valeur par défaut : ["markdown"].
Formats de type chaîne de caractères : passez le nom directement (par ex. "markdown").
Formats objet : passez un objet avec
type et des options supplémentaires.
Filtrage du contenu
onlyMainContent s’exécute en premier pour supprimer le boilerplate (navigation, pied de page, etc.), puis includeTags et excludeTags affinent davantage le résultat. Si vous définissez onlyMainContent: false, le HTML complet de la page est utilisé comme point de départ pour le filtrage par balises.
Timing et cache
Analyse de PDF
Actions
wait et waitFor ne doit pas dépasser 60 secondes.
Notes sur l’exécution des actions
- Write nécessite un
clickpréalable pour placer le focus sur l’élément cible. - Scroll accepte un
selectoroptionnel pour faire défiler un élément spécifique plutôt que la page. - Wait accepte soit
milliseconds(délai fixe), soitselector(attendre jusqu’à ce que l’élément soit visible). - Les actions s’exécutent séquentiellement : chaque étape se termine avant que la suivante ne commence.
- Les actions ne sont pas prises en charge pour les PDF. Si l’URL renvoie vers un PDF, la requête échouera.
Exemples d’actions avancées
cURL
cURL
cURL
Exemple d’extraction complète
cURL
<h1>, <p>, <a> et .main-content tout en excluant #ad et #footer, attend 1 seconde avant l’extraction, définit un délai d’expiration de 15 secondes et active l’analyse des PDF.
Consultez la référence complète de l’API Scrape pour plus de détails.
Extraction JSON via formats
formats pour extraire des données structurées en une seule fois :
Endpoint de l’agent
/v2/agent pour effectuer une extraction autonome de données sur plusieurs pages. L’agent fonctionne de manière asynchrone : vous démarrez un job, puis interrogez périodiquement l’API pour récupérer les résultats.
Options de l’agent
Vérifier l’état de l’agent
GET /v2/agent/{jobId} pour suivre l’avancement. Le champ status de la réponse vaudra "processing", "completed" ou "failed".
cURL
firecrawl.agent()) qui lance la tâche et interroge automatiquement son état jusqu’à son achèvement.
Explorer plusieurs pages
/v2/crawl. L’exploration s’exécute de manière asynchrone et renvoie un ID de tâche.
cURL
Réponse
Vérifier l’état d’une tâche de crawl
cURL
next contenant l’URL de la page suivante de résultats.
Aperçu du prompt et des paramètres de crawl
prompt en langage naturel pour permettre à Firecrawl de déterminer les paramètres de crawl. Prévisualisez-les d’abord :
cURL
Options du crawler
/v2/crawl, vous pouvez personnaliser le comportement du crawl à l’aide des options suivantes.
Filtrage des chemins
Portée du crawl
Sitemap et déduplication
Options de scrape pour le crawl
Exemple de crawl
cURL
Cartographie des liens d’un site web
/v2/map identifie les URL liées à un site web donné.
cURL
Options de mappage
Voici la référence de l’API correspondante : Documentation du point de terminaison /map
Autoriser Firecrawl
Autoriser Firecrawl à explorer votre site web
- User Agent : Autorisez
FirecrawlAgentdans votre pare-feu ou vos règles de sécurité. - Adresses IP : Firecrawl n’utilise pas un ensemble fixe d’adresses IP sortantes.
Autoriser votre application à appeler l’API Firecrawl
api.firecrawl.dev) :
- Adresse IP :
35.245.250.27
