Skip to main content
Referencia de todas las opciones disponibles en los endpoints de scraping, crawling, mapping y agente de Firecrawl.

Scraping básico

Para extraer una sola página y obtener contenido limpio en Markdown, utiliza el endpoint /scrape.

Extracción de PDF

Firecrawl admite PDF. Usa la opción parsers (por ejemplo, parsers: ["pdf"]) cuando quieras asegurar el análisis de PDF. Puedes controlar la estrategia de análisis con la opción mode:
  • auto (predeterminado): intenta primero una extracción rápida basada en texto y luego recurre a OCR si es necesario.
  • fast: solo análisis basado en texto (texto incrustado). Es el más rápido, pero omite páginas escaneadas o con muchas imágenes.
  • ocr: fuerza el análisis mediante OCR en cada página. Úsalo para documentos escaneados o cuando auto clasifique mal una página.
{ type: "pdf" } y "pdf" usan por defecto mode: "auto".

Opciones de extracción

Al usar el endpoint /scrape, puedes personalizar la solicitud con las siguientes opciones.

Formatos (formats)

El array formats controla qué tipos de salida devuelve el scraper. Predeterminado: ["markdown"]. Formatos de tipo string: pasa el nombre directamente (por ejemplo, "markdown"). Formatos de objeto: pasa un objeto con type y opciones adicionales.

Filtrado de contenido

Estos parámetros controlan qué partes de la página aparecen en la salida. onlyMainContent se ejecuta primero para eliminar el contenido de plantilla (nav, footer, etc.); luego includeTags y excludeTags acotan aún más el resultado. Si configuras onlyMainContent: false, se utiliza el HTML completo de la página como punto de partida para el filtrado por etiquetas.

Temporización y caché

Análisis de PDF

Acciones

Ejecuta acciones del navegador antes del scraping. Esto es útil para contenido dinámico, navegación o páginas protegidas para el usuario. Puedes incluir hasta 50 acciones por solicitud, y el tiempo de espera combinado de todas las acciones wait y waitFor no debe superar los 60 segundos.

Notas sobre la ejecución de acciones

  • Write requiere un click previo para poner el foco en el elemento de destino.
  • Scroll acepta un selector opcional para desplazar un elemento específico en lugar de la página completa.
  • Wait acepta milliseconds (retraso fijo) o selector (esperar hasta que sea visible).
  • Las acciones se ejecutan secuencialmente: cada paso se completa antes de que comience el siguiente.
  • Las acciones no son compatibles con PDFs. Si la URL apunta a un PDF, la solicitud fallará.

Ejemplos de acciones avanzadas

Tomar una captura de pantalla:
cURL
Clic en varios elementos:
cURL
Generación de un PDF:
cURL

Ejemplo de scraping completo

La siguiente solicitud combina múltiples opciones de scraping:
cURL
Esta solicitud devuelve markdown, HTML, HTML sin procesar, enlaces y una captura de pantalla de la página completa. Limita el contenido a <h1>, <p>, <a> y .main-content mientras excluye #ad y #footer, espera 1 segundo antes de realizar el scraping, establece un tiempo de espera de 15 segundos y habilita el análisis de PDF. Consulta la referencia completa de la API de Scrape para más detalles.

Extracción JSON mediante formatos

Usa el objeto de formato JSON en formats para extraer datos estructurados en una sola operación:

Endpoint del agente

Usa el endpoint /v2/agent para la extracción autónoma de datos en múltiples páginas. El agente se ejecuta de forma asíncrona: inicias un trabajo y luego consultas periódicamente los resultados.

Opciones del agente

Comprobar el estado del agente

Consulta periódicamente GET /v2/agent/{jobId} para verificar el progreso. El campo status de la respuesta será "processing", "completed" o "failed".
cURL
Los SDK de Python y Node también ofrecen un método de utilidad (firecrawl.agent()) que inicia la tarea y consulta automáticamente el estado hasta que finaliza.

Rastreo de múltiples páginas

Para rastrear varias páginas, usa el endpoint /v2/crawl. El rastreo se ejecuta de forma asíncrona y devuelve un ID de trabajo.
cURL

Respuesta

Consultar trabajo de rastreo

Usa el ID del trabajo para consultar el estado de un rastreo y obtener sus resultados.
cURL
Si el contenido es superior a 10 MB o el trabajo de rastreo aún se está ejecutando, la respuesta puede incluir un parámetro next, una URL de la siguiente página de resultados.

Vista previa del prompt y parámetros de rastreo

Puedes proporcionar un prompt en lenguaje natural para que Firecrawl derive la configuración de rastreo. Primero, prévisualízala:
cURL

Opciones del rastreador

Al usar el endpoint /v2/crawl, puedes personalizar el comportamiento del rastreo con las siguientes opciones.

Filtrado de rutas

La URL inicial también se valida contra includePaths. Si no coincide con ninguno de los patrones, el rastreo puede devolver 0 páginas.

Alcance del rastreo

Sitemap y deduplicación

Opciones de scrape para crawl

Ejemplo de rastreo

cURL
El endpoint /v2/map identifica las URL relacionadas con un sitio web determinado.
cURL

Opciones de Map

Consulta la referencia de la API: Documentación del endpoint /map

Agregar Firecrawl a la lista de permitidos

Permitir que Firecrawl rastree tu sitio web

  • User Agent: Permite FirecrawlAgent en tu firewall o en tus reglas de seguridad.
  • Direcciones IP: Firecrawl no utiliza un conjunto fijo de direcciones IP salientes.

Permitir que tu aplicación llame a la API de Firecrawl

Si tu firewall bloquea las solicitudes salientes de tu aplicación hacia servicios externos, debes incluir en la lista de permitidos la dirección IP del servidor de la API de Firecrawl para que tu aplicación pueda acceder a la API de Firecrawl (api.firecrawl.dev):
  • Dirección IP: 35.245.250.27
Agrega esta IP a la lista de permitidos de salida de tu firewall para que tu backend pueda enviar solicitudes de scraping, crawling, mapping y de agentes a Firecrawl.