Scraping básico
/scrape.
Extracción de PDF
parsers (por ejemplo, parsers: ["pdf"]) cuando quieras asegurar el análisis de PDF. Puedes controlar la estrategia de análisis con la opción mode:
auto(predeterminado): intenta primero una extracción rápida basada en texto y luego recurre a OCR si es necesario.fast: solo análisis basado en texto (texto incrustado). Es el más rápido, pero omite páginas escaneadas o con muchas imágenes.ocr: fuerza el análisis mediante OCR en cada página. Úsalo para documentos escaneados o cuandoautoclasifique mal una página.
{ type: "pdf" } y "pdf" usan por defecto mode: "auto".
Opciones de extracción
/scrape, puedes personalizar la solicitud con las siguientes opciones.
Formatos (formats)
formats controla qué tipos de salida devuelve el scraper. Predeterminado: ["markdown"].
Formatos de tipo string: pasa el nombre directamente (por ejemplo, "markdown").
Formatos de objeto: pasa un objeto con
type y opciones adicionales.
Filtrado de contenido
onlyMainContent se ejecuta primero para eliminar el contenido de plantilla (nav, footer, etc.); luego includeTags y excludeTags acotan aún más el resultado. Si configuras onlyMainContent: false, se utiliza el HTML completo de la página como punto de partida para el filtrado por etiquetas.
Temporización y caché
Análisis de PDF
Acciones
wait y waitFor no debe superar los 60 segundos.
Notas sobre la ejecución de acciones
- Write requiere un
clickprevio para poner el foco en el elemento de destino. - Scroll acepta un
selectoropcional para desplazar un elemento específico en lugar de la página completa. - Wait acepta
milliseconds(retraso fijo) oselector(esperar hasta que sea visible). - Las acciones se ejecutan secuencialmente: cada paso se completa antes de que comience el siguiente.
- Las acciones no son compatibles con PDFs. Si la URL apunta a un PDF, la solicitud fallará.
Ejemplos de acciones avanzadas
cURL
cURL
cURL
Ejemplo de scraping completo
cURL
<h1>, <p>, <a> y .main-content mientras excluye #ad y #footer, espera 1 segundo antes de realizar el scraping, establece un tiempo de espera de 15 segundos y habilita el análisis de PDF.
Consulta la referencia completa de la API de Scrape para más detalles.
Extracción JSON mediante formatos
formats para extraer datos estructurados en una sola operación:
Endpoint del agente
/v2/agent para la extracción autónoma de datos en múltiples páginas. El agente se ejecuta de forma asíncrona: inicias un trabajo y luego consultas periódicamente los resultados.
Opciones del agente
Comprobar el estado del agente
GET /v2/agent/{jobId} para verificar el progreso. El campo status de la respuesta será "processing", "completed" o "failed".
cURL
firecrawl.agent()) que inicia la tarea y consulta automáticamente el estado hasta que finaliza.
Rastreo de múltiples páginas
/v2/crawl. El rastreo se ejecuta de forma asíncrona y devuelve un ID de trabajo.
cURL
Respuesta
Consultar trabajo de rastreo
cURL
next, una URL de la siguiente página de resultados.
Vista previa del prompt y parámetros de rastreo
prompt en lenguaje natural para que Firecrawl derive la configuración de rastreo. Primero, prévisualízala:
cURL
Opciones del rastreador
/v2/crawl, puedes personalizar el comportamiento del rastreo con las siguientes opciones.
Filtrado de rutas
Alcance del rastreo
Sitemap y deduplicación
Opciones de scrape para crawl
Ejemplo de rastreo
cURL
Mapeo de enlaces de sitios web
/v2/map identifica las URL relacionadas con un sitio web determinado.
cURL
Opciones de Map
Consulta la referencia de la API: Documentación del endpoint /map
Agregar Firecrawl a la lista de permitidos
Permitir que Firecrawl rastree tu sitio web
- User Agent: Permite
FirecrawlAgenten tu firewall o en tus reglas de seguridad. - Direcciones IP: Firecrawl no utiliza un conjunto fijo de direcciones IP salientes.
Permitir que tu aplicación llame a la API de Firecrawl
api.firecrawl.dev):
- Dirección IP:
35.245.250.27
