Raspagem básica
/scrape.
Extração de PDFs
parsers (por exemplo, parsers: ["pdf"]) quando quiser garantir a extração de PDFs. Você pode controlar a estratégia de extração com a opção mode:
auto(padrão) — tenta primeiro uma extração rápida baseada em texto e, se necessário, recorre a OCR.fast— apenas extração baseada em texto (texto embutido). Mais rápido, mas ignora páginas digitalizadas ou com muitas imagens.ocr— força a extração via OCR em todas as páginas. Use para documentos digitalizados ou quandoautoclassificar uma página incorretamente.
{ type: "pdf" } e "pdf" usam por padrão mode: "auto".
Opções de scraping
Formatos (formats)
formats controla quais tipos de saída o scraper retorna. Padrão: ["markdown"].
Formatos em string: passe o nome diretamente (por exemplo, "markdown").
Formatos em objeto: passe um objeto com
type e opções adicionais.
Filtragem de conteúdo
onlyMainContent é executado primeiro para remover o boilerplate (nav, footer etc.); em seguida, includeTags e excludeTags refinam ainda mais o resultado. Se você definir onlyMainContent: false, o HTML completo da página será usado como ponto de partida para a filtragem por tags.
Tempo e cache
Análise de PDF
Actions
wait e waitFor não deve exceder 60 segundos.
Observações sobre a execução de ações
- Write requer um
clickanterior para focar o elemento de destino. - Scroll aceita um
selectoropcional para rolar um elemento específico em vez da página. - Wait aceita
milliseconds(atraso fixo) ouselector(esperar até que fique visível). - As ações são executadas sequencialmente: cada etapa é concluída antes da próxima começar.
- Ações não são compatíveis com PDFs. Se a URL for resolvida para um PDF, a requisição falhará.
Exemplos de Ações Avançadas
cURL
cURL
cURL
Exemplo completo de scraping
cURL
<h1>, <p>, <a> e .main-content, enquanto exclui #ad e #footer, aguarda 1 segundo antes de iniciar o scraping, define um tempo limite de 15 segundos e habilita a análise de PDFs.
Consulte a referência completa da API de Scrape para mais detalhes.
Extração de JSON via formatos
formats para extrair dados estruturados em uma única chamada:
Endpoint do agente
/v2/agent para extração autônoma de dados em várias páginas. O agente é executado de forma assíncrona: você inicia uma tarefa e depois faz polling dos resultados.
Opções do agente
Verificar status do agente
GET /v2/agent/{jobId} para verificar o progresso. O campo status da resposta será "processing", "completed" ou "failed".
cURL
firecrawl.agent()) que inicia o job e consulta o status automaticamente até a conclusão.
Rastreando várias páginas
/v2/crawl. O rastreamento é executado de forma assíncrona e retorna um ID de job.
cURL
Resposta
Verificar job de crawl
cURL
next, que é uma URL para a próxima página de resultados.
Prévia do prompt e dos parâmetros de crawl
prompt em linguagem natural para o Firecrawl deduzir as configurações de crawl. Veja a prévia delas primeiro:
cURL
Opções do crawler
/v2/crawl, você pode configurar o comportamento do crawler com as seguintes opções.
Filtragem de caminhos
Escopo do rastreamento
Sitemap e deduplicação
Opções de scrape para crawl
Exemplo de rastreamento
cURL
Mapeando links de sites
/v2/map identifica as URLs relacionadas a um determinado site.
cURL
Opções do map
Aqui está a referência da API correspondente: Documentação do endpoint /map
Adicionando o Firecrawl à lista de permissões
Como permitir que o Firecrawl faça scraping do seu site
- User Agent: permita
FirecrawlAgentno seu firewall ou nas suas regras de segurança. - Endereços IP: o Firecrawl não usa um conjunto fixo de IPs de saída.
Permitindo que sua aplicação faça chamadas à API do Firecrawl
api.firecrawl.dev):
- Endereço IP:
35.245.250.27
