Skip to main content
O Firecrawl oferece recursos poderosos de parsing de documentos, permitindo extrair conteúdo estruturado de diversos formatos. Esse recurso é particularmente útil para processar arquivos como planilhas, documentos do Word e muito mais.

Formatos de documentos suportados

Atualmente, o Firecrawl oferece suporte aos seguintes formatos de documentos:
  • Planilhas do Excel (.xlsx, .xls)
    • Cada planilha é convertida em uma tabela HTML
    • As planilhas são separadas por títulos H2 com o nome da aba
    • Preserva a formatação das células e os tipos de dados
  • Documentos do Word (.docx, .doc, .odt, .rtf)
    • Extrai o conteúdo de texto preservando a estrutura do documento
    • Mantém títulos, parágrafos, listas e tabelas
    • Preserva formatação e estilos básicos
  • Documentos PDF (.pdf)
    • Extrai o conteúdo de texto com informações de layout
    • Preserva a estrutura do documento, incluindo seções e parágrafos
    • Lida com PDFs baseados em texto e digitalizados (com suporte a OCR)
    • Oferece a opção mode para controlar a estratégia de parsing: fast (apenas texto), auto (texto com fallback de OCR, padrão) ou ocr (forçar OCR)
    • Custa 1 crédito por página. Consulte a tabela de preços para detalhes.

Modos de processamento de PDF

Use a opção parsers para controlar como os PDFs são processados:

Como usar a análise de documentos

A análise de documentos no Firecrawl é automática quando você fornece uma URL que aponta para um tipo de documento compatível. O sistema detecta o tipo de arquivo com base na extensão da URL ou no cabeçalho Content-Type e o processa conforme necessário.

Exemplo: Fazendo scraping de um arquivo Excel

Node

Exemplo: Extraindo um documento do Word

Node

Formato de saída

Todos os tipos de documentos compatíveis são convertidos em Markdown limpo e estruturado. Por exemplo, um arquivo Excel com várias planilhas pode ser convertido em: