Processamento de texto PDF rápido e nativo
PDF Inspector, desenvolvido pela Firecrawl, é uma biblioteca Rust rápida projetada para examinar, classificar e extrair o texto de arquivos PDF. Ele permite que decisões inteligentes de roteamento sejam tomadas em processos de processamento de dados, distinguindo documentos digitalizados de arquivos baseados em texto.
Atualizações
- 8 de setembro de 2026: Estrelas 18,684 → 18,936, versão mais recente v1.18.0 (8 de setembro de 2026).
- 3 de setembro de 2026: Estrelas 17,255 → 18,684, versão mais recente v1.15.0 (17 de agosto de 2026).
- 31 de agosto de 2026: Estrelas 16,077 → 17,255, versão mais recente v1.15.0 (17 de agosto de 2026).
- 18 de agosto de 2026: Estrelas 15,659 → 16,077, versão mais recente v1.15.0 (17 de agosto de 2026).
O que você ganha
- Classifica arquivos PDF em segundos
- Converte textos para o formato Markdown sem erros
- Não há necessidade de serviços de reconhecimento óptico de caracteres (OCR)
Instalação
pip install maturin
maturin develop --releasenpm install @firecrawl/pdf-inspectorSe você não programa
Preciso analisar o arquivo PDF que possuo. Classifique este arquivo para ver se ele é baseado em texto ou é um documento digitalizado. Se for baseado em texto, converta-o para um formato Markdown limpo, preservando o texto, tabelas e títulos. Determine a ordem de leitura corretamente usando a estrutura e as informações de fonte do próprio arquivo, sem usar OCR.
Termos relacionados do glossário
Links
A TreScout não desenvolveu esta ferramenta · nós a encontramos nas tendências do GitHub e a apresentamos. Esta página descreve o repositório em 2026-08-04: A contagem de estrelas e o nosso texto são daquele dia, o repositório pode ter mudado desde então. Consulte o link do repositório para ver o estado atual. Esta página foi traduzida automaticamente do original em turco · a versão turca é a que vale.