# Processamento de texto PDF rápido e nativo

PDF Inspector, desenvolvido pela Firecrawl, é uma biblioteca Rust rápida projetada para examinar, classificar e extrair o texto de arquivos PDF. Ele permite que decisões inteligentes de roteamento sejam tomadas em processos de processamento de dados, distinguindo documentos digitalizados de arquivos baseados em texto.

- ★ 18.936
- Rust
- GitHub Trending · 2026-08-04

## O que você ganha
- Classifica arquivos PDF em segundos
- Converte textos para o formato Markdown sem erros
- Não há necessidade de serviços de reconhecimento óptico de caracteres (OCR)

## Instalação
**Instalação com Python**

```
pip install maturin
maturin develop --release
```

**Instalação com Node.js**

```
npm install @firecrawl/pdf-inspector
```


## Se você não programa
Preciso analisar o arquivo PDF que possuo. Classifique este arquivo para ver se ele é baseado em texto ou é um documento digitalizado. Se for baseado em texto, converta-o para um formato Markdown limpo, preservando o texto, tabelas e títulos. Determine a ordem de leitura corretamente usando a estrutura e as informações de fonte do próprio arquivo, sem usar OCR.

## Termos relacionados do glossário

## Links
- Repositório no GitHub →
- Ler em turco →

---
Fonte: TreScout Descobrir · https://trescout.com/pt/discover/pdf-inspector/
