# Traitement de texte PDF rapide et natif

PDF Inspector, développé par Firecrawl, est une bibliothèque Rust rapide conçue pour examiner, classer et extraire le texte des fichiers PDF. Il permet de prendre des décisions de routage intelligentes dans les processus de traitement des données en distinguant les documents numérisés des fichiers texte.

- ★ 13 019
- Rust
- GitHub Trending · 2026-08-04

## Mise à jour
- 7 août 2026 : Étoile 11 746 → 13 019.
- 6 août 2026 : Étoile 8 766 → 11 746.

## Ce que ça vous apporte
- Classifie les fichiers PDF en quelques secondes
- Convertit les textes au format Markdown sans erreurs
- Pas besoin de services de reconnaissance optique de caractères (OCR)

## Installation
**Installation avec Python**

```
pip install maturin
maturin develop --release
```

**Installation avec Node.js**

```
npm install @firecrawl/pdf-inspector
```


## Si vous ne codez pas
Je dois analyser le fichier PDF que j'ai. Classez ce fichier pour voir s’il s’agit d’un document textuel ou numérisé. S'il est basé sur du texte, convertissez-le dans un format Markdown propre, en préservant le texte, les tableaux et les titres. Déterminez correctement l'ordre de lecture en utilisant la structure et les informations de police du fichier, sans utiliser l'OCR.

## Termes liés du glossaire

## Liens
- Dépôt GitHub →
- Lire en turc →

---
Source : TreScout Découvrir · https://trescout.com/fr/discover/pdf-inspector/
