Traitement de texte PDF rapide et natif
PDF Inspector, développé par Firecrawl, est une bibliothèque Rust rapide conçue pour examiner, classer et extraire le texte des fichiers PDF. Il permet de prendre des décisions de routage intelligentes dans les processus de traitement des données en distinguant les documents numérisés des fichiers texte.
Mises à jour
- 6 août 2026: Étoiles 8,766 → 11,746.
Mise à jour
- 6 août 2026 : Étoile 8 766 → 11 746.
Ce que ça vous apporte
- Classifie les fichiers PDF en quelques secondes
- Convertit les textes au format Markdown sans erreurs
- Pas besoin de services de reconnaissance optique de caractères (OCR)
Installation
pip install maturin
maturin develop --releasenpm install @firecrawl/pdf-inspectorSi vous ne codez pas
Je dois analyser le fichier PDF que j'ai. Classez ce fichier pour voir s’il s’agit d’un document textuel ou numérisé. S'il est basé sur du texte, convertissez-le dans un format Markdown propre, en préservant le texte, les tableaux et les titres. Déterminez correctement l'ordre de lecture en utilisant la structure et les informations de police du fichier, sans utiliser l'OCR.
Termes liés du glossaire
Liens
TreScout n'a pas développé cet outil · nous l'avons repéré dans les tendances GitHub et présenté. Cette page décrit le dépôt tel qu'il était le 2026-08-04 : Le nombre d'étoiles et notre texte datent de ce jour, le dépôt a pu changer depuis. Consultez le lien du dépôt pour l'état actuel.