← Découvrir
Découvrir · GitHub · PDF Inspector↑ +1 699 aujourd'hui

Traitement de texte PDF rapide et natif

PDF Inspector, développé par Firecrawl, est une bibliothèque Rust rapide conçue pour examiner, classer et extraire le texte des fichiers PDF. Il permet de prendre des décisions de routage intelligentes dans les processus de traitement des données en distinguant les documents numérisés des fichiers texte.

Mises à jour

  • 6 août 2026: Étoiles 8,766 → 11,746.

Mise à jour

  • 6 août 2026 : Étoile 8 766 → 11 746.

Ce que ça vous apporte

  • Classifie les fichiers PDF en quelques secondes
  • Convertit les textes au format Markdown sans erreurs
  • Pas besoin de services de reconnaissance optique de caractères (OCR)

Installation

Installation avec Python
pip install maturin
maturin develop --release
Installation avec Node.js
npm install @firecrawl/pdf-inspector

Si vous ne codez pas

🤖 Collez ceci dans votre agent (Claude Code · Codex · Antigravity)

Je dois analyser le fichier PDF que j'ai. Classez ce fichier pour voir s’il s’agit d’un document textuel ou numérisé. S'il est basé sur du texte, convertissez-le dans un format Markdown propre, en préservant le texte, les tableaux et les titres. Déterminez correctement l'ordre de lecture en utilisant la structure et les informations de police du fichier, sans utiliser l'OCR.

Termes liés du glossaire

Pour quiConvient aux développeurs qui ont besoin rapidement de données textuelles structurées, telles que des rapports, des documents financiers ou des articles de recherche.
LicenceMIT

Liens

TreScout n'a pas développé cet outil · nous l'avons repéré dans les tendances GitHub et présenté. Cette page décrit le dépôt tel qu'il était le 2026-08-04 : Le nombre d'étoiles et notre texte datent de ce jour, le dépôt a pu changer depuis. Consultez le lien du dépôt pour l'état actuel.