Convertir des documents PDF pour l'IA
Développé par AllenAI, olmocr est une boîte à outils qui convertit les documents PDF en formats texte adaptés aux grands modèles de langage. Ce logiciel facilite les processus de préparation des ensembles de données en fournissant un traitement linéaire de structures de documents complexes.
Mises à jour
- 2 août 2026: Étoiles 18,418 → 19,259, dernière version v0.4.27 (12 mars 2026).
Mise à jour
- 2 août 2026 : Star 18 418 → 19 259, dernière version v0.4.27 (12 mars 2026).
Ce que ça vous apporte
- Convertit les formats PDF et image pour nettoyer le texte Markdown
- Traite les équations, les tableaux et les mises en page complexes dans le bon ordre de lecture
- Efface automatiquement les informations d’en-tête et de pied de page
Installation
sudo apt-get update
sudo apt-get install poppler-utils ttf-mscorefonts-installer msttcorefonts fonts-crosextra-caladea fonts-crosextra-carlito gsfonts lcdf-typetoolsconda create -n olmocr python=3.11
conda activate olmocrSi vous ne codez pas
Je souhaite convertir les documents PDF dont je dispose dans un format Markdown propre que les modèles d'intelligence artificielle peuvent facilement lire. Pouvez-vous m'expliquer étape par étape les étapes d'installation nécessaires à ce processus et la méthode pour l'exécuter sur le GPU local ?
Termes liés du glossaire
Liens
TreScout n'a pas développé cet outil · nous l'avons repéré dans les tendances GitHub et présenté. Cette page décrit le dépôt tel qu'il était le 2026-07-02 : Le nombre d'étoiles et notre texte datent de ce jour, le dépôt a pu changer depuis. Consultez le lien du dépôt pour l'état actuel.