# Convertir des documents PDF pour l'IA

Développé par AllenAI, olmocr est une boîte à outils qui convertit les documents PDF en formats texte adaptés aux grands modèles de langage. Ce logiciel facilite les processus de préparation des ensembles de données en fournissant un traitement linéaire de structures de documents complexes.

- ★ 19 259
- Python
- GitHub Trending · 2026-07-02

## Mise à jour
- 2 août 2026 : Star 18 418 → 19 259, dernière version v0.4.27 (12 mars 2026).

## Ce que ça vous apporte
- Convertit les formats PDF et image pour nettoyer le texte Markdown
- Traite les équations, les tableaux et les mises en page complexes dans le bon ordre de lecture
- Efface automatiquement les informations d’en-tête et de pied de page

## Installation
**Installation des dépendances du système**

```
sudo apt-get update
sudo apt-get install poppler-utils ttf-mscorefonts-installer msttcorefonts fonts-crosextra-caladea fonts-crosextra-carlito gsfonts lcdf-typetools
```

**Création d'un environnement Python**

```
conda create -n olmocr python=3.11
conda activate olmocr
```


## Si vous ne codez pas
Je souhaite convertir les documents PDF dont je dispose dans un format Markdown propre que les modèles d'intelligence artificielle peuvent facilement lire. Pouvez-vous m'expliquer étape par étape les étapes d'installation nécessaires à ce processus et la méthode pour l'exécuter sur le GPU local ?

## Termes liés du glossaire

## Liens
- Dépôt GitHub →
- Lire en turc →

---
Source : TreScout Découvrir · https://trescout.com/fr/discover/olmocr/
