← Découvrir
Découvrir · GitHub · PaddleOCR

Outil OCR qui prépare des documents pour l'intelligence artificielle

Développé par PaddlePaddle, PaddleOCR est un outil léger de reconnaissance optique de caractères qui convertit les documents PDF et visuels en données structurées pour de grands modèles de langage. Cette bibliothèque, qui prend en charge plus de 100 langues, standardise le flux de données entre le contenu visuel et les modèles d'intelligence artificielle.

Mises à jour

  • 2 août 2026: Étoiles 80,160 → 86,787, dernière version v3.7.0 (11 juin 2026).

Mise à jour

  • 2 août 2026 : Star 80 160 → 86 787, dernière version v3.7.0 (11 juin 2026).

Ce que ça vous apporte

  • Convertit les PDF et les images au format JSON ou Markdown
  • Reconnaît plus de 100 langues avec un seul modèle
  • Fournit une grande précision avec une faible utilisation des ressources

Installation

Python (pépin)
pip install paddleocr

Si vous ne codez pas

🤖 Collez ceci dans votre agent (Claude Code · Codex · Antigravity)

Je souhaite convertir les documents PDF et visuels dont je dispose en données structurées que les modèles d'intelligence artificielle peuvent traiter. Comment puis-je convertir le texte, les tableaux et les formules de mes documents au format Markdown ou JSON avec la plus grande précision, en utilisant des modèles tels que PP-OCRv6 ou HPD-Parsing de PaddleOCR ? Quels paramètres de configuration dois-je choisir pour une efficacité et une rapidité élevées dans ce processus ?

Termes liés du glossaire

Pour quiIl convient aux développeurs et analystes de données qui souhaitent utiliser leurs documents dans des applications d'intelligence artificielle.
LicenceApache-2.0

Liens

TreScout n'a pas développé cet outil · nous l'avons repéré dans les tendances GitHub et présenté. Cette page décrit le dépôt tel qu'il était le 2026-06-05 : Le nombre d'étoiles et notre texte datent de ce jour, le dépôt a pu changer depuis. Consultez le lien du dépôt pour l'état actuel.