← Découvrir
Découvrir · GitHub · Opendataloader PDF↑ +570 aujourd'hui

Préparer les données PDF pour l'IA

OpenDataLoader PDF est un analyseur PDF open source (analyseur PDF) qui met les données à disposition pour les modèles d'intelligence artificielle. Ce projet basé sur Java accélère les processus de traitement des données en automatisant l'accessibilité des documents PDF.

Mises à jour

  • 2 août 2026: Étoiles 23,530 → 28,095, dernière version v2.5.0 (14 juillet 2026).

Mise à jour

  • 2 août 2026 : Star 23 530 → 28 095, dernière version v2.5.0 (14 juillet 2026).

Ce que ça vous apporte

  • Convertit les fichiers PDF au format Markdown, JSON ou HTML pour les modèles IA.
  • Fournit une extraction de données de haute précision pour les documents numérisés et les tableaux complexes.
  • Balise automatiquement les fichiers PDF conformément aux normes d'accessibilité.

Installation

Installation avec Python
pip install -U opendataloader-pdf
Installation avec mode hybride
pip install -U "opendataloader-pdf[hybrid]"

Exécution

Processus de conversion PDF
import opendataloader_pdf

# Batch all files in one call — each convert() spawns a JVM process, so repeated calls are slow
opendataloader_pdf.convert(
    input_path=["file1.pdf", "file2.pdf", "folder/"],
    output_dir="output/",
    format="markdown,json"
)

Si vous ne codez pas

🤖 Collez ceci dans votre agent (Claude Code · Codex · Antigravity)

Je souhaite analyser les fichiers PDF dont je dispose à l'aide de l'outil PDF OpenDataLoader et les convertir en formats de données structurés (Markdown ou JSON) que je peux utiliser dans les processus RAG ou LLM. Pouvez-vous m'aider à créer un script à exécuter sur mon ordinateur local à l'aide du SDK Python qui extraira les tableaux, les titres et le texte de mes documents dans le bon ordre de lecture ? Expliquez également étape par étape comment activer le mode hybride pour les pages complexes et personnaliser la sortie.

Termes liés du glossaire

Pour quiPour les développeurs qui souhaitent convertir des documents PDF en données structurées pour les modèles d'IA et pour les utilisateurs qui ont besoin d'automatiser l'accessibilité des PDF.
LicenceApache-2.0

Liens

TreScout n'a pas développé cet outil · nous l'avons repéré dans les tendances GitHub et présenté. Cette page décrit le dépôt tel qu'il était le 2026-06-04 : Le nombre d'étoiles et notre texte datent de ce jour, le dépôt a pu changer depuis. Consultez le lien du dépôt pour l'état actuel.