← Entdecken
Entdecken · GitHub · Opendataloader PDF↑ +570 heute

Bereiten Sie PDF-Daten für KI vor

OpenDataLoader PDF ist ein Open-Source-PDF-Parser, der Daten für Modelle der künstlichen Intelligenz verfügbar macht. Dieses Java-basierte Projekt beschleunigt Datenverarbeitungsprozesse, indem es die Zugänglichkeit von PDF-Dokumenten automatisiert.

Aktualisierungen

  • 1. September 2026: Sterne 28,872 → 28,879, neueste Version v2.5.7 (1. September 2026).
  • 31. August 2026: Sterne 28,831 → 28,872, neueste Version v2.5.6 (31. August 2026).
  • 27. August 2026: Sterne 28,676 → 28,831, neueste Version v2.5.5 (25. August 2026).
  • 24. August 2026: Sterne 28,638 → 28,676, neueste Version v2.5.3 (24. August 2026).

Was es bringt

  • Konvertiert PDF-Dateien in das Markdown-, JSON- oder HTML-Format für KI-Modelle.
  • Bietet hochpräzise Datenextraktion für gescannte Dokumente und komplexe Tabellen.
  • Markiert PDF-Dateien automatisch gemäß den Barrierefreiheitsstandards.

Installation

Installation mit Python
pip install -U opendataloader-pdf
Installation mit Hybridmodus
pip install -U "opendataloader-pdf[hybrid]"

Ausführung

PDF-Konvertierungsprozess
import opendataloader_pdf

# Batch all files in one call — each convert() spawns a JVM process, so repeated calls are slow
opendataloader_pdf.convert(
    input_path=["file1.pdf", "file2.pdf", "folder/"],
    output_dir="output/",
    format="markdown,json"
)

Wenn Sie nicht programmieren

🤖 Fügen Sie dies in Ihren Agenten ein (Claude Code · Codex · Antigravity)

Ich möchte meine PDF-Dateien mit dem PDF-Tool OpenDataLoader analysieren und in strukturierte Datenformate (Markdown oder JSON) konvertieren, die ich in RAG- oder LLM-Prozessen verwenden kann. Können Sie mir helfen, mit dem Python SDK ein Skript zu erstellen, das auf meinem lokalen Computer ausgeführt wird und Tabellen, Überschriften und Text in der richtigen Lesereihenfolge aus meinen Dokumenten extrahiert? Erklären Sie außerdem Schritt für Schritt, wie Sie den Hybridmodus für komplexe Seiten aktivieren und die Ausgabe anpassen.

Verwandte Begriffe aus dem Glossar

Für wen es gedacht istFür Entwickler, die PDF-Dokumente in strukturierte Daten für KI-Modelle konvertieren möchten, und für Benutzer, die die Barrierefreiheit von PDFs automatisieren müssen.
LizenzApache-2.0

Links

TreScout hat dieses Werkzeug nicht entwickelt · wir haben es in den GitHub-Trends gefunden und stellen es vor. Diese Seite beschreibt das Repository so, wie es am 2026-06-04 war: Die Anzahl der Sterne und unser Text stammen von diesem Tag, das Repository kann sich seitdem geändert haben. Den aktuellen Stand finden Sie über den Link zum Repository. Diese Seite wurde maschinell übersetzt aus dem türkischen Original · maßgeblich ist die türkische Fassung.