Bereiten Sie PDF-Daten für KI vor
OpenDataLoader PDF ist ein Open-Source-PDF-Parser, der Daten für Modelle der künstlichen Intelligenz verfügbar macht. Dieses Java-basierte Projekt beschleunigt Datenverarbeitungsprozesse, indem es die Zugänglichkeit von PDF-Dokumenten automatisiert.
Aktualisierungen
- 1. September 2026: Sterne 28,872 → 28,879, neueste Version v2.5.7 (1. September 2026).
- 31. August 2026: Sterne 28,831 → 28,872, neueste Version v2.5.6 (31. August 2026).
- 27. August 2026: Sterne 28,676 → 28,831, neueste Version v2.5.5 (25. August 2026).
- 24. August 2026: Sterne 28,638 → 28,676, neueste Version v2.5.3 (24. August 2026).
Was es bringt
- Konvertiert PDF-Dateien in das Markdown-, JSON- oder HTML-Format für KI-Modelle.
- Bietet hochpräzise Datenextraktion für gescannte Dokumente und komplexe Tabellen.
- Markiert PDF-Dateien automatisch gemäß den Barrierefreiheitsstandards.
Installation
pip install -U opendataloader-pdfpip install -U "opendataloader-pdf[hybrid]"Ausführung
import opendataloader_pdf
# Batch all files in one call — each convert() spawns a JVM process, so repeated calls are slow
opendataloader_pdf.convert(
input_path=["file1.pdf", "file2.pdf", "folder/"],
output_dir="output/",
format="markdown,json"
)Wenn Sie nicht programmieren
Ich möchte meine PDF-Dateien mit dem PDF-Tool OpenDataLoader analysieren und in strukturierte Datenformate (Markdown oder JSON) konvertieren, die ich in RAG- oder LLM-Prozessen verwenden kann. Können Sie mir helfen, mit dem Python SDK ein Skript zu erstellen, das auf meinem lokalen Computer ausgeführt wird und Tabellen, Überschriften und Text in der richtigen Lesereihenfolge aus meinen Dokumenten extrahiert? Erklären Sie außerdem Schritt für Schritt, wie Sie den Hybridmodus für komplexe Seiten aktivieren und die Ausgabe anpassen.
Verwandte Begriffe aus dem Glossar
Links
TreScout hat dieses Werkzeug nicht entwickelt · wir haben es in den GitHub-Trends gefunden und stellen es vor. Diese Seite beschreibt das Repository so, wie es am 2026-06-04 war: Die Anzahl der Sterne und unser Text stammen von diesem Tag, das Repository kann sich seitdem geändert haben. Den aktuellen Stand finden Sie über den Link zum Repository. Diese Seite wurde maschinell übersetzt aus dem türkischen Original · maßgeblich ist die türkische Fassung.