Konvertieren Sie PDF-Dokumente für KI
Olmocr wurde von AllenAI entwickelt und ist ein Toolkit, das PDF-Dokumente in Textformate konvertiert, die für große Sprachmodelle geeignet sind. Diese Software erleichtert die Vorbereitung von Datensätzen durch die lineare Verarbeitung komplexer Dokumentstrukturen.
Aktualisierungen
- 2. August 2026: Sterne 18,418 → 19,259, neueste Version v0.4.27 (12. März 2026).
Was es bringt
- Konvertiert PDF- und Bildformate in sauberen Markdown-Text
- Verarbeitet Gleichungen, Tabellen und komplexe Layouts in der richtigen Lesereihenfolge
- Löscht automatisch Kopf- und Fußzeileninformationen
Installation
sudo apt-get update
sudo apt-get install poppler-utils ttf-mscorefonts-installer msttcorefonts fonts-crosextra-caladea fonts-crosextra-carlito gsfonts lcdf-typetoolsconda create -n olmocr python=3.11
conda activate olmocrWenn Sie nicht programmieren
Ich möchte die PDF-Dokumente, die ich habe, in ein sauberes Markdown-Format konvertieren, das Modelle der künstlichen Intelligenz problemlos lesen können. Können Sie mir Schritt für Schritt die für diesen Prozess erforderlichen Installationsschritte und die Methode zur Ausführung auf der lokalen GPU erklären?
Verwandte Begriffe aus dem Glossar
Links
TreScout hat dieses Werkzeug nicht entwickelt · wir haben es in den GitHub-Trends gefunden und stellen es vor. Diese Seite beschreibt das Repository so, wie es am 2026-07-02 war: Die Anzahl der Sterne und unser Text stammen von diesem Tag, das Repository kann sich seitdem geändert haben. Den aktuellen Stand finden Sie über den Link zum Repository. Diese Seite wurde maschinell übersetzt aus dem türkischen Original · maßgeblich ist die türkische Fassung.