# Schnelle und native PDF-Textverarbeitung

PDF Inspector, entwickelt von Firecrawl, ist eine schnelle Rust-Bibliothek zum Überprüfen, Klassifizieren und Extrahieren des Texts von PDF-Dateien. Es ermöglicht intelligente Routing-Entscheidungen in Datenverarbeitungsprozessen, indem es gescannte Dokumente von textbasierten Dateien unterscheidet.

- ★ 18.936
- Rust
- GitHub Trending · 2026-08-04

## Was es bringt
- Klassifiziert PDF-Dateien in Sekundenschnelle
- Konvertiert Texte fehlerfrei in das Markdown-Format
- Es sind keine OCR-Dienste (Optical Character Recognition) erforderlich

## Installation
**Installation mit Python**

```
pip install maturin
maturin develop --release
```

**Installation mit Node.js**

```
npm install @firecrawl/pdf-inspector
```


## Wenn Sie nicht programmieren
Ich muss die PDF-Datei, die ich habe, analysieren. Klassifizieren Sie diese Datei, um festzustellen, ob es sich um ein textbasiertes oder ein gescanntes Dokument handelt. Wenn es textbasiert ist, konvertieren Sie es in ein sauberes Markdown-Format und behalten dabei den Text, die Tabellen und Überschriften bei. Bestimmen Sie die Lesereihenfolge korrekt, indem Sie die Struktur- und Schriftartinformationen der Datei selbst verwenden, ohne OCR zu verwenden.

## Verwandte Begriffe aus dem Glossar

## Links
- GitHub-Repository →
- Auf Türkisch lesen →

---
Quelle: TreScout Entdecken · https://trescout.com/de/discover/pdf-inspector/
