# Procesamiento de texto PDF nativo y rápido

PDF Inspector, desarrollado por Firecrawl, es una biblioteca rápida de Rust diseñada para inspeccionar, clasificar y extraer el texto de archivos PDF. Permite tomar decisiones de enrutamiento inteligentes en los procesos de procesamiento de datos al distinguir los documentos escaneados de los archivos basados ​​en texto.

- ★ 18.936
- Rust
- GitHub Trending · 2026-08-04

## Qué aporta
- Clasifica archivos PDF en segundos
- Convierte textos a formato Markdown sin errores
- No hay necesidad de servicios de reconocimiento óptico de caracteres (OCR)

## Instalación
**Instalación con Python**

```
pip install maturin
maturin develop --release
```

**Instalación con Node.js**

```
npm install @firecrawl/pdf-inspector
```


## Si no programa
Necesito analizar el archivo PDF que tengo. Clasifique este archivo para ver si está basado en texto o es un documento escaneado. Si está basado en texto, conviértalo a un formato Markdown limpio, conservando el texto, las tablas y los encabezados. Determina correctamente el orden de lectura utilizando la propia estructura del archivo y la información de fuentes, sin utilizar OCR.

## Términos relacionados del glosario

## Enlaces
- Repositorio en GitHub →
- Leer en turco →

---
Fuente: TreScout Descubrir · https://trescout.com/es/discover/pdf-inspector/
