Prepare datos PDF para IA
OpenDataLoader PDF es un analizador de PDF de código abierto que pone datos a disposición de modelos de inteligencia artificial. Este proyecto basado en Java acelera los procesos de procesamiento de datos al automatizar la accesibilidad de los documentos PDF.
Actualizaciones
- 1 de septiembre de 2026: Estrellas 28,872 → 28,879, última versión v2.5.7 (1 de septiembre de 2026).
- 31 de agosto de 2026: Estrellas 28,831 → 28,872, última versión v2.5.6 (31 de agosto de 2026).
- 27 de agosto de 2026: Estrellas 28,676 → 28,831, última versión v2.5.5 (25 de agosto de 2026).
- 24 de agosto de 2026: Estrellas 28,638 → 28,676, última versión v2.5.3 (24 de agosto de 2026).
Qué aporta
- Convierte archivos PDF a formato Markdown, JSON o HTML para modelos de IA.
- Proporciona extracción de datos de alta precisión para documentos escaneados y tablas complejas.
- Etiqueta automáticamente archivos PDF de acuerdo con los estándares de accesibilidad.
Instalación
pip install -U opendataloader-pdfpip install -U "opendataloader-pdf[hybrid]"Ejecución
import opendataloader_pdf
# Batch all files in one call — each convert() spawns a JVM process, so repeated calls are slow
opendataloader_pdf.convert(
input_path=["file1.pdf", "file2.pdf", "folder/"],
output_dir="output/",
format="markdown,json"
)Si no programa
Quiero analizar los archivos PDF que tengo usando la herramienta OpenDataLoader PDF y convertirlos a formatos de datos estructurados (Markdown o JSON) que pueda usar en procesos RAG o LLM. ¿Pueden ayudarme a crear un script para ejecutar en mi computadora local usando el SDK de Python que extraiga tablas, encabezados y texto de mis documentos en el orden de lectura correcto? También explique paso a paso cómo habilitar el modo híbrido para páginas complejas y personalizar la salida.
Términos relacionados del glosario
Enlaces
TreScout no desarrolló esta herramienta · la encontramos en las tendencias de GitHub y la presentamos. Esta página describe el repositorio tal como estaba el 2026-06-04: El número de estrellas y nuestro texto son de ese día, el repositorio puede haber cambiado desde entonces. Consulte el enlace del repositorio para ver el estado actual. Esta página se tradujo automáticamente del original en turco · prevalece la versión turca.