← Descubrir
Descubrir · GitHub · PaddleOCR

Herramienta OCR que prepara documentos para inteligencia artificial

Desarrollado por PaddlePaddle, PaddleOCR es una herramienta liviana de reconocimiento óptico de caracteres que convierte documentos visuales y PDF en datos estructurados para modelos de lenguaje grandes. Esta biblioteca, que admite más de 100 idiomas, estandariza el flujo de datos entre el contenido visual y los modelos de inteligencia artificial.

Actualizaciones

  • 2 de agosto de 2026: Estrellas 80,160 → 86,787, última versión v3.7.0 (11 de junio de 2026).

Qué aporta

  • Convierte archivos PDF e imágenes a formato JSON o Markdown
  • Reconoce más de 100 idiomas con un solo modelo
  • Proporciona alta precisión con bajo uso de recursos

Instalación

Python (pip)
pip install paddleocr

Si no programa

🤖 Pegue esto en su agente (Claude Code · Codex · Antigravity)

Quiero convertir los documentos visuales y PDF que tengo en datos estructurados que los modelos de inteligencia artificial puedan procesar. ¿Cómo puedo convertir el texto, tablas y fórmulas de mis documentos a formato Markdown o JSON con la mayor precisión, utilizando modelos como PP-OCRv6 o HPD-Parsing de PaddleOCR? ¿Qué opciones de configuración debo elegir para lograr una alta eficiencia y velocidad en este proceso?

Términos relacionados del glosario

Para quién esEs adecuado para desarrolladores y analistas de datos que quieran utilizar sus documentos en aplicaciones de inteligencia artificial.
LicenciaApache-2.0

Enlaces

TreScout no desarrolló esta herramienta · la encontramos en las tendencias de GitHub y la presentamos. Esta página describe el repositorio tal como estaba el 2026-06-05: El número de estrellas y nuestro texto son de ese día, el repositorio puede haber cambiado desde entonces. Consulte el enlace del repositorio para ver el estado actual. Esta página se tradujo automáticamente del original en turco · prevalece la versión turca.