← Descobrir
Descobrir · GitHub · PaddleOCR

Ferramenta OCR que prepara documentos para inteligência artificial

Desenvolvido pela PaddlePaddle, o PaddleOCR é uma ferramenta leve de reconhecimento óptico de caracteres que converte PDF e documentos visuais em dados estruturados para grandes modelos de linguagem. Esta biblioteca, que suporta mais de 100 idiomas, padroniza o fluxo de dados entre conteúdo visual e modelos de inteligência artificial.

Atualizações

  • 2 de agosto de 2026: Estrelas 80,160 → 86,787, versão mais recente v3.7.0 (11 de junho de 2026).

O que você ganha

  • Converte PDFs e imagens para o formato JSON ou Markdown
  • Reconhece mais de 100 idiomas com um único modelo
  • Fornece alta precisão com baixo uso de recursos

Instalação

Python (pip)
pip install paddleocr

Se você não programa

🤖 Cole isto no seu agente (Claude Code · Codex · Antigravity)

Quero converter os documentos PDF e visuais que possuo em dados estruturados que os modelos de inteligência artificial possam processar. Como posso converter o texto, tabelas e fórmulas dos meus documentos para o formato Markdown ou JSON com a mais alta precisão, usando modelos como PP-OCRv6 ou HPD-Parsing do PaddleOCR? Quais configurações devo escolher para alta eficiência e velocidade neste processo?

Termos relacionados do glossário

Para quem éÉ adequado para desenvolvedores e analistas de dados que desejam utilizar seus documentos em aplicações de inteligência artificial.
LicençaApache-2.0

Links

A TreScout não desenvolveu esta ferramenta · nós a encontramos nas tendências do GitHub e a apresentamos. Esta página descreve o repositório em 2026-06-05: A contagem de estrelas e o nosso texto são daquele dia, o repositório pode ter mudado desde então. Consulte o link do repositório para ver o estado atual. Esta página foi traduzida automaticamente do original em turco · a versão turca é a que vale.