Ferramenta OCR que prepara documentos para inteligência artificial
Desenvolvido pela PaddlePaddle, o PaddleOCR é uma ferramenta leve de reconhecimento óptico de caracteres que converte PDF e documentos visuais em dados estruturados para grandes modelos de linguagem. Esta biblioteca, que suporta mais de 100 idiomas, padroniza o fluxo de dados entre conteúdo visual e modelos de inteligência artificial.
Atualizações
- 2 de agosto de 2026: Estrelas 80,160 → 86,787, versão mais recente v3.7.0 (11 de junho de 2026).
O que você ganha
- Converte PDFs e imagens para o formato JSON ou Markdown
- Reconhece mais de 100 idiomas com um único modelo
- Fornece alta precisão com baixo uso de recursos
Instalação
pip install paddleocrSe você não programa
Quero converter os documentos PDF e visuais que possuo em dados estruturados que os modelos de inteligência artificial possam processar. Como posso converter o texto, tabelas e fórmulas dos meus documentos para o formato Markdown ou JSON com a mais alta precisão, usando modelos como PP-OCRv6 ou HPD-Parsing do PaddleOCR? Quais configurações devo escolher para alta eficiência e velocidade neste processo?
Termos relacionados do glossário
Links
A TreScout não desenvolveu esta ferramenta · nós a encontramos nas tendências do GitHub e a apresentamos. Esta página descreve o repositório em 2026-06-05: A contagem de estrelas e o nosso texto são daquele dia, o repositório pode ter mudado desde então. Consulte o link do repositório para ver o estado atual. Esta página foi traduzida automaticamente do original em turco · a versão turca é a que vale.