← Descobrir
Descobrir · GitHub · Opendataloader PDF↑ +570 hoje

Prepare dados PDF para IA

OpenDataLoader PDF é um analisador de PDF de código aberto que disponibiliza dados para modelos de inteligência artificial. Este projeto baseado em Java acelera os processos de processamento de dados, automatizando a acessibilidade de documentos PDF.

Atualizações

  • 1 de setembro de 2026: Estrelas 28,872 → 28,879, versão mais recente v2.5.7 (1 de setembro de 2026).
  • 31 de agosto de 2026: Estrelas 28,831 → 28,872, versão mais recente v2.5.6 (31 de agosto de 2026).
  • 27 de agosto de 2026: Estrelas 28,676 → 28,831, versão mais recente v2.5.5 (25 de agosto de 2026).
  • 24 de agosto de 2026: Estrelas 28,638 → 28,676, versão mais recente v2.5.3 (24 de agosto de 2026).

O que você ganha

  • Converte arquivos PDF em formato Markdown, JSON ou HTML para modelos de IA.
  • Fornece extração de dados de alta precisão para documentos digitalizados e tabelas complexas.
  • Marca automaticamente arquivos PDF de acordo com os padrões de acessibilidade.

Instalação

Instalação com Python
pip install -U opendataloader-pdf
Instalação com modo híbrido
pip install -U "opendataloader-pdf[hybrid]"

Execução

Processo de conversão de PDF
import opendataloader_pdf

# Batch all files in one call — each convert() spawns a JVM process, so repeated calls are slow
opendataloader_pdf.convert(
    input_path=["file1.pdf", "file2.pdf", "folder/"],
    output_dir="output/",
    format="markdown,json"
)

Se você não programa

🤖 Cole isto no seu agente (Claude Code · Codex · Antigravity)

Quero analisar os arquivos PDF que possuo usando a ferramenta OpenDataLoader PDF e convertê-los em formatos de dados estruturados (Markdown ou JSON) que posso usar em processos RAG ou LLM. Você pode me ajudar a criar um script para ser executado em meu computador local usando o Python SDK que extrairá tabelas, títulos e texto de meus documentos na ordem de leitura correta? Explique também passo a passo como habilitar o modo híbrido para páginas complexas e personalizar a saída.

Termos relacionados do glossário

Para quem éPara desenvolvedores que desejam converter documentos PDF em dados estruturados para modelos de IA e para usuários que precisam automatizar a acessibilidade ao PDF.
LicençaApache-2.0

Links

A TreScout não desenvolveu esta ferramenta · nós a encontramos nas tendências do GitHub e a apresentamos. Esta página descreve o repositório em 2026-06-04: A contagem de estrelas e o nosso texto são daquele dia, o repositório pode ter mudado desde então. Consulte o link do repositório para ver o estado atual. Esta página foi traduzida automaticamente do original em turco · a versão turca é a que vale.