← Descobrir
Descobrir · GitHub · Olmocr↑ +334 hoje

Converta documentos PDF para IA

Desenvolvido pela AllenAI, olmocr é um kit de ferramentas que converte documentos PDF em formatos de texto adequados para modelos de linguagem grandes. Este software facilita os processos de preparação de conjuntos de dados, fornecendo processamento linear de estruturas complexas de documentos.

Atualizações

  • 2 de agosto de 2026: Estrelas 18,418 → 19,259, versão mais recente v0.4.27 (12 de março de 2026).

O que você ganha

  • Converte formatos PDF e de imagem para limpar texto Markdown
  • Processa equações, tabelas e layouts complexos na ordem de leitura correta
  • Limpa automaticamente informações de cabeçalho e rodapé

Instalação

Instalando dependências do sistema
sudo apt-get update
sudo apt-get install poppler-utils ttf-mscorefonts-installer msttcorefonts fonts-crosextra-caladea fonts-crosextra-carlito gsfonts lcdf-typetools
Criando um ambiente Python
conda create -n olmocr python=3.11
conda activate olmocr

Se você não programa

🤖 Cole isto no seu agente (Claude Code · Codex · Antigravity)

Quero converter os documentos PDF que possuo em um formato Markdown limpo que os modelos de inteligência artificial possam ler facilmente. Você pode me explicar passo a passo as etapas de instalação necessárias para este processo e o método de execução na GPU local?

Termos relacionados do glossário

Para quem éDestina-se a pesquisadores e desenvolvedores que desejam converter documentos PDF complexos em conjuntos de dados para grandes modelos de linguagem.
LicençaApache-2.0

Links

A TreScout não desenvolveu esta ferramenta · nós a encontramos nas tendências do GitHub e a apresentamos. Esta página descreve o repositório em 2026-07-02: A contagem de estrelas e o nosso texto são daquele dia, o repositório pode ter mudado desde então. Consulte o link do repositório para ver o estado atual. Esta página foi traduzida automaticamente do original em turco · a versão turca é a que vale.