PDF belgelerini yapay zekâ için dönüştürün
AllenAI tarafından geliştirilen olmocr, PDF belgelerini büyük dil modelleri (large language models) için uygun metin formatlarına dönüştüren bir araç takımıdır. Bu yazılım, karmaşık doküman yapılarının doğrusal bir biçimde işlenmesini sağlayarak veri seti hazırlama süreçlerini kolaylaştırır.
Güncelleme
- 2 Ağustos 2026: Yıldız 18.418 → 19.259, son sürüm v0.4.27 (12 Mart 2026).
Ne kazandırır?
- PDF ve resim formatlarını temiz Markdown metnine dönüştürür
- Denklem, tablo ve karmaşık düzenleri doğru okuma sırasıyla işler
- Üst ve alt bilgileri otomatik olarak temizler
Kurulum
sudo apt-get update
sudo apt-get install poppler-utils ttf-mscorefonts-installer msttcorefonts fonts-crosextra-caladea fonts-crosextra-carlito gsfonts lcdf-typetoolsconda create -n olmocr python=3.11
conda activate olmocrKod bilmiyorsanız
Elimdeki PDF belgelerini yapay zekâ modellerinin kolayca okuyabileceği temiz bir Markdown formatına dönüştürmek istiyorum. Bu işlem için gerekli olan kurulum adımlarını ve yerel GPU üzerinde çalıştırma yöntemini bana adım adım açıklar mısın?
Bağlantılar
TreScout bu aracı geliştirmedi · GitHub trendlerinde keşfedip Türkçe tanıttı. Bu sayfa deponun 2026-07-02 tarihindeki hâlini anlatır: Yıldız sayısı ve yazdığımız metin o güne aittir, depo sonrasında değişmiş olabilir. Güncel durum için depo bağlantısına bakın.