Convertissez vos documents pour l'IA
MinerU convertit les formats de documents complexes tels que PDF et Office en format markdown ou JSON adapté aux grands modèles de langage. Cet outil vise à rendre les données non structurées disponibles dans des workflows basés sur des agents.
Mises à jour
- 2 août 2026: Étoiles 69,899 → 76,547, dernière version mineru-3.4.4-released (10 juillet 2026).
Mise à jour
- 2 août 2026 : Star 69 899 → 76 547, dernière version mineru-3.4.4-sortie (10 juillet 2026).
Ce que ça vous apporte
- Convertit les fichiers PDF et Office en langage de balisage
- Prépare les données non structurées pour les flux de travail des agents
- Convertit les formats de documents complexes en sortie JSON
Installation
pip install --upgrade pip
pip install uv
uv pip install -U "mineru[all]"git clone https://github.com/opendatalab/MinerU.git
cd MinerU
uv pip install -e .[all]Si vous ne codez pas
Je souhaite convertir les documents PDF et Office complexes dont je dispose dans un format que mon agent d'intelligence artificielle peut comprendre. Je dois convertir ces fichiers au format markdown ou JSON à l'aide de l'outil MinerU. Comment puis-je démarrer ce processus de transformation et utiliser les résultats le plus efficacement possible dans mes flux de travail basés sur des agents ?
Termes liés du glossaire
Liens
TreScout n'a pas développé cet outil · nous l'avons repéré dans les tendances GitHub et présenté. Cette page décrit le dépôt tel qu'il était le 2026-06-26 : Le nombre d'étoiles et notre texte datent de ce jour, le dépôt a pu changer depuis. Consultez le lien du dépôt pour l'état actuel.