Exécutez des modèles d'IA massifs localement
Colibri est un moteur basé sur le langage C qui permet d'exécuter des modèles de mélange d'experts (Mixture of Experts) à grande échelle sur des ordinateurs locaux avec de faibles exigences matérielles. En traitant les couches d'experts par flux depuis le disque, il permet d'exécuter des modèles d'IA à haute capacité sur du matériel limité.
Mises à jour
- 11 septembre 2026: Étoiles 27,608 → 27,610, dernière version v1.10.2 (6 septembre 2026).
Ce que ça vous apporte
- Exécute des modèles à haute capacité sur du matériel limité
- Gère la VRAM, la RAM et la mémoire disque comme une seule couche
- Assure l'efficacité en traitant les couches d'experts par flux
Installation
git clone https://github.com/JustVugg/colibri && cd colibri/c
./setup.sh # checks gcc/OpenMP, builds, self-testsExécution
cd c
make deepseek-v4
python ./coli chat --model /path/to/DeepSeek-V4-Flash --ram 32
# also: coli run / coli serve / coli web
# Windows CUDA tier: make cuda-dsv4-dll CUDA_ARCH=portable (+ make cuda-dsv4-dg-dll on RTX 50)Si vous ne codez pas
Je souhaite exécuter des modèles d'IA à grande échelle sur mon ordinateur local en utilisant le moteur Colibri. Aidez-moi à configurer mes ressources matérielles (VRAM, RAM et disque NVMe) de la manière la plus efficace possible. Expliquez étape par étape comment optimiser et exécuter des modèles tels que GLM ou DeepSeek en fonction de la capacité mémoire de mon système.
Termes liés du glossaire
Liens
TreScout n'a pas développé cet outil · nous l'avons repéré dans les tendances GitHub et présenté. Cette page décrit le dépôt tel qu'il était le 2026-09-11 : Le nombre d'étoiles et notre texte datent de ce jour, le dépôt a pu changer depuis. Consultez le lien du dépôt pour l'état actuel. Cette page a été traduite automatiquement depuis l’original turc · la version turque fait foi.