Execute modelos gigantes de IA com 4 GB de VRAM
AirLLM permite que grandes modelos de linguagem com 70 bilhões de parâmetros sejam executados em unidades de processamento gráfico com apenas 4 GB de memória de vídeo (VRAM). Esta biblioteca utiliza técnicas de otimização de memória para permitir o uso de modelos de alta capacidade com baixos requisitos de hardware.
Atualizações
- 6 de setembro de 2026: Estrelas 33,307 → 33,755, versão mais recente v4.0.0 (5 de setembro de 2026).
- 31 de agosto de 2026: Estrelas 31,598 → 33,307, versão mais recente v3.3.0 (28 de agosto de 2026).
- 19 de agosto de 2026: Estrelas 30,796 → 31,598, versão mais recente v3.2.0 (18 de agosto de 2026).
- 12 de agosto de 2026: Estrelas 29,265 → 30,796, versão mais recente v3.1.0 (29 de julho de 2026).
O que você ganha
- Possibilidade de rodar modelos com parâmetros de 70B com 4GB VRAM.
- Capacidade de usar modelos 405B Llama3.1 com 8 GB VRAM.
- Aumento de velocidade de até 3x com compactação baseada em bloco.
Instalação
pip install airllmSe você não programa
Quero rodar um modelo com parâmetros de 70B usando a biblioteca AirLLM na minha placa gráfica com baixa capacidade de VRAM. Usei o comando pip install airllm para instalação. Como posso criar a estrutura de código Python necessária para carregar meu modelo e produzi-lo com uma entrada de texto simples, usando a classe AutoModel? Eu sei que preciso ter espaço em disco suficiente durante o processo. Você pode explicar as etapas básicas que preciso seguir para iniciar o processo?
Termos relacionados do glossário
Links
A TreScout não desenvolveu esta ferramenta · nós a encontramos nas tendências do GitHub e a apresentamos. Esta página descreve o repositório em 2026-06-04: A contagem de estrelas e o nosso texto são daquele dia, o repositório pode ter mudado desde então. Consulte o link do repositório para ver o estado atual. Esta página foi traduzida automaticamente do original em turco · a versão turca é a que vale.