eddddd
Eta
Programador
¡Usuario con pocos negocios! ¡Utiliza siempre saldo de Forobeta!
AirLLM es una herramienta que permite ejecutar modelos de lenguaje grandes (LLMs) en hardware con poca memoria GPU, pero con importantes limitaciones de velocidad.
## Cómo funciona
Carga el modelo capa por capa en lugar de todo a la vez:
## Capacidades técnicas
## Limitaciones importantes:
Conclusión: Interesante como demostración técnica y para prototipado, pero impracticable para uso interactivo real.
github.com
## Cómo funciona
Carga el modelo capa por capa en lugar de todo a la vez:
- Carga una capa → Ejecuta cálculos → Libera memoria → Carga siguiente capa
- Esto mantiene el uso de VRAM extremadamente bajo
## Capacidades técnicas
- Ejecuta modelos de 70B en 4GB de VRAM
- Puede correr Llama 3.1 405B en 8GB de VRAM
- Compatible con CPU y GPU (Linux, macOS Apple Silicon)
- API similar a Hugging Face Transformers
## Limitaciones importantes:
- ⚠️ Extremadamente lento - no apto para uso en producción
- ⚠️ Depende mucho de la velocidad del disco (I/O)
- ⚠️ No es nuevo - el proyecto original es de noviembre 2023
- ⚠️ Solo para inferencia, no para entrenamiento
- ⚠️ Mejor usar modelos cuantizados más pequeños en CPU con 32GB RAM
Conclusión: Interesante como demostración técnica y para prototipado, pero impracticable para uso interactivo real.
GitHub - 0xSojalSec/airllm: Runs 405B LLMs on 8GB VRAM
Runs 405B LLMs on 8GB VRAM. Contribute to 0xSojalSec/airllm development by creating an account on GitHub.
Última edición:

