¿Qué es AirLLM y cómo puedo usarlo en mi proyecto?

  • Autor Autor eddddd
  • Fecha de inicio Fecha de inicio
eddddd

eddddd

Eta
Programador
¡Usuario con pocos negocios! ¡Utiliza siempre saldo de Forobeta!
AirLLM es una herramienta que permite ejecutar modelos de lenguaje grandes (LLMs) en hardware con poca memoria GPU, pero con importantes limitaciones de velocidad.

## Cómo funciona
Carga el modelo capa por capa en lugar de todo a la vez:
  • Carga una capa → Ejecuta cálculos → Libera memoria → Carga siguiente capa
  • Esto mantiene el uso de VRAM extremadamente bajo

## Capacidades técnicas
  • Ejecuta modelos de 70B en 4GB de VRAM
  • Puede correr Llama 3.1 405B en 8GB de VRAM
  • Compatible con CPU y GPU (Linux, macOS Apple Silicon)
  • API similar a Hugging Face Transformers

## Limitaciones importantes:
  • ⚠️ Extremadamente lento - no apto para uso en producción
  • ⚠️ Depende mucho de la velocidad del disco (I/O)
  • ⚠️ No es nuevo - el proyecto original es de noviembre 2023
  • ⚠️ Solo para inferencia, no para entrenamiento
  • ⚠️ Mejor usar modelos cuantizados más pequeños en CPU con 32GB RAM

Conclusión: Interesante como demostración técnica y para prototipado, pero impracticable para uso interactivo real.

 
Última edición:
se ve interesante este proyecto, haber si comentan como les va en este hilo, aunque minimo deben de tener un disco NVM m.2 y una grafica relativamente compatible con IA, para que no tenga lags considerables.
 
cuéntanos mas, por favor?
 
Atrás
Arriba