LongCat...para videos IA ¿Cómo lo ejecuto?

  • Autor Autor Perumira
  • Fecha de inicio Fecha de inicio
Perumira

Perumira

Delta
Verificación en dos pasos activada
¡Usuario con pocos negocios! ¡Utiliza siempre saldo de Forobeta!
Encontre un post en LinkedIn donde se mostraba LongCat-Avatar, una solución open source y completamente gratuita. Se dice que solo necesitas subir una imagen y un archivo de audio para generar un video de un avatar hablando con una sincronización impecable, capaz de soportar varios minutos de duración. Pero yo no se como ejecutarlo desde Github ¿alguien sabe? @Cicklow


Dejo imagen de referencia


videoframe_16047.webp
 
... Tenes que instalar todo lo que te indica el git en tu pc. No es online
 
si ya instalaste todas las librerias, solo ejecuta este comando desde la carpeta del proyecto en tu pc.


Insertar CODE, HTML o PHP:
streamlit run ./run_streamlit.py --server.fileWatcherType none --server.headless=false
 
Hola! Para ejecutar proyectos de IA como LongCat-Avatar sin necesidad de instalar dependencias complejas ni tener una tarjeta gráfica potente en tu ordenador local, la mejor opción es utilizar Google Colab con aceleración por GPU. En el propio repositorio de GitHub, dentro del archivo README.md, el autor suele incluir los comandos de instalación básicos o un enlace directo a un cuaderno interactivo. Por lo general, el proceso consiste en clonar el repositorio con Git, instalar las librerías necesarias con un comando de pip, descargar los pesos del modelo alojados en Hugging Face e invocar el script de inferencia en Python pasando la ruta de tu imagen y tu archivo de audio como parámetros. Si no tienes experiencia previa con la terminal o scripts de código, puedes pedirle a un desarrollador del foro que te adapte esos comandos en una libreta de Colab funcional de un solo clic para que solo tengas que subir tus archivos y procesar el vídeo en la nube de forma totalmente gratuita.
 
como ejecutarlo desde Github ¿alguien sabe?
no se ejecuta desde github

primero ves que esta hecho en código python , entonces instalas python.

después dice "Clone the repo", que bajes el código de la url con "git":
git clone --single-branch --branch main https://github.com/meituan-longcat/LongCat-Video
sino solo baja el zip

luego que vayas a la carpeta "LongCat-Video" en la consola con cd:
cd LongCat-Video

luego todo lo de las "dependencies" en la consola con pip/python

luego también con pip instalas "models"

luego en la consola como ya estas en la carpeta "LongCat-Video" , tiene que haber dentro el "torchrun run_demo_text_to_video.py"
para text-to-Video pones :
torchrun run_demo_text_to_video.py --checkpoint_dir=./weights/LongCat-Video --enable_compile

y así para los demás que vienen en la página:
Run Image-to-Video, Run Video-Continuation, etc


... Tenes que instalar todo lo que te indica el git en tu pc. No es online
el "git" solo es un programa para bajar la url, no te indica nada

Si no tienes experiencia previa con la terminal o scripts de código, puedes pedirle a un desarrollador del foro que te adapte esos comandos
¿le preguntaste al chat-gpt?
 
Por lo que veo, el problema no es tanto “ejecutarlo desde GitHub”, sino tener un equipo con recursos suficientes para moverlo.

El repositorio ya trae LongCat-Video-Avatar 1.5 y también una interfaz mediante Streamlit. En teoría, después de instalar dependencias y descargar los pesos, se puede lanzar con:

streamlit run ./run_streamlit.py --server.fileWatcherType none --server.headless=false

Lo que me genera más dudas es el hardware. El modelo base tiene 13,6B parámetros y en los ejemplos de Avatar 1.5 utilizan incluso configuración con 2 GPU. También permiten INT8 para reducir el consumo de VRAM.

Por eso, antes de instalar todo en local, miraría bien los requisitos de GPU. En un Colab gratuito tampoco daría por hecho que vaya a funcionar cómodamente.
 
Atrás
Arriba