¿Qué modelo de IA están utilizando para hacer estas novelas de IA tan largas?

Toledor

Toledor

Épsilon
Verificado
Verificación en dos pasos activada
Verificado por Binance
Hola, hace un año que trabajo con IA, tengo mi propio método de trabajo pero aun no consigo como entender cómo estas paginas que tienen millones de visitas logran hacer estas novelas con diálogos y todo IA hasta 10 minutos de duración.

Parece ser que usan Gemini Ultra, pero gastaran solo 200$ al mes para generar tantos videos?...

No creo que tampoco sea el modelo veo 3.1 Light Lower Priority ya que ese modelo es muy malo para generar videos asi...

¿Qué creen ustedes?

 
Para generar novelas o guiones extensos de alta calidad, la clave no suele ser un solo modelo, sino una combinación de arquitecturas y técnicas de gestión de contexto. Muchos creadores utilizan modelos como Claude 3.5 Sonnet o GPT-4o a través de API, aprovechando sus grandes ventanas de contexto para mantener la coherencia narrativa durante toda la historia.

El costo no suele basarse en una suscripción plana, sino en el consumo por API, lo cual es mucho más económico y eficiente para automatizar grandes volúmenes de texto. Además, emplean técnicas de "agentes" o encadenamiento (chaining) donde un modelo escribe el guion, otro lo revisa y un tercero estructura los diálogos, optimizando el uso de tokens.

Para la parte visual y de audio, se utilizan herramientas especializadas como ElevenLabs para las voces y generadores de video como Kling, Luma o Runway, integrados mediante flujos de trabajo automatizados (como Make o scripts personalizados). Esto permite crear contenido de larga duración sin depender de una única interfaz web.
 
Para generar novelas o guiones extensos de alta calidad, la clave no suele ser un solo modelo, sino una combinación de arquitecturas y técnicas de gestión de contexto. Muchos creadores utilizan modelos como Claude 3.5 Sonnet o GPT-4o a través de API, aprovechando sus grandes ventanas de contexto para mantener la coherencia narrativa durante toda la historia.

El costo no suele basarse en una suscripción plana, sino en el consumo por API, lo cual es mucho más económico y eficiente para automatizar grandes volúmenes de texto. Además, emplean técnicas de "agentes" o encadenamiento (chaining) donde un modelo escribe el guion, otro lo revisa y un tercero estructura los diálogos, optimizando el uso de tokens.

Para la parte visual y de audio, se utilizan herramientas especializadas como ElevenLabs para las voces y generadores de video como Kling, Luma o Runway, integrados mediante flujos de trabajo automatizados (como Make o scripts personalizados). Esto permite crear contenido de larga duración sin depender de una única interfaz web.
Qué buena respuesta ha dado el bot! Voy a aplicar algunos de sus consejos para la primera novela que estoy redactando con IA.

En mi caso solo aplica a la parte de contenido, pero anoto las recomendaciones para la parte audiovisual
 
Qué buena respuesta ha dado el bot! Voy a aplicar algunos de sus consejos para la primera novela que estoy redactando con IA.

En mi caso solo aplica a la parte de contenido, pero anoto las recomendaciones para la parte audiovisual
Me alegra que la información te sea de utilidad para tu proyecto. Si te enfocas solo en el contenido, recuerda que la clave para mantener la coherencia en textos largos es gestionar bien el "historial" o memoria de la IA; usar un sistema de resumen de capítulos anteriores ayuda a que el modelo no pierda el hilo conductor.

Si en algún momento decides escalar hacia la parte audiovisual o automatizar procesos, recuerda que puedes explorar la sección de negocios del foro para buscar colaboradores o servicios especializados: https://forobeta.com/categories/seccion-de-negocios.4/
 
Tambien me interesa saber
 
Me alegra que la información te sea de utilidad para tu proyecto. Si te enfocas solo en el contenido, recuerda que la clave para mantener la coherencia en textos largos es gestionar bien el "historial" o memoria de la IA; usar un sistema de resumen de capítulos anteriores ayuda a que el modelo no pierda el hilo conductor.

Si en algún momento decides escalar hacia la parte audiovisual o automatizar procesos, recuerda que puedes explorar la sección de negocios del foro para buscar colaboradores o servicios especializados: https://forobeta.com/categories/seccion-de-negocios.4/
Yo mi novela la estoy redactando con Claude. Cree un proyecto y le subí información sobre los personajes, desarrollo de la trama, desarrollo de los personajes, y el estilo de redacción. Luego fui subiendo los capítulos al proyecto posteriores a mi revisión.

Quiero probar la parte que has comentado de un agente para la revisión, otro para los diálogos.

Y posteriormente pensar si tb le incluyo parte audiovisual.
 
La mayoría no genera 10 minutos de video puro por IA desde cero porque los costes de GPU y las inconsistencias de personajes te funden el presupuesto. El flujo real que usan esos canales con millones de visitas es este:

1. Guión y estructura: Usan Claude 3.5 Sonnet o Gemini dividiendo la historia por escenas/beats para mantener la coherencia narrativa y el tono dramático.
2. Voces y diálogos: ElevenLabs o el TTS de OpenAI (mucho más económico y rápido para textos largos de 10 minutos).
3. Visuales: Generan las imágenes base de los personajes con Midjourney v6 o Flux.1 usando referencias consistentes. No animan los 10 minutos completos: combinan transiciones cinemáticas, zooms y paneos en CapCut, y solo animan los planos clave usando herramientas como Kling AI o Minimax (Hailuo), que tienen planes mensuales fijos muy accesibles.

Con una suscripción fija a Midjourney + Kling gastan menos de $60 - $80 USD al mes y sacan decenas de videos largos sin pagar por token.
 
La mayoría no genera 10 minutos de video puro por IA desde cero porque los costes de GPU y las inconsistencias de personajes te funden el presupuesto. El flujo real que usan esos canales con millones de visitas es este:

1. Guión y estructura: Usan Claude 3.5 Sonnet o Gemini dividiendo la historia por escenas/beats para mantener la coherencia narrativa y el tono dramático.
2. Voces y diálogos: ElevenLabs o el TTS de OpenAI (mucho más económico y rápido para textos largos de 10 minutos).
3. Visuales: Generan las imágenes base de los personajes con Midjourney v6 o Flux.1 usando referencias consistentes. No animan los 10 minutos completos: combinan transiciones cinemáticas, zooms y paneos en CapCut, y solo animan los planos clave usando herramientas como Kling AI o Minimax (Hailuo), que tienen planes mensuales fijos muy accesibles.

Con una suscripción fija a Midjourney + Kling gastan menos de $60 - $80 USD al mes y sacan decenas de videos largos sin pagar por token.
Se sabe que no se anima la historia completa. Primero se hacen las imágenes y luego se animan poco a poco. Algunos hacen lo que tú dices de animar con diálogo solo el principio pero este ejemplo que estoy colocando el diálogo y la animación es en toda la historia por 5, 6 y minutos o más
 
Ah, claro, te refieres a la sincronización labial continua (Lip-Sync) y animación facial durante todo el diálogo de 5 a 6 minutos, no a planos de acción general.

El truco de esos canales NO es usar generadores de video tradicionales (como Veo o Runway), porque al segundo 10 la cara se deforma y te cuesta una fortuna. Lo que usan es un pipeline de Video Portrait / Lip-Sync:

1. El motor de diálogo continuo: Usan Hedra AI (Character-2) o LivePortrait. Suben la imagen fija del personaje generada en Midjourney + el archivo de audio completo de ElevenLabs con los diálogos, y la herramienta anima automáticamente los labios, parpadeos, gestos y movimientos de cabeza sincronizados con la voz.

2. La estructura de montaje (Plano y Contraplano): Generan la pista de audio continua de la conversación con las dos voces. Luego en edición no tienen una sola toma de 6 minutos: cortan entre Personaje A hablando (10-15s), Personaje B escuchando/asintiendo y planos de detalle.

Con Hedra o instancias de LivePortrait en RunPod/ComfyUI sacan videos de diálogo infinito por centavos. Si quieres te paso el flujo detallado por privado.
 
Ah, claro, te refieres a la sincronización labial continua (Lip-Sync) y animación facial durante todo el diálogo de 5 a 6 minutos, no a planos de acción general.

El truco de esos canales NO es usar generadores de video tradicionales (como Veo o Runway), porque al segundo 10 la cara se deforma y te cuesta una fortuna. Lo que usan es un pipeline de Video Portrait / Lip-Sync:

1. El motor de diálogo continuo: Usan Hedra AI (Character-2) o LivePortrait. Suben la imagen fija del personaje generada en Midjourney + el archivo de audio completo de ElevenLabs con los diálogos, y la herramienta anima automáticamente los labios, parpadeos, gestos y movimientos de cabeza sincronizados con la voz.

2. La estructura de montaje (Plano y Contraplano): Generan la pista de audio continua de la conversación con las dos voces. Luego en edición no tienen una sola toma de 6 minutos: cortan entre Personaje A hablando (10-15s), Personaje B escuchando/asintiendo y planos de detalle.

Con Hedra o instancias de LivePortrait en RunPod/ComfyUI sacan videos de diálogo infinito por centavos. Si quieres te paso el flujo detallado por privado.
Pásame un ejemplo de cómo es ese flujo de trabajo en un video
 
No te hace falta que te grabe nada, podés probarlo vos mismo gratis ahora en 2 minutos:

Entrá a https://www.hedra.com/ (herramienta Character-2/3).
Subís una imagen de plano medio de cualquier personaje hecho en Midjourney + un audio de ElevenLabs, le das a generar y vas a ver cómo te sincroniza la voz, los labios, el parpadeo y los movimientos de cabeza sin límite de tiempo.

Si querés ver el tutorial paso a paso con el montaje de planos en CapCut, buscá en YouTube: "Hedra AI ElevenLabs dialogue workflow" o "Hedra AI lip sync tutorial". Vas a ver exactamente cómo arman las escenas de las novelas sin gastar nada.
 
No te hace falta que te grabe nada, podés probarlo vos mismo gratis ahora en 2 minutos:

Entrá a https://www.hedra.com/ (herramienta Character-2/3).
Subís una imagen de plano medio de cualquier personaje hecho en Midjourney + un audio de ElevenLabs, le das a generar y vas a ver cómo te sincroniza la voz, los labios, el parpadeo y los movimientos de cabeza sin límite de tiempo.

Si querés ver el tutorial paso a paso con el montaje de planos en CapCut, buscá en YouTube: "Hedra AI ElevenLabs dialogue workflow" o "Hedra AI lip sync tutorial". Vas a ver exactamente cómo arman las escenas de las novelas sin gastar nada.
gracias bro
 
Hola, hace un año que trabajo con IA, tengo mi propio método de trabajo pero aun no consigo como entender cómo estas paginas que tienen millones de visitas logran hacer estas novelas con diálogos y todo IA hasta 10 minutos de duración.

Parece ser que usan Gemini Ultra, pero gastaran solo 200$ al mes para generar tantos videos?...

No creo que tampoco sea el modelo veo 3.1 Light Lower Priority ya que ese modelo es muy malo para generar videos asi...

¿Qué creen ustedes?


yo ando haicendo una mini serie, y acabo de decirle a mi agente que se aprenda todos los consejos del hilo xD
 
Al final creo que el verdadero reto no es tanto encontrar “la IA” que haga todo, sino mantener la continuidad entre escenas y capítulos.

Si vais a hacer una mini serie, yo tendría una especie de biblia del proyecto con los personajes, ropa, escenarios, personalidad, relaciones, estilo visual, etc. y se la pasaría siempre al agente. Incluso guardaría las imágenes de referencia de cada personaje para reutilizarlas.

Porque hacer un vídeo espectacular de 20 segundos ya es relativamente fácil; lo complicado es que en el capítulo 8 el protagonista siga teniendo la misma cara, el mismo estilo y que la historia no empiece a contradecir capítulos anteriores 😅.
 
Atrás
Arriba