IA local para clonar voces con buena calidad

  • Autor Autor angelseoia
  • Fecha de inicio Fecha de inicio
A

angelseoia

Beta
¡Usuario con pocos negocios! ¡Utiliza siempre saldo de Forobeta!
Voicebox te permite clonar voces en local de manera muy sencilla y gratuita.

Instalación 1 clic usando Pinokio. Descárgalo en el siguiente enlace: https://pinokio.co/download.html

 
Tengo algunas dudas al respecto:

Se puede monetizar vídeos de youtube usando voces TTS?

Este modelo mejora XTTSv2, de Coqui TTS? (Que no se podía usar en Youtube por un tema de licencia).

Y cómo se compara este modelo con los recientes chatterbox y F5 Spanish?
 
Tengo algunas dudas al respecto:

Se puede monetizar vídeos de youtube usando voces TTS?

Este modelo mejora XTTSv2, de Coqui TTS? (Que no se podía usar en Youtube por un tema de licencia).

Y cómo se compara este modelo con los recientes chatterbox y F5 Spanish?
Se puede monetizar siempre y cuando no uses la voz de algún personaje o actor famoso, tambien hay que entender que no es lo mismo narrar una pequeña parte del video con X voz que basar la identidad del canal en esa voz, el modelo que usa es Qwent TTs su ultima versión, el programa solo es una UI mas agradable y te ahorra el proceso de instalación

es x3 veces superior a casi todos los motores que nombraste, creo que donde hay competencia es con chatterbox
 
Se puede monetizar siempre y cuando no uses la voz de algún personaje o actor famoso, tambien hay que entender que no es lo mismo narrar una pequeña parte del video con X voz que basar la identidad del canal en esa voz, el modelo que usa es Qwent TTs su ultima versión, el programa solo es una UI mas agradable y te ahorra el proceso de instalación

es x3 veces superior a casi todos los motores que nombraste, creo que donde hay competencia es con chatterbox
Sí, yo mañana instalaré qwen3-tts porque mi intención es usarlo mediante scripting en la terminal.

Entonces, será verdad que es una alternativa libre al elevenlabs? La idea seía usalo con RVC para dale consistencia a una voz que previamente habré diseñado.
 
Yo lo estoy usando pero se suele tildar bastante, al menos en mi pc, a veces se apaga o no carga las voces
 
Sí, yo mañana instalaré qwen3-tts porque mi intención es usarlo mediante scripting en la terminal.

Entonces, será verdad que es una alternativa libre al elevenlabs? La idea seía usalo con RVC para dale consistencia a una voz que previamente habré diseñado.
Para la gran mayoría de usos es funcional y gratuito, aunque acaba de salir una mejor que es fish audio, igual es opensource pero la inferencia requiere mínimo 24GB de Vram lo cual no está a mi alcance local, pero el plan de pago son 5$ y te da un x3 de créditos de lo que otorga elevenlabs y tiene mas de 1500+ etiquetas de expresiones, por lo cual puedes manipular mas el audio, creo que a mi criterio es la mejor actualmente
 
El qwen3-tts en local tiene buena pinta. Lo estoy configurando con python. Tiene algunos modelos pero voy a usar ahora el VoiceDesign. Ya son unas 18 GB de instalación, entre el python 3.12, los modelos, safetensors, pytorch, torchaudio, etc.
 
Atrás
Arriba