Guía Universal de Entrenamiento de Modelos TTS y Preparación de Datasets¶
Bienvenido a una guía práctica para preparar datasets de voz, entrenar o ajustar modelos personalizados de Text-to-Speech, ejecutar inferencia y empaquetar modelos para reutilizarlos.
Empieza aquí¶
Sigue este flujo en orden si estás iniciando un proyecto nuevo:
- Prepara tu dataset
- Configura el entorno de entrenamiento
- Entrena o ajusta el modelo
- Genera voz mediante inferencia
- Empaqueta y comparte el modelo
- Resuelve problemas y encuentra recursos
Elige tu camino¶
- Tienes audio sin transcripciones limpias: empieza por Preparación de Datos.
- Ya tienes pares de audio y texto limpios: continúa con Configuración del Entrenamiento.
- Tienes un checkpoint entrenado: ve a Inferencia.
- Tienes un modelo listo para distribuir: lee Empaquetado y Compartición.
La guía intenta ser independiente del framework siempre que sea posible. Se centra en decisiones y comprobaciones que se aplican a las herramientas TTS modernas.
Usa el selector de idioma de la cabecera para cambiar entre las traducciones disponibles. Las contribuciones y las nuevas traducciones se explican en la Guía de Traducción.