Guide universel d'entraînement de modèles TTS et de préparation de jeux de données¶
Bienvenue dans ce guide pratique consacré à la préparation de jeux de données vocales, à l'entraînement ou au fine-tuning de modèles Text-to-Speech personnalisés, à l'inférence et au conditionnement des modèles pour leur réutilisation.
Commencez ici¶
Suivez ce processus dans l'ordre si vous démarrez un nouveau projet :
- Préparez votre jeu de données
- Configurez l'environnement d'entraînement
- Entraînez ou affinez le modèle
- Générez de la parole avec l'inférence
- Conditionnez et partagez le modèle
- Résolvez les problèmes et trouvez des ressources
Choisissez votre parcours¶
- Vous avez de l'audio brut sans transcriptions propres : commencez par la Préparation des données.
- Vous avez déjà des paires audio-texte propres : passez à la Configuration de l'entraînement.
- Vous avez un checkpoint entraîné : consultez l'Inférence.
- Vous avez un modèle prêt à distribuer : lisez Packaging et partage.
Ce guide reste indépendant des frameworks lorsque cela est possible. Il se concentre sur les décisions et les vérifications communes aux outils TTS modernes.
Utilisez le sélecteur de langue dans l'en-tête pour passer d'une traduction à l'autre. Les contributions et les nouvelles traductions sont décrites dans le Guide de traduction.