mirror of
https://github.com/R0m1k3/Socialflow.git
synced 2026-10-11 17:26:45 +02:00
SRT : la voix n'est plus jamais accélérée (atempo sans plafond, jusqu'à 2× et plus, rendait la voix incompréhensible). Un morceau plus long que son sous-titre déborde et décale les suivants ; les sous-titres suivent la voix, la vidéo s'allonge et un avertissement signale le décalage. Rythme : style par défaut « neutre », consignes Gemini sans « rythme entraînant », débit Edge des styles dynamique/promo ramené à +0 %/+3 %. Nouveau moteur « qwen » : service qwen-tts (Qwen3-TTS sur CPU, gratuit, français, ton piloté par consigne, clonage de voix depuis qwen-tts/voices). Même vérification Whisper que Gemini, généralisée ; repli qwen → gemini → edge, et une lecture sous 85 % du texte est écartée (mots sautés/faux). Co-Authored-By: Claude Opus 5.5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Upu97wMmsRkBoj6iVM4rH6
Voix clonées (Qwen3-TTS)
Pour une voix française native, déposez ici un court extrait (5 à 15 s, une seule personne, sans musique) et sa transcription exacte :
voices/
camille.wav # extrait de référence
camille.txt # texte prononcé dans l'extrait
camille.json # optionnel : {"label": "Camille — chaleureuse", "gender": "female"}
La voix apparaît alors dans le choix des voix Qwen sous l'identifiant
clone:camille. Le dossier peut aussi être monté en volume
(QWEN_TTS_VOICES_DIR) pour ajouter des voix sans reconstruire l'image.
Utilisez uniquement des voix dont vous avez les droits.