mirror of
https://github.com/R0m1k3/LiveFlow.git
synced 2026-10-11 17:27:19 +02:00
Découpage : ne plus couper les mots en début/fin de phrase
Maintenant que l'amplification ne sert qu'à la détection (l'audio transcrit reste propre), on peut rendre le VAD bien plus généreux aux bords sans coût sur la qualité : - pré-enregistrement 300 ms -> 750 ms (capture l'attaque de la 1re syllabe) - VAD plus sensible (agressivité 2 -> 1), déclenchement plus rapide (0.6 -> 0.35) - silence de fin 700 ms -> 950 ms (capture les fins de mots) Validé : lead-in 0.5 s + trailing 1.1 s capturés, phrases distinctes non fusionnées. https://claude.ai/code/session_01YHMp3EKzr4s6o8w1ygxuUe
This commit is contained in:
1 file changed
+5
-5
+5
-5
@@ -17,11 +17,11 @@ SAMPLE_RATE = 16000
|
|||||||
FRAME_MS = 30
|
FRAME_MS = 30
|
||||||
FRAME_BYTES = SAMPLE_RATE * FRAME_MS // 1000 * 2 # 960 octets
|
FRAME_BYTES = SAMPLE_RATE * FRAME_MS // 1000 * 2 # 960 octets
|
||||||
|
|
||||||
VAD_AGGRESSIVENESS = 2
|
VAD_AGGRESSIVENESS = 1 # plus sensible : capte les attaques/fins douces
|
||||||
PREROLL_FRAMES = 10 # 300 ms conservées avant le déclenchement
|
PREROLL_FRAMES = 25 # 750 ms gardées avant le déclenchement (début de phrase)
|
||||||
TRIGGER_RATIO = 0.6 # part de trames "parole" du pré-roll pour démarrer
|
TRIGGER_RATIO = 0.35 # déclenche vite, sur peu de trames "parole"
|
||||||
SILENCE_END_MS = 700 # silence qui clôt un segment
|
SILENCE_END_MS = 950 # silence qui clôt un segment (capte les fins de mots)
|
||||||
MIN_SPEECH_MS = 300 # en dessous, le segment est ignoré (bruit)
|
MIN_SPEECH_MS = 240 # en dessous, le segment est ignoré (bruit)
|
||||||
MAX_SEGMENT_S = 15 # coupe forcée pour garder une latence raisonnable
|
MAX_SEGMENT_S = 15 # coupe forcée pour garder une latence raisonnable
|
||||||
|
|
||||||
# Contrôle de gain automatique appliqué AVANT la détection de parole : sans lui,
|
# Contrôle de gain automatique appliqué AVANT la détection de parole : sans lui,
|
||||||
|
|||||||
Reference in new issue
Block a user