mirror of
https://github.com/R0m1k3/LiveFlow.git
synced 2026-10-11 17:27:19 +02:00
ASR : limite --max-model-len à 8192 pour tenir dans le cache KV du GPU
Par défaut vLLM réserve le contexte max du modèle (65k tokens = 7 Go de KV cache), ce qui dépasse la mémoire restante après chargement des poids sur les GPU modestes. 8192 tokens sont très largement suffisants pour des segments audio de 25 s. https://claude.ai/code/session_01YHMp3EKzr4s6o8w1ygxuUe
This commit is contained in:
2 files changed
+2
No files matched your search
@@ -36,6 +36,7 @@ services:
|
||||
restart: unless-stopped
|
||||
command: >-
|
||||
--model Qwen/Qwen3-ASR-1.7B
|
||||
--max-model-len 8192
|
||||
--gpu-memory-utilization 0.70
|
||||
runtime: nvidia
|
||||
environment:
|
||||
|
||||
Reference in new issue
Block a user