ASR : limite --max-model-len à 8192 pour tenir dans le cache KV du GPU

Par défaut vLLM réserve le contexte max du modèle (65k tokens = 7 Go de KV
cache), ce qui dépasse la mémoire restante après chargement des poids sur
les GPU modestes. 8192 tokens sont très largement suffisants pour des
segments audio de 25 s.

https://claude.ai/code/session_01YHMp3EKzr4s6o8w1ygxuUe
This commit is contained in:
Claude committed 2026-06-12 07:06:10 +00:00
1 parent 3c83b67538
commit 8ba9cfb234
2 files changed
+2

No files matched your search

+1
View File
@@ -36,6 +36,7 @@ services:
restart: unless-stopped
command: >-
--model Qwen/Qwen3-ASR-1.7B
--max-model-len 8192
--gpu-memory-utilization 0.70
runtime: nvidia
environment: