From 8ba9cfb2345d234d963cf74d58aa5f145187cd87 Mon Sep 17 00:00:00 2001 From: Claude Date: Fri, 12 Jun 2026 07:06:10 +0000 Subject: [PATCH] =?UTF-8?q?ASR=20:=20limite=20--max-model-len=20=C3=A0=208?= =?UTF-8?q?192=20pour=20tenir=20dans=20le=20cache=20KV=20du=20GPU?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Par défaut vLLM réserve le contexte max du modèle (65k tokens = 7 Go de KV cache), ce qui dépasse la mémoire restante après chargement des poids sur les GPU modestes. 8192 tokens sont très largement suffisants pour des segments audio de 25 s. https://claude.ai/code/session_01YHMp3EKzr4s6o8w1ygxuUe --- docker-compose.unraid.yml | 1 + docker-compose.yml | 1 + 2 files changed, 2 insertions(+) diff --git a/docker-compose.unraid.yml b/docker-compose.unraid.yml index 812930a..4208e20 100644 --- a/docker-compose.unraid.yml +++ b/docker-compose.unraid.yml @@ -36,6 +36,7 @@ services: restart: unless-stopped command: >- --model Qwen/Qwen3-ASR-1.7B + --max-model-len 8192 --gpu-memory-utilization 0.70 runtime: nvidia environment: diff --git a/docker-compose.yml b/docker-compose.yml index e46de81..4caa4b4 100644 --- a/docker-compose.yml +++ b/docker-compose.yml @@ -23,6 +23,7 @@ services: restart: unless-stopped command: >- --model Qwen/Qwen3-ASR-1.7B + --max-model-len 8192 --gpu-memory-utilization 0.70 environment: - HUGGING_FACE_HUB_TOKEN=${HF_TOKEN:-}