Files
LiveFlow/docker-compose.unraid.yml
T
Claude 8ba9cfb234 ASR : limite --max-model-len à 8192 pour tenir dans le cache KV du GPU
Par défaut vLLM réserve le contexte max du modèle (65k tokens = 7 Go de KV
cache), ce qui dépasse la mémoire restante après chargement des poids sur
les GPU modestes. 8192 tokens sont très largement suffisants pour des
segments audio de 25 s.

https://claude.ai/code/session_01YHMp3EKzr4s6o8w1ygxuUe
2026-06-12 07:06:10 +00:00

48 lines
1.5 KiB
YAML

# Compose adapté à Unraid (plugin "Docker Compose Manager").
#
# Prérequis :
# 1. Plugin "Nvidia Driver" installé (Community Applications)
# 2. Le dépôt extrait dans /mnt/user/appdata/liveflow
# 3. Une stack Compose Manager pointant sur ce fichier
#
# L'app sert directement le HTTPS avec un certificat auto-signé (requis par
# les navigateurs pour autoriser le micro) : ouvrir https://<ip-unraid>:8443
# et accepter l'avertissement de certificat.
services:
app:
build: /mnt/user/appdata/liveflow/app
container_name: liveflow-app
restart: unless-stopped
ports:
- "8443:8000"
environment:
# ← IP (ou nom d'hôte) de votre serveur Unraid, pour le certificat HTTPS
- LIVEFLOW_HOST=192.168.1.16
- ASR_BASE_URL=http://asr:8000/v1
- ASR_MODEL=Qwen/Qwen3-ASR-1.7B
- ASR_API_KEY=sk-local
# Code langue ISO ("fr", "en"...) ou vide pour la détection automatique
- ASR_LANGUAGE=fr
- DB_PATH=/data/liveflow.db
volumes:
- /mnt/user/appdata/liveflow/data:/data
depends_on:
- asr
asr:
image: vllm/vllm-openai:latest
container_name: liveflow-asr
restart: unless-stopped
command: >-
--model Qwen/Qwen3-ASR-1.7B
--max-model-len 8192
--gpu-memory-utilization 0.70
runtime: nvidia
environment:
- NVIDIA_VISIBLE_DEVICES=all
- NVIDIA_DRIVER_CAPABILITIES=compute,utility
volumes:
- /mnt/user/appdata/liveflow/hf-cache:/root/.cache/huggingface
ipc: host