mirror of
https://github.com/R0m1k3/Loki.git
synced 2026-10-11 17:26:57 +02:00
- Dockerfile 3 étapes : llama.cpp CUDA (flags de backend_build.go, sauf GGML_NATIVE=OFF — l'image est bâtie sur un runner, pas sur la machine cible), binaire Go statique, runtime CUDA léger (tini, git, nodejs pour les serveurs MCP npx). - docker-entrypoint.sh : sème BIN/HOST/PORT (+ MODEL/CTX/NGL depuis l'env, au premier boot seulement), lance le moteur en supervision PID puis 'loki web' au premier plan. UI seule exposée (8090) ; le moteur (8080, non authentifié) reste interne. - Nouvelle commande 'loki config [get|set]' : configuration non interactive (la config vit dans bbolt, pas dans un fichier plat). - docker-compose.yml (build local, réservation GPU) + variante Unraid (image GHCR, runtime nvidia) ; volumes /data (LOKI_HOME) et /models. Un seul conteneur car llm_client.go joint le moteur sur localhost (hérité de l'amont).
20 lines
800 B
Bash
20 lines
800 B
Bash
# ── Loki — configuration du build/run Docker ────────────────────────────
|
|
# (fork d'AJEAN : https://github.com/nathaninline/ajean)
|
|
|
|
# Port de l'interface web (identique dedans/dehors).
|
|
LOKI_WEB_PORT=8090
|
|
|
|
# Architectures CUDA compilées (build local uniquement).
|
|
# 75=Turing (GTX 16xx / RTX 20xx), 86=Ampere (RTX 30xx), 89=Ada (RTX 40xx).
|
|
# Restreindre à sa carte divise le temps de compilation.
|
|
CUDA_ARCHS=75;86;89
|
|
|
|
# Optionnel — semé au PREMIER démarrage seulement (modifiable ensuite dans
|
|
# l'UI, qui garde la main) :
|
|
# Modèle initial : nom d'un .gguf présent dans ./models ou chemin complet.
|
|
LOKI_MODEL=
|
|
# Taille de contexte (défaut moteur : 32768)
|
|
LOKI_CTX=
|
|
# Couches déportées sur le GPU (défaut : 999 = tout)
|
|
LOKI_NGL=
|