Files
Loki/.env.example
T
Loki 1e232a7ff3 Simplification radicale : moteur pris de l'image officielle llama.cpp
Plus aucune compilation CUDA : le runtime part de
ghcr.io/ggml-org/llama.cpp:server-cuda (llama-server précompilé et maintenu
par l'équipe amont, backends .so chargés dynamiquement, archs GPU courantes,
repli CPU fonctionnel). Le build complet passe de ~40 min à ~4 min et tous
les pièges du build CUDA sans GPU (stubs libcuda, espace disque du runner,
choix des architectures) disparaissent.

- Dockerfile : 2 étapes (Go + image officielle), build-arg LLAMACPP_IMAGE
  pour épingler une version ou passer en CPU/Vulkan
- entrypoint : BIN=/app/llama-server
- workflow GHCR : purge disque et CUDA_ARCHS supprimés, cache max
- compose/.env/README à l'avenant

Validé : build 3 min 55, UI HTTP 200, healthcheck healthy, superviseur PID
OK, llama-server démarre (repli CPU) et n'échoue que sur un modèle factice.
2026-08-14 22:59:35 +00:00

15 lines
587 B
Bash

# ── Loki — configuration du build/run Docker ────────────────────────────
# (fork d'AJEAN : https://github.com/nathaninline/ajean)
# Port de l'interface web (identique dedans/dehors).
LOKI_WEB_PORT=8090
# Optionnel — semé au PREMIER démarrage seulement (modifiable ensuite dans
# l'UI, qui garde la main) :
# Modèle initial : nom d'un .gguf présent dans ./models ou chemin complet.
LOKI_MODEL=
# Taille de contexte (défaut moteur : 32768)
LOKI_CTX=
# Couches déportées sur le GPU (défaut : 999 = tout)
LOKI_NGL=