mirror of
https://github.com/R0m1k3/Loki.git
synced 2026-10-12 01:37:06 +02:00
Plus aucune compilation CUDA : le runtime part de ghcr.io/ggml-org/llama.cpp:server-cuda (llama-server précompilé et maintenu par l'équipe amont, backends .so chargés dynamiquement, archs GPU courantes, repli CPU fonctionnel). Le build complet passe de ~40 min à ~4 min et tous les pièges du build CUDA sans GPU (stubs libcuda, espace disque du runner, choix des architectures) disparaissent. - Dockerfile : 2 étapes (Go + image officielle), build-arg LLAMACPP_IMAGE pour épingler une version ou passer en CPU/Vulkan - entrypoint : BIN=/app/llama-server - workflow GHCR : purge disque et CUDA_ARCHS supprimés, cache max - compose/.env/README à l'avenant Validé : build 3 min 55, UI HTTP 200, healthcheck healthy, superviseur PID OK, llama-server démarre (repli CPU) et n'échoue que sur un modèle factice.
15 lines
587 B
Bash
15 lines
587 B
Bash
# ── Loki — configuration du build/run Docker ────────────────────────────
|
|
# (fork d'AJEAN : https://github.com/nathaninline/ajean)
|
|
|
|
# Port de l'interface web (identique dedans/dehors).
|
|
LOKI_WEB_PORT=8090
|
|
|
|
# Optionnel — semé au PREMIER démarrage seulement (modifiable ensuite dans
|
|
# l'UI, qui garde la main) :
|
|
# Modèle initial : nom d'un .gguf présent dans ./models ou chemin complet.
|
|
LOKI_MODEL=
|
|
# Taille de contexte (défaut moteur : 32768)
|
|
LOKI_CTX=
|
|
# Couches déportées sur le GPU (défaut : 999 = tout)
|
|
LOKI_NGL=
|