mirror of
https://github.com/R0m1k3/Loki.git
synced 2026-10-11 17:26:57 +02:00
Plus aucune compilation CUDA : le runtime part de ghcr.io/ggml-org/llama.cpp:server-cuda (llama-server précompilé et maintenu par l'équipe amont, backends .so chargés dynamiquement, archs GPU courantes, repli CPU fonctionnel). Le build complet passe de ~40 min à ~4 min et tous les pièges du build CUDA sans GPU (stubs libcuda, espace disque du runner, choix des architectures) disparaissent. - Dockerfile : 2 étapes (Go + image officielle), build-arg LLAMACPP_IMAGE pour épingler une version ou passer en CPU/Vulkan - entrypoint : BIN=/app/llama-server - workflow GHCR : purge disque et CUDA_ARCHS supprimés, cache max - compose/.env/README à l'avenant Validé : build 3 min 55, UI HTTP 200, healthcheck healthy, superviseur PID OK, llama-server démarre (repli CPU) et n'échoue que sur un modèle factice.
38 lines
1.4 KiB
YAML
38 lines
1.4 KiB
YAML
# Loki — fork conteneurisé d'AJEAN (https://github.com/nathaninline/ajean, MIT)
|
|
# Un seul service : le conteneur embarque le moteur llama.cpp (CUDA) ET l'UI.
|
|
#
|
|
# cp .env.example .env # ajuste si besoin
|
|
# docker compose up --build # build local en quelques minutes (llama-server
|
|
# # vient précompilé de l'image officielle llama.cpp)
|
|
#
|
|
# Interface : http://localhost:8090
|
|
# Pré-requis GPU : NVIDIA Container Toolkit sur l'hôte.
|
|
services:
|
|
loki:
|
|
build:
|
|
context: .
|
|
# Pour épingler la version du moteur ou passer en CPU/Vulkan :
|
|
# args: { LLAMACPP_IMAGE: "ghcr.io/ggml-org/llama.cpp:server-cuda-b10423" }
|
|
container_name: loki
|
|
ports:
|
|
- "${LOKI_WEB_PORT:-8090}:${LOKI_WEB_PORT:-8090}"
|
|
environment:
|
|
- LOKI_WEB_PORT=${LOKI_WEB_PORT:-8090}
|
|
# Semé UNE fois au premier démarrage (modifiable ensuite dans l'UI) :
|
|
- LOKI_MODEL=${LOKI_MODEL:-}
|
|
- LOKI_CTX=${LOKI_CTX:-}
|
|
- LOKI_NGL=${LOKI_NGL:-}
|
|
volumes:
|
|
# /data = LOKI_HOME : config, base bbolt, mémoire, workspace, modèles téléchargés
|
|
- ./data:/data
|
|
# /models : dossier(s) de modèles GGUF supplémentaires (LOKI_MODEL_DIRS)
|
|
- ./models:/models
|
|
deploy:
|
|
resources:
|
|
reservations:
|
|
devices:
|
|
- driver: nvidia
|
|
count: all
|
|
capabilities: ["gpu"]
|
|
restart: unless-stopped
|