mirror of
https://github.com/R0m1k3/Loki.git
synced 2026-10-11 17:26:57 +02:00
Simplification radicale : moteur pris de l'image officielle llama.cpp
Plus aucune compilation CUDA : le runtime part de ghcr.io/ggml-org/llama.cpp:server-cuda (llama-server précompilé et maintenu par l'équipe amont, backends .so chargés dynamiquement, archs GPU courantes, repli CPU fonctionnel). Le build complet passe de ~40 min à ~4 min et tous les pièges du build CUDA sans GPU (stubs libcuda, espace disque du runner, choix des architectures) disparaissent. - Dockerfile : 2 étapes (Go + image officielle), build-arg LLAMACPP_IMAGE pour épingler une version ou passer en CPU/Vulkan - entrypoint : BIN=/app/llama-server - workflow GHCR : purge disque et CUDA_ARCHS supprimés, cache max - compose/.env/README à l'avenant Validé : build 3 min 55, UI HTTP 200, healthcheck healthy, superviseur PID OK, llama-server démarre (repli CPU) et n'échoue que sur un modèle factice.
This commit is contained in:
6 files changed
+49
-89
No files matched your search
+4
-5
@@ -2,7 +2,8 @@
|
||||
# Un seul service : le conteneur embarque le moteur llama.cpp (CUDA) ET l'UI.
|
||||
#
|
||||
# cp .env.example .env # ajuste si besoin
|
||||
# docker compose up --build # build local (30-45 min : compilation CUDA)
|
||||
# docker compose up --build # build local en quelques minutes (llama-server
|
||||
# # vient précompilé de l'image officielle llama.cpp)
|
||||
#
|
||||
# Interface : http://localhost:8090
|
||||
# Pré-requis GPU : NVIDIA Container Toolkit sur l'hôte.
|
||||
@@ -10,10 +11,8 @@ services:
|
||||
loki:
|
||||
build:
|
||||
context: .
|
||||
args:
|
||||
# Restreins à ta carte pour un build plus court : 75=Turing (GTX 16xx/RTX 20xx),
|
||||
# 86=Ampere (RTX 30xx), 89=Ada (RTX 40xx).
|
||||
CUDA_ARCHS: ${CUDA_ARCHS:-75;86;89}
|
||||
# Pour épingler la version du moteur ou passer en CPU/Vulkan :
|
||||
# args: { LLAMACPP_IMAGE: "ghcr.io/ggml-org/llama.cpp:server-cuda-b10423" }
|
||||
container_name: loki
|
||||
ports:
|
||||
- "${LOKI_WEB_PORT:-8090}:${LOKI_WEB_PORT:-8090}"
|
||||
|
||||
Reference in new issue
Block a user