Simplification radicale : moteur pris de l'image officielle llama.cpp

Plus aucune compilation CUDA : le runtime part de
ghcr.io/ggml-org/llama.cpp:server-cuda (llama-server précompilé et maintenu
par l'équipe amont, backends .so chargés dynamiquement, archs GPU courantes,
repli CPU fonctionnel). Le build complet passe de ~40 min à ~4 min et tous
les pièges du build CUDA sans GPU (stubs libcuda, espace disque du runner,
choix des architectures) disparaissent.

- Dockerfile : 2 étapes (Go + image officielle), build-arg LLAMACPP_IMAGE
  pour épingler une version ou passer en CPU/Vulkan
- entrypoint : BIN=/app/llama-server
- workflow GHCR : purge disque et CUDA_ARCHS supprimés, cache max
- compose/.env/README à l'avenant

Validé : build 3 min 55, UI HTTP 200, healthcheck healthy, superviseur PID
OK, llama-server démarre (repli CPU) et n'échoue que sur un modèle factice.
This commit is contained in:
Loki committed 2026-08-14 22:59:35 +00:00
1 parent 0846a70eb0
commit 1e232a7ff3
6 files changed
+49 -89

No files matched your search

+1 -15
View File
@@ -16,16 +16,6 @@ jobs:
- name: Checkout
uses: actions/checkout@v4
# L'étape llama.cpp CUDA a besoin de place : l'image devel pèse ~8 Go et
# un runner ubuntu-latest n'offre que ~14 Go libres. On purge ce qui est
# préinstallé et inutile ici (SDK Android, .NET, Haskell…).
- name: Libérer l'espace disque du runner
run: |
sudo rm -rf /usr/local/lib/android /usr/share/dotnet /opt/ghc \
/usr/local/.ghcup /opt/hostedtoolcache/CodeQL
sudo docker image prune -af
df -h /
- name: Setup Buildx
uses: docker/setup-buildx-action@v3
@@ -53,11 +43,7 @@ jobs:
push: true
build-args: |
LOKI_VERSION=${{ github.sha }}
CUDA_ARCHS=75;86;89
tags: ${{ steps.meta.outputs.tags }}
labels: ${{ steps.meta.outputs.labels }}
# Cache limité : les couches CUDA (plusieurs Go) satureraient le
# plafond de 10 Go du cache GitHub Actions — on ne cache que le mode
# min (couches finales), le gain principal restant le cache apt/go.
cache-from: type=gha
cache-to: type=gha,mode=min
cache-to: type=gha,mode=max