mirror of
https://github.com/R0m1k3/Loki.git
synced 2026-10-11 17:26:57 +02:00
Le build ne mourait plus, mais tournait encore après trente-sept minutes. Et il aurait produit un binaire inutilisable sur la moitié du matériel visé. Les GPU de la machine cible sont une RTX 5060 Ti (Blackwell, sm_120) et une RTX 3060 (Ampere, sm_86). L'étape de compilation était épinglée sur nvidia/cuda:12.4.1 : ce nvcc-là ne CONNAÎT pas Blackwell. Il refuse l'architecture, et le binaire ne tournerait au mieux que par recompilation PTX au chargement. 12.8.1 sur Ubuntu 24.04 est désormais utilisé — exactement ce avec quoi llama.cpp bâtit l'image amont qui fournit libcudart. Pour la durée, deux causes distinctes : - Sans borne, ggml compile pour TOUTES les architectures qu'il connaît, de Maxwell à Blackwell. CMAKE_CUDA_ARCHITECTURES ramène le travail à quatre (Turing → Blackwell), et l'ARG CUDA_ARCHS permet d'élargir sans toucher au fichier pour un GPU plus ancien. - Surtout : ce binaire ne dépend d'AUCUN fichier du dépôt, et il était pourtant recompilé à chaque push. Le cache de couches GitHub Actions le réutilise tant que ses lignes du Dockerfile ne bougent pas ; seuls le code Go et l'assemblage de l'image se refont. Un test vérifie le plancher CUDA et la présence de la borne d'architectures : ces deux fautes ne se voient pas à la lecture et coûtent quarante minutes à découvrir. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01W3ewMAsXhkw9RY11kb9Dc9
68 lines
2.1 KiB
YAML
68 lines
2.1 KiB
YAML
name: Publier l'image Docker (GHCR)
|
|
|
|
on:
|
|
push:
|
|
branches: [main]
|
|
workflow_dispatch:
|
|
|
|
permissions:
|
|
contents: read
|
|
packages: write
|
|
|
|
jobs:
|
|
build-push:
|
|
runs-on: ubuntu-latest
|
|
steps:
|
|
- name: Checkout
|
|
uses: actions/checkout@v4
|
|
|
|
# Depuis que l'image compile whisper.cpp avec CUDA, le build empile
|
|
# nvidia/cuda:*-devel (~6 Go), l'image runtime CUDA de llama.cpp (~4 Go)
|
|
# et Chromium/Playwright (~1 Go) — pour ~14 Go libres sur un runner neuf.
|
|
# Ces trois répertoires ne servent à rien ici et rendent une dizaine de
|
|
# gigaoctets en moins d'une minute.
|
|
- name: Libérer de l'espace disque
|
|
run: |
|
|
df -h /
|
|
sudo rm -rf /usr/share/dotnet /usr/local/lib/android /opt/ghc
|
|
df -h /
|
|
|
|
- name: Setup Buildx
|
|
uses: docker/setup-buildx-action@v3
|
|
|
|
- name: Connexion à GHCR
|
|
uses: docker/login-action@v3
|
|
with:
|
|
registry: ghcr.io
|
|
username: ${{ github.actor }}
|
|
password: ${{ secrets.GITHUB_TOKEN }}
|
|
|
|
- name: Métadonnées (tags / labels)
|
|
id: meta
|
|
uses: docker/metadata-action@v5
|
|
with:
|
|
images: ghcr.io/${{ github.repository }}
|
|
tags: |
|
|
type=raw,value=latest
|
|
type=sha,format=short
|
|
|
|
- name: Build & push
|
|
uses: docker/build-push-action@v6
|
|
with:
|
|
context: .
|
|
platforms: linux/amd64
|
|
push: true
|
|
build-args: |
|
|
LOKI_VERSION=${{ github.sha }}
|
|
# Sans cache, chaque push recompilait whisper.cpp avec CUDA — une
|
|
# quarantaine de minutes — alors que ce binaire ne dépend d'AUCUN
|
|
# fichier du dépôt. Les étapes whisperbuild-* sont désormais réutilisées
|
|
# tant que leurs lignes du Dockerfile ne bougent pas ; seul le code Go
|
|
# et l'assemblage de l'image se refont.
|
|
cache-from: type=gha
|
|
cache-to: type=gha,mode=max
|
|
tags: ${{ steps.meta.outputs.tags }}
|
|
labels: ${{ steps.meta.outputs.labels }}
|
|
cache-from: type=gha
|
|
cache-to: type=gha,mode=max
|