mirror of
https://github.com/R0m1k3/Loki.git
synced 2026-10-12 01:37:06 +02:00
Le build ne mourait plus, mais tournait encore après trente-sept minutes. Et il aurait produit un binaire inutilisable sur la moitié du matériel visé. Les GPU de la machine cible sont une RTX 5060 Ti (Blackwell, sm_120) et une RTX 3060 (Ampere, sm_86). L'étape de compilation était épinglée sur nvidia/cuda:12.4.1 : ce nvcc-là ne CONNAÎT pas Blackwell. Il refuse l'architecture, et le binaire ne tournerait au mieux que par recompilation PTX au chargement. 12.8.1 sur Ubuntu 24.04 est désormais utilisé — exactement ce avec quoi llama.cpp bâtit l'image amont qui fournit libcudart. Pour la durée, deux causes distinctes : - Sans borne, ggml compile pour TOUTES les architectures qu'il connaît, de Maxwell à Blackwell. CMAKE_CUDA_ARCHITECTURES ramène le travail à quatre (Turing → Blackwell), et l'ARG CUDA_ARCHS permet d'élargir sans toucher au fichier pour un GPU plus ancien. - Surtout : ce binaire ne dépend d'AUCUN fichier du dépôt, et il était pourtant recompilé à chaque push. Le cache de couches GitHub Actions le réutilise tant que ses lignes du Dockerfile ne bougent pas ; seuls le code Go et l'assemblage de l'image se refont. Un test vérifie le plancher CUDA et la présence de la borne d'architectures : ces deux fautes ne se voient pas à la lecture et coûtent quarante minutes à découvrir. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01W3ewMAsXhkw9RY11kb9Dc9