Merge branch 'claude/ajean-loki-container-fork-aep9r2'

This commit is contained in:
Claude committed 2026-08-15 11:11:41 +00:00
commit 7472de0a41
4 files changed
+15 -6

No files matched your search

+10 -1
View File
@@ -101,7 +101,6 @@ func cmdServe(args []string) error {
llmArgs := []string{bin,
"-m", model,
"-ngl", get("NGL", "999"),
"-c", get("CTX", "32768"),
"-t", get("THREADS", "0"),
"-tb", get("THREADS_BATCH", "0"),
@@ -110,6 +109,16 @@ func cmdServe(args []string) error {
"--host", get("HOST", "0.0.0.0"),
"--port", get("PORT", "8080"),
}
// NGL=auto : on n'envoie PAS -ngl, et llama.cpp choisit lui-même combien de
// couches tiennent dans la VRAM libre (common_fit_params). Il s'en abstient
// dès que la valeur est imposée — « n_gpu_layers already set by user to 999,
// abort » — d'où des cudaMalloc en échec, un repli partiel sur le CPU et un
// débit effondré alors que le GPU tourne à 100 %.
// Le défaut reste 999 (tout sur le GPU) : omettre -ngl sur un llama.cpp
// antérieur à cet ajustement automatique le ferait tourner 100 % CPU.
if ngl := get("NGL", "999"); !strings.EqualFold(ngl, "auto") {
llmArgs = append(llmArgs, "-ngl", ngl)
}
if ktv != "" {
llmArgs = append(llmArgs, "-ctk", ktv)
}
+1 -1
View File
@@ -67,7 +67,7 @@ var configTemplate = []struct{ key, help string }{
{"HOST", "adresse d'écoute du moteur (défaut 0.0.0.0)"},
{"PORT", "port du moteur (défaut 8080)"},
{"CTX", "taille du contexte (défaut 32768)"},
{"NGL", "couches déportées sur le GPU (défaut 999 = tout)"},
{"NGL", "couches déportées sur le GPU (défaut 999 = tout ; auto = ce qui tient en VRAM)"},
{"BATCH", "batch (défaut 2048)"},
{"UBATCH", "micro-batch (défaut 512)"},
{"THREADS", "threads CPU, 0 = auto"},
+2 -2
View File
@@ -1902,8 +1902,8 @@ button:hover{border-color:var(--dim);color:var(--text)}
<span class="pe-row-c"><input id="s-ctx" class="pe-val" type="number" min="0" step="1024" placeholder="32768" oninput="cfgWriteKey('CTX', this.value)"><span class="pe-unit">tok</span></span>
</div>
<div class="pe-row">
<span class="pe-row-l">Couches sur GPU<span class="pe-sub">999 = tout sur le GPU</span></span>
<span class="pe-row-c"><input id="s-ngl" class="pe-val" type="number" min="0" step="1" placeholder="999" oninput="cfgWriteKey('NGL', this.value)"></span>
<span class="pe-row-l">Couches sur GPU<span class="pe-sub">999 = tout sur le GPU · auto = ce qui tient en VRAM</span></span>
<span class="pe-row-c"><input id="s-ngl" class="pe-val" type="text" inputmode="numeric" placeholder="999" oninput="cfgWriteKey('NGL', this.value)"></span>
</div>
<div class="pe-row">
<span class="pe-row-l">Experts MoE sur CPU<span class="pe-sub">vide = non</span></span>
+2 -2
View File
@@ -720,8 +720,8 @@
<span class="pe-row-c"><input id="s-ctx" class="pe-val" type="number" min="0" step="1024" placeholder="32768" oninput="cfgWriteKey('CTX', this.value)"><span class="pe-unit">tok</span></span>
</div>
<div class="pe-row">
<span class="pe-row-l">Couches sur GPU<span class="pe-sub">999 = tout sur le GPU</span></span>
<span class="pe-row-c"><input id="s-ngl" class="pe-val" type="number" min="0" step="1" placeholder="999" oninput="cfgWriteKey('NGL', this.value)"></span>
<span class="pe-row-l">Couches sur GPU<span class="pe-sub">999 = tout sur le GPU · auto = ce qui tient en VRAM</span></span>
<span class="pe-row-c"><input id="s-ngl" class="pe-val" type="text" inputmode="numeric" placeholder="999" oninput="cfgWriteKey('NGL', this.value)"></span>
</div>
<div class="pe-row">
<span class="pe-row-l">Experts MoE sur CPU<span class="pe-sub">vide = non</span></span>