Files
Loki/internal/loki/llm_slots.go
T
MichaelandClaude Opus 5.5 2097c9f915 Compaction : COMPACT_CONTINUATION résume dans le prolongement du prompt en cache, en opt-in
Le résumé d'une compaction part aujourd'hui dans une requête à part — prompt
du résumeur et transcription des anciens tours — que le moteur local calcule à
froid : des dizaines de secondes sur un 27B, des minutes sur un MoE, à chaque
compaction. Nouvelle clé COMPACT_CONTINUATION (off par défaut) : quand le slot
porte encore le prompt de la discussion, la requête de résumé est celle du tour
telle qu'elle est partie, suivie d'une seule demande de résumé ; le moteur ne
calcule qu'elle. Sans la clé, requêtes de compaction identiques à l'octet près
(prompt du résumeur comparé à une copie figée, testé).

- vue MODÈLE pour tout ce qui est rangé : bornes, archives recall, demande
  réinjectée, garantie de réduction et sortie ne changent pas ; la vue
  d'envoi (turnViewDry, wireMessages, buildChatPayload) ne sert qu'à la
  requête, rien d'injecté n'entre dans l'historique (testé)
- frontière recalée sur la vue envoyée (messages non système un pour un,
  vérifiés rôle par rôle), désignée par le nombre de messages gardés et le
  début du premier ; tout résumer avant, dater l'avancement à la frontière
- mêmes règles de résumé (+ mode Code), même budget, température 0.2 sans
  l'échantillonnage du preset, enable_thinking=false ajouté aux arguments du
  tour, reasoning_effort du tour, tool_choice « none », sans flux
- messages utilisateur de fin hors de la vue : pas en cache, et pas deux
  `user` d'affilée pour les gabarits stricts
- slot vérifié : tampon posé par une étape de tour acceptée (llm_slots.go,
  sous le verrou du compteur en vol), perdu dès qu'une autre requête part —
  vérification, sous-agent, tâche, préchauffage, résumé, bench, /v1 — ou que
  le modèle ou la fenêtre changent ; relu à l'envoi
- marge en jetons réels (dernier compte + non vu + demande + budget + 5 %)
- repli sur la transcription au moindre écart : refus du moteur, réseau,
  appel d'outil émis (tool_calls décodés) ou écrit en texte, raisonnement
  seul, résumé vide ; refus du gabarit ou appel d'outil = suspendue pour le
  modèle jusqu'au redémarrage, deux échecs de suite aussi
- avec la clé : pas de résumé quand même un vide ne réduirait pas de 20 %
  (borne exacte, avant tout archivage) ; après un refus faute de réduction,
  pas de nouvel essai avant +10 % de contexte, jamais à 90 % de la fenêtre,
  oublié quand le contexte baisse
- réactif, fenêtre pleine, bouton manuel, tâches, sous-agents, terminal,
  preset externe : chemin d'avant ; télémétrie kind=compact avec la discussion

Co-Authored-By: Claude Opus 5.5 <noreply@anthropic.com>
2026-10-04 09:21:57 +02:00

356 lines
13 KiB
Go

package loki
import (
"context"
"encoding/json"
"fmt"
"io"
"net/http"
"os"
"path/filepath"
"regexp"
"strconv"
"strings"
"sync"
"sync/atomic"
"time"
)
// Isolation des travaux annexes dans le cache de prompts.
//
// llama-server tourne en --parallel 1 : un vérificateur, un sous-agent, une
// tâche planifiée ou un bench prennent LE slot de la conversation. Le moteur
// range alors l'état de la conversation dans son cache RAM (exact, octet pour
// octet) et le recharge quand elle revient — à condition qu'il y soit encore.
// Or, à la requête suivante, il sauve d'abord l'état du travail annexe, et pour
// lui faire de la place il évince les entrées les plus anciennes : souvent
// justement la conversation, qui est alors recalculée en entier.
//
// Effacer le slot une fois le travail annexe TERMINÉ (pas entre ses étapes)
// règle ça : un slot vide n'est pas sauvé, et la conversation est rechargée
// depuis la RAM. On ne jette qu'un état qui ne resservirait pas — rien de ce
// que voit le modèle ne change.
//
// Mais un effacement est différé par le moteur tant que le slot travaille, et
// s'exécute ensuite sur ce qui s'y trouve alors : il faut donc être SÛR que le
// slot est à nous. D'où les garde-fous, tous nécessaires :
// - moteur local (jamais une API externe) ;
// - build vanilla ≥ 8660 : avant (PR #20993), un slot vide ne rechargeait pas
// depuis le cache, et effacer aurait forcé un recalcul complet. Build
// inconnu ou fork : on s'abstient ;
// - un seul slot (/props total_slots, pas la clé PARALLEL qu'EXTRA_ARGS peut
// contredire) ;
// - le travail annexe a bien été servi par le moteur : sinon le slot porte
// encore la conversation (erreur avant l'envoi, refus, arrêt immédiat) ;
// - aucune requête de Loki en vol vers le moteur (compteur ci-dessous, tenu
// par le chat, les résumés, le bench et les proxys /v1), et le slot 0 au
// repos d'après /slots ;
// - appel synchrone, borné à 2 s, sous le verrou du compteur : aucune
// requête de Loki ne peut partir entre la vérification et l'effacement.
// slotEraseMinBuild : premier build de llama.cpp qui recharge un slot vide
// depuis le cache de prompts (PR #20993, 50e0ad08fb).
const slotEraseMinBuild = 8660
// engineGate compte les requêtes de Loki en vol vers le moteur local.
// L'effacement prend le verrou pendant sa vérification et son appel : une
// nouvelle requête attend au plus ces deux secondes.
var engineGate struct {
mu sync.Mutex
inflight int
served uint64 // réponses 200 du moteur obtenues par runChat ou le bench
// seq numérote les requêtes de Loki vers le moteur local, préchauffage
// compris. main : la dernière, quand c'était une étape d'un tour de
// discussion acceptée par le moteur — le slot porte alors, selon toute
// vraisemblance, le prompt de cette discussion (COMPACT_CONTINUATION).
seq uint64
main engineMainStamp
}
// engineMainStamp : la requête d'un tour de discussion que le slot porte.
// Modèle et fenêtre en font partie : un moteur relancé sur un autre modèle ou
// une autre fenêtre a un slot vide.
type engineMainStamp struct {
seq uint64
conv, model string
window int
}
// engineMainNow : modèle et fenêtre du moteur, pour le tampon.
func engineMainNow() (model string, window int) {
return filepath.Base(strings.TrimSpace(ReadConfig()["MODEL"])), ctxWindow()
}
// engineMarkMain : la requête seq, étape d'un tour de la discussion conv, a été
// acceptée par le moteur. Sans effet si une autre requête est partie depuis.
func engineMarkMain(seq uint64, conv string) {
if conv == "" {
return
}
model, window := engineMainNow()
engineGate.mu.Lock()
defer engineGate.mu.Unlock()
if engineGate.seq == seq {
engineGate.main = engineMainStamp{seq: seq, conv: conv, model: model, window: window}
}
}
// engineSlotHolds : le slot porte-t-il plausiblement le prompt de conv ? Oui si
// la dernière requête de Loki vers le moteur était une étape d'un de ses tours,
// acceptée, sur le même modèle et la même fenêtre. Un vérificateur, un
// sous-agent, une tâche, un préchauffage, un résumé, un bench, un client /v1 ou
// une autre discussion passés depuis : non. Un client qui parlerait au moteur
// sans passer par Loki échappe à ce compte — au pire, un recalcul.
func engineSlotHolds(conv string) bool {
if conv == "" {
return false
}
model, window := engineMainNow()
engineGate.mu.Lock()
defer engineGate.mu.Unlock()
m := engineGate.main
return m.seq != 0 && m.seq == engineGate.seq && m.conv == conv && m.model == model && m.window == window
}
// engineServed note qu'une requête de Loki a été acceptée par le moteur local :
// le slot porte désormais SON état. Un travail annexe qui n'en a obtenu aucune
// (erreur avant l'envoi, moteur qui refuse, arrêt immédiat) n'a pas pris le
// slot — il porte encore la conversation, et l'effacer la ferait recalculer.
func engineServed() {
engineGate.mu.Lock()
engineGate.served++
engineGate.mu.Unlock()
}
func engineServedCount() uint64 {
engineGate.mu.Lock()
defer engineGate.mu.Unlock()
return engineGate.served
}
// sideJobs : travaux annexes en cours. Leurs prompts ne sont pas ceux de la
// conversation : noteEnginePrompt ne les retient ni ne les compare.
var sideJobs atomic.Int32
// engineRequestStart marque une requête vers le moteur local ; la fonction
// rendue la clôt (une seule fois, quel que soit le nombre d'appels), une fois
// le corps de la réponse lu. Un préchauffage en vol (PREWARM, chat_prewarm.go)
// est annulé d'abord : il ne passe jamais devant un vrai travail.
func engineRequestStart() func() { return engineRequestStartKeep(nil) }
// engineRequestStartKeep : engineRequestStart, sauf pour le préchauffage en vol
// que keep reconnaît comme le début exact de cette requête — il continue, et la
// requête le suit dans le même slot sur le préfixe qu'il vient de calculer.
// Décidé sous le verrou du compteur : aucun préchauffage ne peut démarrer entre
// la décision et le compte.
func engineRequestStartKeep(keep func(*prewarmRun) bool) func() {
end, _ := engineRequestBegin(keep)
return end
}
// engineRequestBegin : engineRequestStartKeep, avec le numéro de la requête
// (engineMarkMain).
func engineRequestBegin(keep func(*prewarmRun) bool) (func(), uint64) {
engineGate.mu.Lock()
if p := prewarmCur; p != nil && (keep == nil || !keep(p)) {
prewarmDropLocked(p)
}
engineGate.inflight++
engineGate.seq++
seq := engineGate.seq
engineGate.mu.Unlock()
var once sync.Once
return func() {
once.Do(func() {
engineGate.mu.Lock()
engineGate.inflight--
engineGate.mu.Unlock()
})
}, seq
}
// slotsWrite : une action sur /slots (save, restore, erase) plutôt qu'une
// lecture. Les proxys de Loki la refusent : seul Loki, en local, efface — et
// save ou restore écriraient des Gio sur le disque pour un client distant.
func slotsWrite(r *http.Request) bool {
return strings.HasPrefix(r.URL.Path, "/slots") && r.Method != http.MethodGet && r.Method != http.MethodHead
}
// slotIsolator parle au moteur local ; séparé pour les tests.
type slotIsolator struct {
base string // http://localhost:<port>
auth func(set func(k, v string))
client *http.Client
}
var reBuildInfo = regexp.MustCompile(`^b(\d+)`)
// get lit un JSON du moteur, borné à 2 s.
func (s slotIsolator) get(ctx context.Context, path string, out any) error {
ctx, cancel := context.WithTimeout(ctx, 2*time.Second)
defer cancel()
req, err := http.NewRequestWithContext(ctx, http.MethodGet, s.base+path, nil)
if err != nil {
return err
}
s.auth(req.Header.Set)
resp, err := s.client.Do(req)
if err != nil {
return err
}
defer resp.Body.Close()
if resp.StatusCode != http.StatusOK {
return fmt.Errorf("GET %s : %s", path, resp.Status)
}
return json.NewDecoder(io.LimitReader(resp.Body, 1<<20)).Decode(out)
}
// eraseIfIdle efface le slot 0 si, et seulement si, tous les garde-fous
// passent. erased=false sans erreur : on s'est abstenu, sans dommage.
func (s slotIsolator) eraseIfIdle(ctx context.Context) (erased bool, err error) {
var props struct {
BuildInfo string `json:"build_info"`
TotalSlots int `json:"total_slots"`
}
if err := s.get(ctx, "/props", &props); err != nil {
return false, err
}
build := 0
if m := reBuildInfo.FindStringSubmatch(props.BuildInfo); m != nil {
build, _ = strconv.Atoi(m[1])
}
if build < slotEraseMinBuild || props.TotalSlots != 1 {
return false, nil
}
engineGate.mu.Lock()
defer engineGate.mu.Unlock()
if engineGate.inflight > 0 {
return false, nil
}
var slots []struct {
ID int `json:"id"`
IsProcessing bool `json:"is_processing"`
}
if err := s.get(ctx, "/slots", &slots); err != nil {
return false, err
}
for _, sl := range slots {
if sl.ID == 0 && sl.IsProcessing {
return false, nil
}
}
ctx, cancel := context.WithTimeout(ctx, 2*time.Second)
defer cancel()
req, err := http.NewRequestWithContext(ctx, http.MethodPost, s.base+"/slots/0?action=erase", nil)
if err != nil {
return false, err
}
s.auth(req.Header.Set)
resp, err := s.client.Do(req)
if err != nil {
return false, err
}
defer resp.Body.Close()
if resp.StatusCode != http.StatusOK {
b, _ := io.ReadAll(io.LimitReader(resp.Body, 300))
return false, fmt.Errorf("effacement du slot : %s %s", resp.Status, strings.TrimSpace(string(b)))
}
return true, nil
}
var slotEraseLogOnce sync.Once
// engineSideJob encadre un travail annexe (sous-agent, vérification, tâche,
// bench) : à appeler AVANT, et la fonction rendue APRÈS — d'habitude
// « defer engineSideJob()() ». Elle efface le slot si c'est sans risque, et
// arme la vérification du cache sur la requête suivante (noteEnginePrompt).
func engineSideJob() func() {
before, servedAt := lastEnginePrompt.Load(), engineServedCount()
sideJobs.Add(1)
return func() {
sideJobs.Add(-1)
finishSideJob(before, servedAt, eraseLocalSlot)
}
}
// finishSideJob : la fin d'un travail annexe, séparée de ses appels au moteur
// pour les tests. Rien n'est effacé si le moteur n'a servi aucune requête de
// Loki depuis le début du travail : le slot porte alors toujours la
// conversation (ou l'état d'un client qu'on ne connaît pas).
func finishSideJob(before int64, servedAt uint64, erase func() (bool, error)) {
if engineServedCount() == servedAt {
return
}
erased, err := erase()
if err != nil {
// Moteur sans --slot-save-path (501), ou /slots coupé : l'erreur est
// sans conséquence et se répéterait à chaque travail annexe.
slotEraseLogOnce.Do(func() {
fmt.Fprintf(os.Stderr, "[cache] isolation des travaux annexes indisponible : %v\n", err)
})
}
if erased && before > 0 {
slotHintPending.Store(before)
}
}
// eraseLocalSlot efface le slot 0 du moteur local si le preset actif s'y prête
// et que tous les garde-fous d'eraseIfIdle passent.
func eraseLocalSlot() (bool, error) {
ep := resolveChatEndpoint()
if ep.External {
return false, nil
}
cfg := ReadConfig()
argEnv := map[string]string{}
for _, k := range cacheArgEnv {
argEnv[k] = os.Getenv(k)
}
if !cacheIsolationOn(cfg) || cacheRAMOff(cfg, splitArgs(cfg["EXTRA_ARGS"]), argEnv) {
return false, nil
}
iso := slotIsolator{base: fmt.Sprintf("http://localhost:%d", LLMPort()), auth: ep.auth, client: http.DefaultClient}
return iso.eraseIfIdle(context.Background())
}
// Vérification du cache après un effacement. Le moteur dit, dans l'usage de
// chaque réponse, combien de jetons du prompt il a repris du cache
// (prompt_tokens_details.cached_tokens). Si la conversation revient après un
// travail annexe avec bien moins que ce qu'elle avait, son état n'a pas tenu
// dans le cache RAM : c'est CACHE_RAM qu'il faut relever.
var (
lastEnginePrompt atomic.Int64 // prompt_tokens de la dernière réponse locale
slotHintPending atomic.Int64 // prompt d'avant le travail annexe effacé ; 0 = rien à vérifier
slotHintShown atomic.Bool // le conseil n'apparaît qu'une fois par lancement
)
// slotHintMinTokens : en dessous, un recalcul coûte trop peu pour en parler.
const slotHintMinTokens = 4096
// noteEnginePrompt enregistre l'usage d'une réponse du moteur local et rend le
// conseil à afficher, s'il y a lieu (une seule fois par lancement ; le journal,
// lui, le note à chaque fois).
func noteEnginePrompt(total, cached int, hasCached bool) string {
// Prompt d'un travail annexe : ni la conversation à comparer, ni la taille
// à retenir pour le prochain (deux vérifications de suite, par exemple).
if sideJobs.Load() > 0 {
return ""
}
if total > 0 {
lastEnginePrompt.Store(int64(total))
}
before := slotHintPending.Swap(0)
// Un prompt plus court que celui d'avant n'est pas la suite de la même
// conversation (nouvelle discussion, autre tâche) : rien à comparer.
if !hasCached || before < slotHintMinTokens || int64(total) < before || int64(cached) >= before/2 {
return ""
}
fmt.Fprintf(os.Stderr, "[cache] conversation recalculée après un travail annexe : %d jetons repris du cache sur %d\n",
cached, before)
if slotHintShown.Swap(true) {
return ""
}
return fmt.Sprintf("Conversation recalculée après un travail annexe (%d jetons repris du cache sur %d) : "+
"le cache de prompts en RAM est trop petit — augmente CACHE_RAM dans le preset.", cached, before)
}