mirror of
https://github.com/R0m1k3/Loki.git
synced 2026-10-11 17:26:57 +02:00
Trois apports repérés chez AJEAN (v0.13.8) et OpenFox (2.0.118), portés et adaptés à Loki. ## Reprise réseau du tour (llm_retry_net.go) La requête de complétion partait une fois : un Do() qui échoue ou un statut d'erreur tuait le tour. Les messages d'erreur le disaient eux-mêmes — « réessaie dans quelques secondes » — autrement dit on demandait à l'utilisateur de refaire à la main ce que le code pouvait faire seul. Une tâche planifiée tombée pendant un redémarrage du moteur échouait pour de bon, sans personne pour recliquer. Trois reprises consécutives, 0,8 → 1,6 → 3,2 s, plafonnées, interruptibles par un /stop. La règle de sûreté ne souffre pas d'exception : on ne rejoue que TANT QU'AUCUN OCTET N'A ÉTÉ DIFFUSÉ, sinon la moitié de la réponse déjà chez l'utilisateur serait dupliquée. Le compteur repart à zéro dès qu'une réponse arrive. 500 n'est pas un statut de reprise : c'est ce que llama.cpp rend pour un appel d'outil malformé ou un prompt trop long, deux échecs déterministes que les filets sémantiques traitent déjà. Restent les codes qui disent « pas maintenant » : 429, 502, 503, 504. ## Presets externes (backend_external.go, web_external.go) Un preset avec EXTERNAL=1 route le chat vers une API OpenAI-compatible distante (OpenAI, Groq, OpenRouter, un vLLM sur une autre machine) au lieu du llama-server local. C'est un preset COMME UN AUTRE : même liste, même bascule, même prompt système par preset. La différence ne vit qu'à deux endroits — l'inférence (resolveChatEndpoint) et la bascule, qui arrête le moteur local au lieu de le redémarrer. La clé du serveur local ne part jamais chez un tiers : chaque endpoint porte la sienne. La clé du preset n'est jamais renvoyée en clair à l'interface, et un champ vide ne l'efface pas — il faut y avoir touché. Une fenêtre dédiée plutôt que l'éditeur habituel : un modèle distant n'a ni quantification, ni couches GPU, ni moteur. Un bouton teste la connexion avant d'enregistrer, et rend le message de l'API plutôt que le JSON brut. Le résumé de compactage part au même endroit que le chat : le laisser taper le moteur local aurait cassé toute compaction sur un preset externe. ## see_image (chat_vision_tool.go) Loki savait voir une pièce jointe et une capture qu'il venait de prendre, mais pas un fichier qui dort sur le disque : « regarde ~/photos/bug.png » n'avait aucune réponse, `read` rendant des octets binaires. L'outil charge l'image et la réinjecte dans un message utilisateur multimodal — même chemin que les pièces jointes. Même règle ÉPHÉMÈRE que les captures (et non celle de l'amont, qui persiste l'image) : l'image va dans le tour en cours, pas dans l'historique. Un base64 persisté repartirait à chaque tour et finirait par dépasser la fenêtre pour de bon. Le marqueur de perte à la compaction existait déjà mais n'offrait qu'un recours, « reprends la capture » — ce qui enverrait photographier une page web alors que l'image perdue est un PNG du disque. Formulation généralisée. ## Au passage toolCallLabel est extrait de runChat. Cette table nom d'outil → argument a une double fonction — libellé affiché ET argument principal — donc un outil absent s'exécute sur une chaîne vide : see_image répondait « chemin de fichier manquant » quoi qu'on lui passe, sans que rien d'autre ne bronche. Une table pareille se teste. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_0129sffVC43rezAXUMQuzUog
120 lines
4.5 KiB
Go
120 lines
4.5 KiB
Go
package loki
|
|
|
|
// backend_external.go — presets « externes » : au lieu de lancer un llama-server
|
|
// local, un tel preset route le chat vers une API OpenAI-compatible distante
|
|
// (OpenAI, Groq, OpenRouter, un autre Loki, un vLLM sur une autre machine…).
|
|
// Un preset externe se reconnaît à sa clé EXTERNAL=1 ; il porte l'URL, le nom du
|
|
// modèle et la clé d'accès.
|
|
//
|
|
// Choix d'archi, repris d'AJEAN : l'externe est un PRESET COMME UN AUTRE, un
|
|
// fichier .env dans presetsDir. Toute la mécanique existante s'applique sans
|
|
// rien changer — liste, nom d'affichage, empreinte d'activité, bascule, prompt
|
|
// système par preset, réglages d'échantillonnage. La différence ne vit qu'à
|
|
// DEUX endroits : au moment de l'inférence (resolveChatEndpoint) et au moment
|
|
// de la bascule (aucun moteur à redémarrer).
|
|
//
|
|
// Ce qui ne s'applique pas, et c'est voulu : un preset externe n'a ni MODEL, ni
|
|
// NGL, ni moteur. La machine distante décide de tout ça. CTX, en revanche,
|
|
// reste utile — c'est lui qui pilote la jauge de contexte et le seuil de
|
|
// compaction côté Loki.
|
|
|
|
import (
|
|
"fmt"
|
|
"strings"
|
|
)
|
|
|
|
const (
|
|
extKeyFlag = "EXTERNAL" // marqueur : "1" = preset externe
|
|
extKeyURL = "EXTERNAL_URL" // base ou URL complète des complétions
|
|
extKeyModel = "EXTERNAL_MODEL" // nom du modèle envoyé dans le payload
|
|
extKeyToken = "EXTERNAL_KEY" // clé API (Bearer), peut être vide
|
|
)
|
|
|
|
// chatEndpoint : où partent les appels /v1/chat/completions de ce tour.
|
|
type chatEndpoint struct {
|
|
URL string // URL complète des complétions
|
|
Model string // nom de modèle envoyé dans le payload
|
|
Key string // Bearer ("" = aucun)
|
|
External bool // true = API distante (pas le llama-server local)
|
|
}
|
|
|
|
// isExternalConfig indique si une configuration décrit un endpoint externe.
|
|
func isExternalConfig(cfg map[string]string) bool {
|
|
return strings.TrimSpace(cfg[extKeyFlag]) == "1"
|
|
}
|
|
|
|
// externalActive : le preset actif est-il un endpoint externe ?
|
|
func externalActive() bool { return isExternalConfig(ReadConfig()) }
|
|
|
|
// completionsURL normalise l'URL saisie en une URL de complétions complète.
|
|
// Accepte les trois formes qu'on colle en pratique :
|
|
//
|
|
// - une URL déjà complète (…/chat/completions) — laissée telle quelle ;
|
|
// - une base OpenAI (…/v1, …/openai/v1, …/api/v1) — on ajoute /chat/completions ;
|
|
// - autre chose — on suppose une racine et on ajoute /v1/chat/completions.
|
|
//
|
|
// Exiger la forme exacte serait une source d'échecs muets : la page d'un
|
|
// fournisseur donne tantôt « https://api.groq.com/openai/v1 », tantôt l'URL
|
|
// complète, et se tromper ne produit qu'un 404 illisible.
|
|
func completionsURL(raw string) string {
|
|
u := strings.TrimRight(strings.TrimSpace(raw), "/")
|
|
if u == "" {
|
|
return ""
|
|
}
|
|
if strings.HasSuffix(u, "/chat/completions") {
|
|
return u
|
|
}
|
|
if strings.HasSuffix(u, "/v1") {
|
|
return u + "/chat/completions"
|
|
}
|
|
return u + "/v1/chat/completions"
|
|
}
|
|
|
|
// resolveChatEndpoint décide où envoyer les complétions : l'API externe si le
|
|
// preset actif en est un, sinon le llama-server local.
|
|
func resolveChatEndpoint() chatEndpoint {
|
|
cfg := ReadConfig()
|
|
if isExternalConfig(cfg) {
|
|
return chatEndpoint{
|
|
URL: completionsURL(cfg[extKeyURL]),
|
|
Model: strings.TrimSpace(cfg[extKeyModel]),
|
|
Key: strings.TrimSpace(cfg[extKeyToken]),
|
|
External: true,
|
|
}
|
|
}
|
|
return chatEndpoint{
|
|
URL: fmt.Sprintf("http://localhost:%d/v1/chat/completions", LLMPort()),
|
|
Model: "loki",
|
|
Key: readAPIKey(),
|
|
}
|
|
}
|
|
|
|
// auth pose l'en-tête d'autorisation de CET endpoint. Indispensable de le tenir
|
|
// ici plutôt que d'appeler authHeader : celui-ci envoie la clé du serveur LOCAL,
|
|
// et l'expédier à api.openai.com serait fuiter un secret chez un tiers en même
|
|
// temps qu'un 401 garanti.
|
|
func (e chatEndpoint) auth(set func(k, v string)) {
|
|
if e.Key != "" {
|
|
set("Authorization", "Bearer "+e.Key)
|
|
}
|
|
}
|
|
|
|
// externalPresetContent construit le corps .env d'un preset externe (hors ligne
|
|
// « # NAME= », ajoutée par SavePreset). Une clé vide n'est pas écrite. `ctx` va
|
|
// dans la clé CTX standard — elle pilote la jauge de contexte et le seuil de
|
|
// compaction, exactement comme pour un preset local.
|
|
func externalPresetContent(url, model, key, ctx string) string {
|
|
m := map[string]string{
|
|
extKeyFlag: "1",
|
|
extKeyURL: strings.TrimSpace(url),
|
|
extKeyModel: strings.TrimSpace(model),
|
|
}
|
|
if k := strings.TrimSpace(key); k != "" {
|
|
m[extKeyToken] = k
|
|
}
|
|
if c := strings.TrimSpace(ctx); c != "" {
|
|
m["CTX"] = c
|
|
}
|
|
return formatEnv(m)
|
|
}
|