mirror of
https://github.com/R0m1k3/Loki.git
synced 2026-10-11 17:26:57 +02:00
Recherche : un modèle plus gros que la VRAM (ex. qwen3.6:35b-a3b ~20 Go sur 16 Go) déborde sur le CPU et charge lentement ; et le préchargement chargeait un runner aux options par défaut, aussitôt rechargé par le 1er message avec un num_ctx différent — double chargement d'un gros modèle. - ollama_client.warm : accepte et transmet les options de génération. - routes/models : start_model_warm calcule les options depuis la config du modèle (ollama_options) et les passe au warm -> runner identique au chat, plus de rechargement. Après chargement, détecte le placement via /api/ps (gpu/cpu/mixte + %) et l'expose dans l'état de warm. - Frontend : warmModel renvoie l'état ; si le modèle se charge sur CPU/mixte, message d'alerte clair (trop gros pour la VRAM, choisir plus petit/quant). Tests : options transmises au warm, placement 'mixte 65%' détecté, builds OK. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SVay7z3y7q2gEe54ByAE6N