mirror of
https://github.com/R0m1k3/Loki.git
synced 2026-10-11 17:26:57 +02:00
Évite le rechargement lent quand Ollama a déchargé le modèle de la VRAM : - ollama_client.warm() : précharge un modèle (/api/generate sans prompt) ; chat() accepte keep_alive (durée de rétention en VRAM). - agent.run_agent transmet keep_alive ; route chat le passe depuis la config. - config : champ keep_alive (défaut 30m) par profil de modèle. - routes/models : POST /api/models/warm, GET /api/models/loaded (placement GPU/CPU via /api/ps). - main : préchargement du modèle par défaut au démarrage (arrière-plan, best-effort — n'empêche pas le démarrage si Ollama est absent). - Frontend : préchargement automatique à la sélection d'un modèle, poll des modèles chargés (8s), pastille verte (GPU) / orange (CPU) / blanche (à charger) dans le sélecteur, réglage 'Maintien en VRAM' dans Configuration. Tests : warm/loaded routes, keep_alive transmis, démarrage résilient sans Ollama, build front. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SVay7z3y7q2gEe54ByAE6N
95 lines
2.9 KiB
Python
95 lines
2.9 KiB
Python
"""Point d'entrée FastAPI de Loki.
|
|
|
|
Sert l'API (/api/*) et, en production, le frontend React compilé (static/).
|
|
"""
|
|
from __future__ import annotations
|
|
|
|
import os
|
|
from contextlib import asynccontextmanager
|
|
|
|
from fastapi import FastAPI
|
|
from fastapi.middleware.cors import CORSMiddleware
|
|
from fastapi.responses import FileResponse
|
|
from fastapi.staticfiles import StaticFiles
|
|
|
|
from . import agent_config, coder, db, rag
|
|
from .config import settings
|
|
from .routes import benchmark, chat, config, files, models, sessions, shell, system
|
|
|
|
|
|
async def _warm_default_model() -> None:
|
|
"""Précharge le modèle par défaut en VRAM au démarrage (best-effort)."""
|
|
import asyncio
|
|
import logging
|
|
|
|
from .ollama_client import OllamaError, ollama
|
|
|
|
await asyncio.sleep(2) # laisse le service démarrer
|
|
try:
|
|
cfg = agent_config.get_config(settings.default_model)
|
|
await ollama.warm(settings.default_model, cfg.get("keep_alive", "30m"))
|
|
logging.getLogger(__name__).info(
|
|
"Modèle %s préchargé en VRAM", settings.default_model
|
|
)
|
|
except (OllamaError, OSError, Exception) as exc: # best-effort
|
|
logging.getLogger(__name__).info(
|
|
"Préchargement au démarrage ignoré : %s", exc
|
|
)
|
|
|
|
|
|
@asynccontextmanager
|
|
async def lifespan(_: FastAPI):
|
|
import asyncio
|
|
|
|
db.init_db()
|
|
rag.init_table()
|
|
# Workspace en dépôt git : requis pour les commits du moteur code (Aider).
|
|
coder.ensure_git(settings.workspace_dir)
|
|
# Préchargement du modèle par défaut, sans bloquer le démarrage.
|
|
asyncio.create_task(_warm_default_model())
|
|
yield
|
|
|
|
|
|
app = FastAPI(
|
|
title="Loki", description="Agent IA local sur Ollama", lifespan=lifespan
|
|
)
|
|
|
|
# En dev, le front tourne sur Vite (5173). On autorise le CORS large ;
|
|
# en prod le front est servi par le même origin, donc sans impact.
|
|
app.add_middleware(
|
|
CORSMiddleware,
|
|
allow_origins=["*"],
|
|
allow_methods=["*"],
|
|
allow_headers=["*"],
|
|
)
|
|
|
|
app.include_router(models.router)
|
|
app.include_router(sessions.router)
|
|
app.include_router(chat.router)
|
|
app.include_router(files.router)
|
|
app.include_router(config.router)
|
|
app.include_router(shell.router)
|
|
app.include_router(system.router)
|
|
app.include_router(benchmark.router)
|
|
|
|
|
|
@app.get("/api/health")
|
|
async def health() -> dict:
|
|
return {"status": "ok", "service": "loki"}
|
|
|
|
|
|
# ── Service du frontend compilé (présent uniquement en image Docker) ─────
|
|
_STATIC_DIR = os.path.join(os.path.dirname(__file__), "..", "static")
|
|
if os.path.isdir(_STATIC_DIR):
|
|
app.mount(
|
|
"/assets",
|
|
StaticFiles(directory=os.path.join(_STATIC_DIR, "assets")),
|
|
name="assets",
|
|
)
|
|
|
|
@app.get("/{full_path:path}")
|
|
async def spa_fallback(full_path: str):
|
|
"""Renvoie index.html pour toutes les routes (SPA React)."""
|
|
index = os.path.join(_STATIC_DIR, "index.html")
|
|
return FileResponse(index)
|