mirror of
https://github.com/R0m1k3/Loki.git
synced 2026-10-11 17:26:57 +02:00
Les llama-server récents ouvrent 4 slots par défaut : des tampons de calcul GPU multipliés par quatre, pour un serveur qui ne sert qu'un utilisateur. Résultat vécu après une mise à jour du moteur : une config 27B qui tournait très bien meurt en « cudaMalloc failed: out of memory » en pleine génération, sans qu'aucun réglage n'ait changé. On repasse explicitement à un slot — le comportement historique — et PARALLEL=n reste disponible dans le preset pour qui veut du parallèle. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>