mirror of
https://github.com/R0m1k3/Loki.git
synced 2026-10-12 01:37:06 +02:00
La dictée marche depuis la PR #18 mais comprend mal et n'écrit qu'à l'arrêt du micro. La lenteur est structurelle : chaque requête relance whisper-cli, qui recharge le modèle depuis le disque. Découper en tranches par-dessus ce mécanisme reviendrait à recharger le modèle toutes les quelques secondes. La conception retient whisper-server (modèle chargé une fois, supervisé par Loki comme llama-server), un découpage en tranches calé sur les silences et piloté côté Go, et un panneau Dictée pour choisir GPU, modèle, langue et réactivité. Deux points tranchés en cours de route : - Deux binaires whisper-server, CPU et CUDA, pas un seul. LLAMACPP_IMAGE accepte la variante CPU de l'image amont ; sur cette base les .so CUDA sont absentes et un binaire lié à CUDA n'a même pas de quoi démarrer. Un binaire unique condamnerait cette variante. - Le seuil de silence est adaptatif. Un seuil fixe ne coupe jamais dans une pièce calme avec un micro discret, et coupe sans arrêt près d'un ventilateur. Les drapeaux GGML_NATIVE=OFF restent exigés sur les deux cibles : le SIGILL de la PR #18 ne doit pas revenir par la porte du build CUDA. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01W3ewMAsXhkw9RY11kb9Dc9