my_voice_assistant_v3/deploy/ollama-keepalive.conf

19 lines
885 B
Text
Raw Normal View History

# systemd-Drop-in fuer den Ollama-System-Dienst: Modelle nach Leerlauf entladen,
# damit die GPU automatisch frei wird (statt OLLAMA_KEEP_ALIVE=-1 = nie entladen).
#
# Installation (root noetig, betrifft den systemweiten ollama-Dienst):
# sudo mkdir -p /etc/systemd/system/ollama.service.d
# sudo cp deploy/ollama-keepalive.conf /etc/systemd/system/ollama.service.d/keepalive.conf
# sudo systemctl daemon-reload
# sudo systemctl restart ollama
# # Pruefen:
# systemctl show ollama -p Environment | tr ' ' '\n' | grep KEEP_ALIVE
#
# Wirkung: Ein geladenes Modell wird nach 5 Minuten Inaktivitaet aus dem VRAM
# entladen -> GPU 1 ist im Leerlauf wieder fuer andere Zwecke frei. Der erste
# Request danach zahlt einmalig die Ladezeit (Kaltstart).
#
# Wert anpassbar: 0 = sofort entladen, 30m = laenger halten, -1 = nie (Default).
[Service]
Environment="OLLAMA_KEEP_ALIVE=5m"