19 lines
885 B
Text
19 lines
885 B
Text
|
|
# systemd-Drop-in fuer den Ollama-System-Dienst: Modelle nach Leerlauf entladen,
|
||
|
|
# damit die GPU automatisch frei wird (statt OLLAMA_KEEP_ALIVE=-1 = nie entladen).
|
||
|
|
#
|
||
|
|
# Installation (root noetig, betrifft den systemweiten ollama-Dienst):
|
||
|
|
# sudo mkdir -p /etc/systemd/system/ollama.service.d
|
||
|
|
# sudo cp deploy/ollama-keepalive.conf /etc/systemd/system/ollama.service.d/keepalive.conf
|
||
|
|
# sudo systemctl daemon-reload
|
||
|
|
# sudo systemctl restart ollama
|
||
|
|
# # Pruefen:
|
||
|
|
# systemctl show ollama -p Environment | tr ' ' '\n' | grep KEEP_ALIVE
|
||
|
|
#
|
||
|
|
# Wirkung: Ein geladenes Modell wird nach 5 Minuten Inaktivitaet aus dem VRAM
|
||
|
|
# entladen -> GPU 1 ist im Leerlauf wieder fuer andere Zwecke frei. Der erste
|
||
|
|
# Request danach zahlt einmalig die Ladezeit (Kaltstart).
|
||
|
|
#
|
||
|
|
# Wert anpassbar: 0 = sofort entladen, 30m = laenger halten, -1 = nie (Default).
|
||
|
|
|
||
|
|
[Service]
|
||
|
|
Environment="OLLAMA_KEEP_ALIVE=5m"
|