# systemd-Drop-in fuer den Ollama-System-Dienst: Modelle nach Leerlauf entladen, # damit die GPU automatisch frei wird (statt OLLAMA_KEEP_ALIVE=-1 = nie entladen). # # Installation (root noetig, betrifft den systemweiten ollama-Dienst): # sudo mkdir -p /etc/systemd/system/ollama.service.d # sudo cp deploy/ollama-keepalive.conf /etc/systemd/system/ollama.service.d/keepalive.conf # sudo systemctl daemon-reload # sudo systemctl restart ollama # # Pruefen: # systemctl show ollama -p Environment | tr ' ' '\n' | grep KEEP_ALIVE # # Wirkung: Ein geladenes Modell wird nach 5 Minuten Inaktivitaet aus dem VRAM # entladen -> GPU 1 ist im Leerlauf wieder fuer andere Zwecke frei. Der erste # Request danach zahlt einmalig die Ladezeit (Kaltstart). # # Wert anpassbar: 0 = sofort entladen, 30m = laenger halten, -1 = nie (Default). [Service] Environment="OLLAMA_KEEP_ALIVE=5m"