- spoken_response_adapter: Emoji-/Symbol-Strip (Emoticons, Symbole, Flaggen, Pfeile, Dingbats, ZWJ/Variationsselektoren). Markdown wurde bereits entfernt. - Geräte-TTS (app.js v28) liest das bereinigte "spoken"-Feld statt des Rohtexts (automatisch + beim Replay); Anzeige bleibt Originaltext. - deploy/ollama-keepalive.conf: Drop-in OLLAMA_KEEP_ALIVE=5m -> GPU im Leerlauf frei. - Doku §4.10: Dauerbetrieb als Dienst + warum der Gateway die GPU nicht blockiert. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
19 lines
885 B
Text
19 lines
885 B
Text
# systemd-Drop-in fuer den Ollama-System-Dienst: Modelle nach Leerlauf entladen,
|
|
# damit die GPU automatisch frei wird (statt OLLAMA_KEEP_ALIVE=-1 = nie entladen).
|
|
#
|
|
# Installation (root noetig, betrifft den systemweiten ollama-Dienst):
|
|
# sudo mkdir -p /etc/systemd/system/ollama.service.d
|
|
# sudo cp deploy/ollama-keepalive.conf /etc/systemd/system/ollama.service.d/keepalive.conf
|
|
# sudo systemctl daemon-reload
|
|
# sudo systemctl restart ollama
|
|
# # Pruefen:
|
|
# systemctl show ollama -p Environment | tr ' ' '\n' | grep KEEP_ALIVE
|
|
#
|
|
# Wirkung: Ein geladenes Modell wird nach 5 Minuten Inaktivitaet aus dem VRAM
|
|
# entladen -> GPU 1 ist im Leerlauf wieder fuer andere Zwecke frei. Der erste
|
|
# Request danach zahlt einmalig die Ladezeit (Kaltstart).
|
|
#
|
|
# Wert anpassbar: 0 = sofort entladen, 30m = laenger halten, -1 = nie (Default).
|
|
|
|
[Service]
|
|
Environment="OLLAMA_KEEP_ALIVE=5m"
|