my_voice_assistant_v2/deploy/ollama-keepalive.conf
Dieter Schlüter bd20a308de feat(tts): Emojis/Markdown beim Vorlesen entfernen + Autostart/GPU-Doku
- spoken_response_adapter: Emoji-/Symbol-Strip (Emoticons, Symbole, Flaggen,
  Pfeile, Dingbats, ZWJ/Variationsselektoren). Markdown wurde bereits entfernt.
- Geräte-TTS (app.js v28) liest das bereinigte "spoken"-Feld statt des Rohtexts
  (automatisch + beim Replay); Anzeige bleibt Originaltext.
- deploy/ollama-keepalive.conf: Drop-in OLLAMA_KEEP_ALIVE=5m -> GPU im Leerlauf frei.
- Doku §4.10: Dauerbetrieb als Dienst + warum der Gateway die GPU nicht blockiert.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-20 18:25:45 +02:00

19 lines
885 B
Text

# systemd-Drop-in fuer den Ollama-System-Dienst: Modelle nach Leerlauf entladen,
# damit die GPU automatisch frei wird (statt OLLAMA_KEEP_ALIVE=-1 = nie entladen).
#
# Installation (root noetig, betrifft den systemweiten ollama-Dienst):
# sudo mkdir -p /etc/systemd/system/ollama.service.d
# sudo cp deploy/ollama-keepalive.conf /etc/systemd/system/ollama.service.d/keepalive.conf
# sudo systemctl daemon-reload
# sudo systemctl restart ollama
# # Pruefen:
# systemctl show ollama -p Environment | tr ' ' '\n' | grep KEEP_ALIVE
#
# Wirkung: Ein geladenes Modell wird nach 5 Minuten Inaktivitaet aus dem VRAM
# entladen -> GPU 1 ist im Leerlauf wieder fuer andere Zwecke frei. Der erste
# Request danach zahlt einmalig die Ladezeit (Kaltstart).
#
# Wert anpassbar: 0 = sofort entladen, 30m = laenger halten, -1 = nie (Default).
[Service]
Environment="OLLAMA_KEEP_ALIVE=5m"