diff --git a/BEDIENUNGSANLEITUNG.md b/BEDIENUNGSANLEITUNG.md index 8dc1287..c71c33e 100644 --- a/BEDIENUNGSANLEITUNG.md +++ b/BEDIENUNGSANLEITUNG.md @@ -388,6 +388,25 @@ python scripts/voice_loop.py --recorder arecord --device plughw:5,0 --session te **Audio (TTS, dann STT)**; das LLM ist nahezu kostenlos. Verlässliche Zahlen liefert das **OpenRouter-Dashboard** (Activity/Usage). +### C5. Hybrid-Konstellation (STT + LLM lokal, TTS remote) — Kostenvergleich + +Konstellation: **STT** lokal (`faster-whisper`) → **KI** lokal (Ollama, z. B. `llama3.1:8b`) +→ **TTS** remote (Gemini/Zephyr). Befehl: siehe Hybrid-Beispiel in Teil B1. + +| | STT | LLM | TTS | API-Kosten/Runde | +|---|-----|-----|-----|------------------| +| **Ideal (all-cloud)** | remote ~0,15 ¢ | remote ~0,01 ¢ | remote ~0,5–1,5 ¢ | **~1–2 ¢** | +| **Hybrid** | lokal (nur Strom) | lokal (nur Strom) | remote ~0,5–1,5 ¢ | **~0,5–1,5 ¢** | + +**Ersparnis: nur ~0,15 ¢/Runde (~10–15 %)** — winzig, weil der Kostentreiber das **remote +TTS** ist und remote bleibt; STT und LLM waren in der Cloud ohnehin sehr billig. Der echte +Gewinn des Hybrids ist **Datenschutz** (Spracherkennung + Verständnis bleiben lokal), nicht +die Kosten. Dafür: lokaler **Stromverbrauch** der GPUs, langsamerer erster Turn (Modell-Kaltstart) +und bei Dialekt/Plattdeutsch etwas schwächer als Cloud-Gemini. + +→ **Für echte Kostensenkung** müsste auch das **TTS lokal** laufen (z. B. `piper` — derzeit +noch Platzhalter); dann ~gratis (nur Strom), aber geringere Sprachqualität. + --- # Betrieb & Verwaltung