docs: Hybrid-Konstellation + Kostenvergleich (vs. all-cloud Ideal)

Bedienungsanleitung Teil C5: Hybrid (STT+LLM lokal, TTS remote) mit Kostentabelle.
Ersparnis nur ~0,15 ct/Runde (~10-15 %), da das remote TTS der Kostentreiber ist und
remote bleibt; echter Gewinn = Datenschutz. Fuer echte Kostensenkung muesste auch das
TTS lokal laufen (piper, derzeit Stub).

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
Dieter Schlüter 2026-06-17 18:08:58 +02:00
commit 67d807cbcc

View file

@ -388,6 +388,25 @@ python scripts/voice_loop.py --recorder arecord --device plughw:5,0 --session te
**Audio (TTS, dann STT)**; das LLM ist nahezu kostenlos. Verlässliche Zahlen liefert das
**OpenRouter-Dashboard** (Activity/Usage).
### C5. Hybrid-Konstellation (STT + LLM lokal, TTS remote) — Kostenvergleich
Konstellation: **STT** lokal (`faster-whisper`) → **KI** lokal (Ollama, z. B. `llama3.1:8b`)
**TTS** remote (Gemini/Zephyr). Befehl: siehe Hybrid-Beispiel in Teil B1.
| | STT | LLM | TTS | API-Kosten/Runde |
|---|-----|-----|-----|------------------|
| **Ideal (all-cloud)** | remote ~0,15 ¢ | remote ~0,01 ¢ | remote ~0,51,5 ¢ | **~12 ¢** |
| **Hybrid** | lokal (nur Strom) | lokal (nur Strom) | remote ~0,51,5 ¢ | **~0,51,5 ¢** |
**Ersparnis: nur ~0,15 ¢/Runde (~1015 %)** — winzig, weil der Kostentreiber das **remote
TTS** ist und remote bleibt; STT und LLM waren in der Cloud ohnehin sehr billig. Der echte
Gewinn des Hybrids ist **Datenschutz** (Spracherkennung + Verständnis bleiben lokal), nicht
die Kosten. Dafür: lokaler **Stromverbrauch** der GPUs, langsamerer erster Turn (Modell-Kaltstart)
und bei Dialekt/Plattdeutsch etwas schwächer als Cloud-Gemini.
**Für echte Kostensenkung** müsste auch das **TTS lokal** laufen (z. B. `piper` — derzeit
noch Platzhalter); dann ~gratis (nur Strom), aber geringere Sprachqualität.
---
# Betrieb & Verwaltung