docs: Sprech-Loop-Streaming aktualisieren (--stream-audio, /ws/voice-Optionen)

- Hybrid-Beispiel um --stream-audio ergaenzt
- erklaert: --stream-audio liest satzweise vor (Ton beginnt nach 1. Satz);
  Provider-Overrides und audio_stream wirken jetzt auch ueber /ws/voice (start-Frame)

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
Dieter Schlüter 2026-06-17 17:43:22 +02:00
commit 2e6f2efef6

View file

@ -175,7 +175,10 @@ curl -s -X POST "$URL/api/chat?debug=true" \
fließt in die nächste Antwort. Ohne `session_id` ist jeder Aufruf eigenständig.
Wie viele Nachrichten einfließen, steuert `HISTORY_MAX_MESSAGES` (Standard 10).
- **Echtzeit-Streaming:** WebSocket `/ws/chat` mit `{"text":"…","stream":true}` liefert
die Antwort wortweise; `"audio_stream":true` zusätzlich das Audio satzweise.
die Antwort wortweise; `"audio_stream":true` zusätzlich das Audio satzweise. Im
Sprech-Loop aktivierst du das satzweise Vorlesen mit `--stream-audio` (das Vorlesen
beginnt dann schon nach dem ersten Satz, statt erst nach der ganzen Antwort).
Provider-Overrides und `--stream-audio` wirken auch über `/ws/voice` (start-Frame).
- **Unterbrechen (Barge-in):** während der Assistent spricht `{"type":"interrupt"}`
senden → laufende Antwort wird abgebrochen.
- **Automatische Sprechpausen-Erkennung (VAD):** im Start-Frame von `/ws/voice`
@ -226,12 +229,14 @@ echo 'LOCAL_LLM_MODEL=llama3.2:latest' >> .env
make run
# in Terminal 2 — Sprech-Loop mit der Hybrid-Kombi (MOTU = plughw:5,0):
python scripts/voice_loop.py --recorder arecord --device plughw:5,0 --session hybrid \
--stream-audio \
--stt-provider faster-whisper \
--llm-provider local-openai-compatible \
--tts-provider openrouter
```
Erster Turn ist langsamer (Whisper- und Ollama-Modell laden), danach zügig. STT-Modell
und Gerät steuern `FASTER_WHISPER_MODEL`/`FASTER_WHISPER_DEVICE` in `.env`.
und Gerät steuern `FASTER_WHISPER_MODEL`/`FASTER_WHISPER_DEVICE` in `.env`. `--stream-audio`
lässt das Vorlesen schon nach dem ersten Satz beginnen (geringere Wartezeit bis zum Ton).
## B2. Soundquelle & Ausgabe-Gerät wechseln (Mikrofon, Lautsprecher, Bluetooth, Handy)