docs: Sprech-Loop-Streaming aktualisieren (--stream-audio, /ws/voice-Optionen)
- Hybrid-Beispiel um --stream-audio ergaenzt - erklaert: --stream-audio liest satzweise vor (Ton beginnt nach 1. Satz); Provider-Overrides und audio_stream wirken jetzt auch ueber /ws/voice (start-Frame) Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
parent
2d288be630
commit
2e6f2efef6
1 changed files with 7 additions and 2 deletions
|
|
@ -175,7 +175,10 @@ curl -s -X POST "$URL/api/chat?debug=true" \
|
|||
fließt in die nächste Antwort. Ohne `session_id` ist jeder Aufruf eigenständig.
|
||||
Wie viele Nachrichten einfließen, steuert `HISTORY_MAX_MESSAGES` (Standard 10).
|
||||
- **Echtzeit-Streaming:** WebSocket `/ws/chat` mit `{"text":"…","stream":true}` liefert
|
||||
die Antwort wortweise; `"audio_stream":true` zusätzlich das Audio satzweise.
|
||||
die Antwort wortweise; `"audio_stream":true` zusätzlich das Audio satzweise. Im
|
||||
Sprech-Loop aktivierst du das satzweise Vorlesen mit `--stream-audio` (das Vorlesen
|
||||
beginnt dann schon nach dem ersten Satz, statt erst nach der ganzen Antwort).
|
||||
Provider-Overrides und `--stream-audio` wirken auch über `/ws/voice` (start-Frame).
|
||||
- **Unterbrechen (Barge-in):** während der Assistent spricht `{"type":"interrupt"}`
|
||||
senden → laufende Antwort wird abgebrochen.
|
||||
- **Automatische Sprechpausen-Erkennung (VAD):** im Start-Frame von `/ws/voice`
|
||||
|
|
@ -226,12 +229,14 @@ echo 'LOCAL_LLM_MODEL=llama3.2:latest' >> .env
|
|||
make run
|
||||
# in Terminal 2 — Sprech-Loop mit der Hybrid-Kombi (MOTU = plughw:5,0):
|
||||
python scripts/voice_loop.py --recorder arecord --device plughw:5,0 --session hybrid \
|
||||
--stream-audio \
|
||||
--stt-provider faster-whisper \
|
||||
--llm-provider local-openai-compatible \
|
||||
--tts-provider openrouter
|
||||
```
|
||||
Erster Turn ist langsamer (Whisper- und Ollama-Modell laden), danach zügig. STT-Modell
|
||||
und Gerät steuern `FASTER_WHISPER_MODEL`/`FASTER_WHISPER_DEVICE` in `.env`.
|
||||
und Gerät steuern `FASTER_WHISPER_MODEL`/`FASTER_WHISPER_DEVICE` in `.env`. `--stream-audio`
|
||||
lässt das Vorlesen schon nach dem ersten Satz beginnen (geringere Wartezeit bis zum Ton).
|
||||
|
||||
## B2. Soundquelle & Ausgabe-Gerät wechseln (Mikrofon, Lautsprecher, Bluetooth, Handy)
|
||||
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue