From 2e6f2efef6d9829120002187a05b5092f3880b17 Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?Dieter=20Schl=C3=BCter?= Date: Wed, 17 Jun 2026 17:43:22 +0200 Subject: [PATCH] docs: Sprech-Loop-Streaming aktualisieren (--stream-audio, /ws/voice-Optionen) - Hybrid-Beispiel um --stream-audio ergaenzt - erklaert: --stream-audio liest satzweise vor (Ton beginnt nach 1. Satz); Provider-Overrides und audio_stream wirken jetzt auch ueber /ws/voice (start-Frame) Co-Authored-By: Claude Opus 4.8 --- BEDIENUNGSANLEITUNG.md | 9 +++++++-- 1 file changed, 7 insertions(+), 2 deletions(-) diff --git a/BEDIENUNGSANLEITUNG.md b/BEDIENUNGSANLEITUNG.md index 7bd2c35..06a55d4 100644 --- a/BEDIENUNGSANLEITUNG.md +++ b/BEDIENUNGSANLEITUNG.md @@ -175,7 +175,10 @@ curl -s -X POST "$URL/api/chat?debug=true" \ fließt in die nächste Antwort. Ohne `session_id` ist jeder Aufruf eigenständig. Wie viele Nachrichten einfließen, steuert `HISTORY_MAX_MESSAGES` (Standard 10). - **Echtzeit-Streaming:** WebSocket `/ws/chat` mit `{"text":"…","stream":true}` liefert - die Antwort wortweise; `"audio_stream":true` zusätzlich das Audio satzweise. + die Antwort wortweise; `"audio_stream":true` zusätzlich das Audio satzweise. Im + Sprech-Loop aktivierst du das satzweise Vorlesen mit `--stream-audio` (das Vorlesen + beginnt dann schon nach dem ersten Satz, statt erst nach der ganzen Antwort). + Provider-Overrides und `--stream-audio` wirken auch über `/ws/voice` (start-Frame). - **Unterbrechen (Barge-in):** während der Assistent spricht `{"type":"interrupt"}` senden → laufende Antwort wird abgebrochen. - **Automatische Sprechpausen-Erkennung (VAD):** im Start-Frame von `/ws/voice` @@ -226,12 +229,14 @@ echo 'LOCAL_LLM_MODEL=llama3.2:latest' >> .env make run # in Terminal 2 — Sprech-Loop mit der Hybrid-Kombi (MOTU = plughw:5,0): python scripts/voice_loop.py --recorder arecord --device plughw:5,0 --session hybrid \ + --stream-audio \ --stt-provider faster-whisper \ --llm-provider local-openai-compatible \ --tts-provider openrouter ``` Erster Turn ist langsamer (Whisper- und Ollama-Modell laden), danach zügig. STT-Modell -und Gerät steuern `FASTER_WHISPER_MODEL`/`FASTER_WHISPER_DEVICE` in `.env`. +und Gerät steuern `FASTER_WHISPER_MODEL`/`FASTER_WHISPER_DEVICE` in `.env`. `--stream-audio` +lässt das Vorlesen schon nach dem ersten Satz beginnen (geringere Wartezeit bis zum Ton). ## B2. Soundquelle & Ausgabe-Gerät wechseln (Mikrofon, Lautsprecher, Bluetooth, Handy)