docs(barge-in): Bedienungsanleitung um Barge-in-Nutzerbedienung ergaenzen

- §5.1.2 Tabelle: Mic-Button mit allen 3 Zustaenden (gruen/rot/amber) beschrieben
- §5.1.4: Barge-in-Schritt im Sprachaufnahme-Ablauf erklaert
- §5.2: [Enter] waehrend Wiedergabe = Barge-in im Terminal-Ablauf eingetragen
- §6.8: Barge-in jetzt fuer alle drei Kanaele beschrieben (Web, Terminal, API)

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
Dieter Schlüter 2026-06-18 18:44:53 +02:00
commit 6693c0411c

View file

@ -484,7 +484,7 @@ https://va.beispiel.de/ ← remote über Reverse-Proxy (alles, inkl. Mikr
| Element | Funktion |
|---------|----------|
| **Texteingabe + Senden** | Text tippen, dann Enter oder „Senden" |
| **🎤 Mikrofon-Button** | Tippen → Aufnahme startet (Button wird rot); erneut tippen → Aufnahme stoppt und wird verarbeitet |
| **🎤 Mikrofon-Button** | **Idle (grün 🎤):** Tippen → Aufnahme startet · **Aufnahme (rot pulsierend 🎤):** Tippen → Aufnahme stoppt und wird gesendet · **KI antwortet (amber ⏹):** Tippen → Antwort sofort unterbrechen (Barge-in) |
| **Stimme ▾** | TTS-Provider wählen: leer = Server-Default, `chatterbox` = neuronale Stimme, `openrouter` = Cloud-TTS |
| **☀️ / 🌙** | Tag-/Nacht-Modus; folgt sonst automatisch dem Betriebssystem |
| **Angemeldet als …** | SSO-Identität; „Gast" wenn AUTH deaktiviert oder kein SSO-Cookie |
@ -503,6 +503,10 @@ https://va.beispiel.de/ ← remote über Reverse-Proxy (alles, inkl. Mikr
3. **🎤** erneut tippen → Statuszeile: „verarbeite Sprache …" → „denkt …".
4. Transkription erscheint blau, Antwort grau — und wird vorgelesen.
**Antwort unterbrechen (Barge-in):** Während der Button amber / ⏹ zeigt (KI spricht),
einfach erneut tippen → Wiedergabe stoppt sofort, Generierung auf dem Server bricht ab.
Der Button kehrt zu grün zurück, sobald die Verbindung sauber geschlossen ist.
#### 5.1.5 Fehlermeldungen im Chat
| Meldung | Ursache | Abhilfe |
@ -527,8 +531,9 @@ python scripts/voice_loop.py --session mein-gespraech
**Ablauf je Runde:**
1. **[Enter]** → sprechen
2. **[Enter]** → Aufnahme stoppt, Assistent antwortet hörbar
3. **[Enter]** → wieder sprechen; Verlauf bleibt
4. **Strg + C** → beenden
3. **[Enter]** während der Wiedergabe → **Barge-in:** Antwort sofort unterbrechen
4. **[Enter]** → nächste Runde beginnen
5. **Strg + C** → beenden
**Nützliche Optionen:**
@ -908,8 +913,11 @@ AUDIO_STREAM_DEFAULT=false
python scripts/voice_loop.py --no-stream-audio
```
**Barge-in** (laufende Antwort unterbrechen): WebSocket-Event `{"type":"interrupt"}`
senden → Server stoppt Streaming und meldet `{"type":"interrupted"}`.
**Barge-in** (laufende Antwort unterbrechen):
- **Web-Interface:** Mic-Button ⏹ (amber) während der KI-Antwort tippen → Wiedergabe stoppt sofort, Server bricht Generierung ab.
- **Terminal:** `[Enter]` während der Wiedergabe drücken → dasselbe Ergebnis.
- **API/eigene Clients:** WebSocket-Event `{"type":"interrupt"}` senden → Server stoppt Streaming und meldet `{"type":"interrupted"}`.
**VAD** (automatische Sprechpausen-Erkennung): Im Start-Frame von `/ws/voice`
`{"type":"start","vad":true,"format":"pcm","sample_rate":16000}` → kein manuelles Ende nötig.