docs(deploy): Chatterbox-TTS-Dienst (GPU-Pinning per UUID, no_playback) ergaenzen

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
Dieter Schlüter 2026-06-18 09:58:15 +02:00
commit 56114309f5

View file

@ -78,3 +78,19 @@ werden ohnehin durchgereicht.
- `https://va.linix.de/` lädt die UI, links „Angemeldet als <SSO-User>". - `https://va.linix.de/` lädt die UI, links „Angemeldet als <SSO-User>".
- Text-Chat funktioniert; **Mikrofon-Button** nimmt auf und spielt die Antwort ab. - Text-Chat funktioniert; **Mikrofon-Button** nimmt auf und spielt die Antwort ab.
- Admins (`ADMIN_USERS`) sehen den Admin-Bereich (Nutzerliste). - Admins (`ADMIN_USERS`) sehen den Admin-Bereich (Nutzerliste).
## 6. Chatterbox-TTS (optional, hohe Qualität + Voice-Cloning)
Eigener HTTP-Dienst (`~/chatterbox-tts-cli`, Conda-Env, GPU). systemd-User-Unit
`chatterbox-tts.service` (Port 9999). Wichtig:
- **GPU pinnen per UUID** (CUDA-Default-Order ist „fastest first" → Index trügt):
`Environment="CUDA_VISIBLE_DEVICES=GPU-<uuid der freien 3090>"` (UUID via `nvidia-smi -L`).
- **`TTS_PRELOAD_LANG=de`** lädt das Modell beim Start (Warm-up).
- Der Dienst wird vom Gateway mit **`no_playback=true`** aufgerufen → er spielt **nicht**
lokal ab, sondern liefert nur die WAV (`tts_service.py` unterstützt das Flag).
```bash
systemctl --user enable --now chatterbox-tts
curl -s http://127.0.0.1:9999/health # {"status":"ok","device":"cuda:0"}
```
Gateway: `tts_provider=chatterbox` (pro Request/Session) + `CHATTERBOX_VOICE` = Referenz-WAV.
> Chatterbox ist ~echtzeit-langsam → als Qualitäts-Option gedacht; `piper` bleibt der
> schnelle Default. Braucht ~34 GB GPU-Speicher.