Jamulix: Optimierungen übernehmen, lokale Voice-Modelle ignorieren

This commit is contained in:
Dieter Schlüter 2026-06-24 22:01:38 +02:00
commit 91b9ef3374
12 changed files with 555 additions and 94 deletions

View file

@ -18,6 +18,7 @@ from app.providers.stt.faster_whisper import FasterWhisperProvider
from app.providers.llm.local_openai_compatible import LocalOpenAICompatibleLLM
from app.providers.llm.openrouter import OpenRouterLLMProvider
from app.providers.tts.openrouter import OpenRouterTTSProvider
from app.providers.tts.cartesia import CartesiaTTSProvider
from app.providers.tts.chatterbox import ChatterboxTTSProvider
from app.providers.tts.piper import PiperTTSProvider
from app.providers.fallback import (
@ -80,6 +81,10 @@ TTS_REGISTRY = {
s.chatterbox_timeout,
voices_dir=s.chatterbox_voices_dir,
),
"cartesia": lambda s: CartesiaTTSProvider(
s.cartesia_api_key, s.cartesia_voice_id, s.cartesia_tts_model, s.tts_sample_rate,
voices_str=s.cartesia_voices,
),
"piper": lambda s: PiperTTSProvider(
s.piper_bin, s.piper_voices_dir, s.piper_voice, s.tts_sample_rate
),
@ -151,32 +156,74 @@ ROUTE_KEYS = (
"tts_provider",
"language",
"language_mode",
"voice_gender",
)
# Stimm-Auswahl nach Sprache: (effektive) Sprache → beste Piper-Stimme.
# Gilt in BEIDEN Modi — die gesprochene Stimme folgt immer der Antwortsprache.
# Stimm-Auswahl nach Sprache: (effektive) Sprache → beste Piper-Stimme (gender-agnostisch).
LANG_TO_PIPER_VOICE: dict[str, str] = {
"de": "de_DE-thorsten-high",
"en": "en_US-lessac-high",
"fr": "fr_FR-siwis-medium",
"es": "es_ES-sharvard-medium",
"it": "it_IT-paola-medium",
"nl": "nl_NL-mls-medium",
"pt": "pt_BR-faber-medium",
"pl": "pl_PL-darkman-medium",
"ar": "ar_JO-kareem-medium",
"ru": "ru_RU-irina-medium",
"zh": "zh_CN-huayan-medium",
"cmn": "zh_CN-huayan-medium",
}
# Geschlechtsspezifische Piper-Stimmen für Sprachen mit m+f Varianten.
# Präzedenz: PIPER_VOICE_GENDERED > LANG_TO_PIPER_VOICE.
# ES sharvard ist ein Multi-Speaker-Modell: #0=M, #1=F (speaker_id_map: {'M':0,'F':1})
PIPER_VOICE_GENDERED: dict[tuple[str, str], str] = {
("de", "f"): "de_DE-kerstin-low",
("de", "m"): "de_DE-thorsten-high",
("en", "f"): "en_US-amy-medium",
("en", "m"): "en_US-lessac-high",
("fr", "f"): "fr_FR-siwis-medium",
("fr", "m"): "fr_FR-tom-medium",
("es", "f"): "es_ES-sharvard-medium#1",
("es", "m"): "es_ES-sharvard-medium#0",
("it", "f"): "it_IT-paola-medium",
("it", "m"): "it_IT-riccardo-x_low",
("ru", "f"): "ru_RU-irina-medium",
("ru", "m"): "ru_RU-ruslan-medium",
("pl", "f"): "pl_PL-gosia-medium",
("pl", "m"): "pl_PL-darkman-medium",
}
def piper_voice_for_language(tts_provider: str, language: str | None) -> str | None:
"""Liefert die zur Sprache passende Piper-Stimme (sonst None → Provider-Default).
"""Kompatibilitäts-Alias für voice_for_route ohne gender."""
return voice_for_route(tts_provider, language, "any")
Nur für Piper sinnvoll: Cloud-TTS (OpenRouter) und Chatterbox haben eigene
Stimmnamen (z. B. "Zephyr") und steuern die Sprache anders. Bei None nimmt der
jeweilige Provider seine konfigurierte Default-Stimme.
def voice_for_route(
tts_provider: str, language: str | None, voice_gender: str = "any"
) -> str | None:
"""Liefert den voice-Parameter für synthesize() passend zum Provider.
- piper: Piper-Stimmmodell-Name; geschlechtsspezifisch wenn Varianten vorhanden
- cartesia: Geschlechts-Code ("m"/"f"/"any") CartesiaTTSProvider löst UUID auf
- andere: None (Provider nutzt seinen eigenen Default)
"""
if tts_provider == "piper" and language:
return LANG_TO_PIPER_VOICE.get(language)
lang = language.lower()
gender = (voice_gender or "any").lower()
# Geschlechtsspezifische Stimme: bevorzugte Richtung, dann Gegenteil
if gender in ("m", "f"):
candidates = [gender, "f" if gender == "m" else "m"]
else: # "any" → weiblich bevorzugt (konsistent mit Cartesia)
candidates = ["f", "m"]
for g in candidates:
voice = PIPER_VOICE_GENDERED.get((lang, g))
if voice:
return voice
return LANG_TO_PIPER_VOICE.get(lang)
if tts_provider == "cartesia":
return voice_gender or "any"
return None
@ -189,6 +236,7 @@ class ResolvedRoute:
tts_provider: str
language: str
language_mode: str = "fix"
voice_gender: str = "any"
def as_dict(self) -> dict:
return {
@ -199,6 +247,7 @@ class ResolvedRoute:
"tts_provider": self.tts_provider,
"language": self.language,
"language_mode": self.language_mode,
"voice_gender": self.voice_gender,
}