Jamulix: Optimierungen übernehmen, lokale Voice-Modelle ignorieren
This commit is contained in:
parent
e99508a727
commit
91b9ef3374
12 changed files with 555 additions and 94 deletions
|
|
@ -18,6 +18,7 @@ from app.providers.stt.faster_whisper import FasterWhisperProvider
|
|||
from app.providers.llm.local_openai_compatible import LocalOpenAICompatibleLLM
|
||||
from app.providers.llm.openrouter import OpenRouterLLMProvider
|
||||
from app.providers.tts.openrouter import OpenRouterTTSProvider
|
||||
from app.providers.tts.cartesia import CartesiaTTSProvider
|
||||
from app.providers.tts.chatterbox import ChatterboxTTSProvider
|
||||
from app.providers.tts.piper import PiperTTSProvider
|
||||
from app.providers.fallback import (
|
||||
|
|
@ -80,6 +81,10 @@ TTS_REGISTRY = {
|
|||
s.chatterbox_timeout,
|
||||
voices_dir=s.chatterbox_voices_dir,
|
||||
),
|
||||
"cartesia": lambda s: CartesiaTTSProvider(
|
||||
s.cartesia_api_key, s.cartesia_voice_id, s.cartesia_tts_model, s.tts_sample_rate,
|
||||
voices_str=s.cartesia_voices,
|
||||
),
|
||||
"piper": lambda s: PiperTTSProvider(
|
||||
s.piper_bin, s.piper_voices_dir, s.piper_voice, s.tts_sample_rate
|
||||
),
|
||||
|
|
@ -151,32 +156,74 @@ ROUTE_KEYS = (
|
|||
"tts_provider",
|
||||
"language",
|
||||
"language_mode",
|
||||
"voice_gender",
|
||||
)
|
||||
|
||||
# Stimm-Auswahl nach Sprache: (effektive) Sprache → beste Piper-Stimme.
|
||||
# Gilt in BEIDEN Modi — die gesprochene Stimme folgt immer der Antwortsprache.
|
||||
# Stimm-Auswahl nach Sprache: (effektive) Sprache → beste Piper-Stimme (gender-agnostisch).
|
||||
LANG_TO_PIPER_VOICE: dict[str, str] = {
|
||||
"de": "de_DE-thorsten-high",
|
||||
"en": "en_US-lessac-high",
|
||||
"fr": "fr_FR-siwis-medium",
|
||||
"es": "es_ES-sharvard-medium",
|
||||
"it": "it_IT-paola-medium",
|
||||
"nl": "nl_NL-mls-medium",
|
||||
"pt": "pt_BR-faber-medium",
|
||||
"pl": "pl_PL-darkman-medium",
|
||||
"ar": "ar_JO-kareem-medium",
|
||||
"ru": "ru_RU-irina-medium",
|
||||
"zh": "zh_CN-huayan-medium",
|
||||
"cmn": "zh_CN-huayan-medium",
|
||||
}
|
||||
|
||||
# Geschlechtsspezifische Piper-Stimmen für Sprachen mit m+f Varianten.
|
||||
# Präzedenz: PIPER_VOICE_GENDERED > LANG_TO_PIPER_VOICE.
|
||||
# ES sharvard ist ein Multi-Speaker-Modell: #0=M, #1=F (speaker_id_map: {'M':0,'F':1})
|
||||
PIPER_VOICE_GENDERED: dict[tuple[str, str], str] = {
|
||||
("de", "f"): "de_DE-kerstin-low",
|
||||
("de", "m"): "de_DE-thorsten-high",
|
||||
("en", "f"): "en_US-amy-medium",
|
||||
("en", "m"): "en_US-lessac-high",
|
||||
("fr", "f"): "fr_FR-siwis-medium",
|
||||
("fr", "m"): "fr_FR-tom-medium",
|
||||
("es", "f"): "es_ES-sharvard-medium#1",
|
||||
("es", "m"): "es_ES-sharvard-medium#0",
|
||||
("it", "f"): "it_IT-paola-medium",
|
||||
("it", "m"): "it_IT-riccardo-x_low",
|
||||
("ru", "f"): "ru_RU-irina-medium",
|
||||
("ru", "m"): "ru_RU-ruslan-medium",
|
||||
("pl", "f"): "pl_PL-gosia-medium",
|
||||
("pl", "m"): "pl_PL-darkman-medium",
|
||||
}
|
||||
|
||||
|
||||
def piper_voice_for_language(tts_provider: str, language: str | None) -> str | None:
|
||||
"""Liefert die zur Sprache passende Piper-Stimme (sonst None → Provider-Default).
|
||||
"""Kompatibilitäts-Alias für voice_for_route ohne gender."""
|
||||
return voice_for_route(tts_provider, language, "any")
|
||||
|
||||
Nur für Piper sinnvoll: Cloud-TTS (OpenRouter) und Chatterbox haben eigene
|
||||
Stimmnamen (z. B. "Zephyr") und steuern die Sprache anders. Bei None nimmt der
|
||||
jeweilige Provider seine konfigurierte Default-Stimme.
|
||||
|
||||
def voice_for_route(
|
||||
tts_provider: str, language: str | None, voice_gender: str = "any"
|
||||
) -> str | None:
|
||||
"""Liefert den voice-Parameter für synthesize() passend zum Provider.
|
||||
|
||||
- piper: Piper-Stimmmodell-Name; geschlechtsspezifisch wenn Varianten vorhanden
|
||||
- cartesia: Geschlechts-Code ("m"/"f"/"any") → CartesiaTTSProvider löst UUID auf
|
||||
- andere: None (Provider nutzt seinen eigenen Default)
|
||||
"""
|
||||
if tts_provider == "piper" and language:
|
||||
return LANG_TO_PIPER_VOICE.get(language)
|
||||
lang = language.lower()
|
||||
gender = (voice_gender or "any").lower()
|
||||
# Geschlechtsspezifische Stimme: bevorzugte Richtung, dann Gegenteil
|
||||
if gender in ("m", "f"):
|
||||
candidates = [gender, "f" if gender == "m" else "m"]
|
||||
else: # "any" → weiblich bevorzugt (konsistent mit Cartesia)
|
||||
candidates = ["f", "m"]
|
||||
for g in candidates:
|
||||
voice = PIPER_VOICE_GENDERED.get((lang, g))
|
||||
if voice:
|
||||
return voice
|
||||
return LANG_TO_PIPER_VOICE.get(lang)
|
||||
if tts_provider == "cartesia":
|
||||
return voice_gender or "any"
|
||||
return None
|
||||
|
||||
|
||||
|
|
@ -189,6 +236,7 @@ class ResolvedRoute:
|
|||
tts_provider: str
|
||||
language: str
|
||||
language_mode: str = "fix"
|
||||
voice_gender: str = "any"
|
||||
|
||||
def as_dict(self) -> dict:
|
||||
return {
|
||||
|
|
@ -199,6 +247,7 @@ class ResolvedRoute:
|
|||
"tts_provider": self.tts_provider,
|
||||
"language": self.language,
|
||||
"language_mode": self.language_mode,
|
||||
"voice_gender": self.voice_gender,
|
||||
}
|
||||
|
||||
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue