Gegen "Blödsinn", v. a. an Handys: 1) Modell-Default base -> small + compute_type int8 (Benchmark auf der VM: base patzt schon bei sauberem Audio "an Dienstag und 10 Uhr", small korrekt "am Dienstag um 10 Uhr"; ~4 s/6-s-Clip, gecacht). 2) faster_whisper.transcribe mit vad_filter=True (+min_silence 500ms) und condition_on_previous_text=False -> weniger Stille-/Kontext-Halluzinationen. 3) stt_force_language (Default True): WS-Pfad gibt die feste Zielsprache vor statt Auto-Detect -> robust bei kurzen/verrauschten Clips. Auto-Detect + Fremdsprachen-Übersetzung jetzt opt-in (stt_force_language=False). Tests: Config-Defaults + VAD/Language-Durchreichung; test_ws-Übersetzung auf opt-in umgestellt. Suite 253 grün. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com> |
||
|---|---|---|
| .. | ||
| __init__.py | ||
| base.py | ||
| faster_whisper.py | ||
| openrouter.py | ||