feat: schwerwiegende KI-Funde dürfen ROT auslösen (konfigurierbar)

Bisher war das KI-Level hart auf Gelb gedeckelt — auch injizierte
Pornografie oder strafbare/diffamierende Inhalte lösten nie Rot aus.
Das unterschätzt echte Notfälle (Sicherheits- + Rechts-/Reputationsrisiko).

Neu: kategoriebasierter Grave-Override in score_ai_findings. Nur Kategorien
aus red_categories (default ["pornography","defamation_illegal"]) lösen Rot
aus, und nur bei Schwere ≥ red_min_severity (high) UND Konfidenz ≥
red_min_confidence (0.9). Alle anderen Kategorien (Spam, Off-Topic,
Propaganda, Widerspruch) bleiben höchstens Gelb. Die Punktsumme allein
ergibt weiterhin nie Rot. red_categories: [] stellt das alte Verhalten her.

Begründung für die konservative Schwelle: LLM-Konfidenzen sind nicht
perfekt kalibriert — nur die gravierendsten Fälle dürfen die volle
ROT-Dringlichkeit ("Dienstleister informieren, nichts freigeben") tragen.

Rot fließt über die bestehende _worst_level-Verdrahtung automatisch ins
Gesamt-Level + Exit-Code 2; gilt auch für Bildfunde (OCR).

Tests: 237 grün (+7 Rot-Gate, bestehender Cap-Test auf Punktsumme-Logik
umgestellt). Config + Template + README + Bedienungsanleitung aktualisiert.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
Dieter Schlüter 2026-06-13 01:16:23 +02:00
commit a8dcaabf7c
6 changed files with 98 additions and 15 deletions

View file

@ -140,6 +140,11 @@ ai_analysis:
# einzelne Schlüsselwörter. Bitte ausfüllen, wenn enabled: true.
site_context: ""
ai_confidence_min: 0.7
# KI-Funde sind auf Gelb gedeckelt — AUSSER diese schwerwiegenden Kategorien lösen
# bei hoher Schwere + hoher Konfidenz ROT aus. Leere Liste [] = immer max. Gelb.
red_categories: ["pornography", "defamation_illegal"]
red_min_severity: "high"
red_min_confidence: 0.9
attempt_timeout: 30 # Zeitlimit je Modell-Versuch (Sek.) → Auslöser der Eskalation
max_retries: 1 # Wiederholungen der ganzen Modell-Kette bei Komplettausfall
retry_backoff_seconds: 2.0