Bisher: Die Analyse identischer Bilder war bereits dedupliziert (Ledger nach Byte-Hash indiziert). Aber jede Bild-URL wurde bei jedem Scan ERNEUT heruntergeladen, um ihren Hash für Gruppierung/Abdeckung zu berechnen — auch wenn die Bytes längst bekannt und analysiert waren. Neu: persistente URL→Hash-Map im Ledger (url_hashes). Eine bereits gesehene Bild-URL wird nicht erneut geladen; Abdeckung umfasst nur noch nie gesehene URLs. Duplikate (gleiche Bytes an mehreren URLs) werden je URL höchstens einmal geholt und nie doppelt analysiert. Geänderte/geflaggte Bilder werden weiterhin IMMER (erneut) geprüft. Spart Bandbreite/Zeit und schont den überwachten Server (Fetch nur für Neues). Byte-Änderungen bereits bekannter Bilder auf stabilen Seiten deckt weiterhin check-assets ab (Integritäts-Layer). Tests: 258 grün (+1: Duplikat-URLs einmal geladen, einmal analysiert, danach kein erneuter Fetch). Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com> |
||
|---|---|---|
| .. | ||
| __init__.py | ||
| __main__.py | ||
| ai_analyzer.py | ||
| alerter.py | ||
| baseline.py | ||
| checker.py | ||
| config.py | ||
| crawler.py | ||
| differ.py | ||
| extractor.py | ||
| plain.py | ||
| report.py | ||