feat: initial implementation of website integrity scanner
Python-Package zur unabhängigen Überwachung statischer Websites gegen SEO-Spam und unbefugte Manipulationen. Läuft außerhalb des Hosters. Kernfunktionen: - Reiner Python-Crawler (bs4+lxml), kein wget - Baseline-Management mit manuellem Freigabe-Workflow (niemals automatisch) - Text-/Link-/Meta-Diff mit Risiko-Scoring (grün/gelb/rot) - Hidden-Content-Erkennung (CSS inline, noscript, Kommentar-Links) - Whitelist für externe Domains und interne Pfade - E-Mail + Webhook Alarmierung - CLI: init, crawl, check, scan, approve, report, status - 79 Unit-Tests (pytest), alle grün Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
commit
98e8d11eb5
24 changed files with 4295 additions and 0 deletions
17
config/allowed_paths.yaml
Normal file
17
config/allowed_paths.yaml
Normal file
|
|
@ -0,0 +1,17 @@
|
|||
# Whitelist erlaubter interner URL-Pfade (optional)
|
||||
#
|
||||
# Wenn diese Liste befüllt ist, lösen interne Links auf nicht gelistete
|
||||
# Pfade einen Alarm aus.
|
||||
# Leer lassen = keine Pfad-Whitelist-Prüfung (nur Baseline-Diff zählt).
|
||||
#
|
||||
# Format: ein Pfad pro Zeile (absoluter Pfad, ohne Domain)
|
||||
# Beispiel für bredelar.info:
|
||||
#
|
||||
# - /
|
||||
# - /index.html
|
||||
# - /kontakt/
|
||||
# - /kontakt/index.html
|
||||
# - /impressum/
|
||||
# - /datenschutz/
|
||||
# - /ueber-uns/
|
||||
# - /aktuelles/
|
||||
Loading…
Add table
Add a link
Reference in a new issue