docs: Betriebsprofile, Ollama, Web-UI und Startup-Hinweise dokumentieren

- README: Ollama als LLM-Backend (Alternative zu llama.cpp) mit .env-Snippet
- README: Warnung dass Gateway ohne LLM-Server startet, Fehler erst beim ersten Request
- BEDIENUNGSANLEITUNG: Abschnitt 4 zu vollstaendiger Profilbeschreibung ausgebaut
  (cloud / hybrid / local-dev je mit Hardware, Software, Kosten, Latenz, Qualitaet,
  Einrichtungsbefehlen und Vergleichstabelle)
- BEDIENUNGSANLEITUNG: neues Kapitel A0 Web-Interface (Oberflaeche, Ablaeufe,
  Fehlertabelle)

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
Dieter Schlüter 2026-06-18 16:30:46 +02:00
commit 5e6d708038
2 changed files with 261 additions and 6 deletions

View file

@ -183,9 +183,46 @@ make llm-up # 35B-Modell laden; mit make llm-status auf "HTTP OK" warte
make run # Gateway nutzt jetzt das lokale, unzensierte Modell als zentrale KI
```
> **Wichtig:** Gateway und LLM-Server starten **unabhängig** voneinander — `make run`
> läuft auch ohne laufenden LLM-Container hoch, ohne Fehlermeldung. Der Fehler
> „All connection attempts failed" erscheint erst beim **ersten Request**. Daher immer
> zuerst `make llm-up` vollständig abwarten (Status „HTTP OK"), dann `make run`.
> `VA_PROFILE` ist in `.env` dauerhaft setzbar (aktuell `local-dev`) oder pro Lauf
> voranstellbar (`VA_PROFILE=hybrid make run`). Prüfen: `curl http://localhost:8080/api/config`.
## Ollama als LLM-Backend (Alternative)
Wer statt des llama.cpp-Docker-Containers lieber **Ollama** nutzt, braucht keinen
eigenen Start-Skript: Ollama verwaltet den Server-Prozess selbst und bietet eine
**OpenAI-kompatible API** — der Provider `local-openai-compatible` verbindet sich
direkt damit.
**Voraussetzung:** Ollama ist installiert (`ollama --version`) und das gewünschte
Modell bereits heruntergeladen (`ollama pull qwen3:30b-a3b`).
Drei Zeilen in `.env` anpassen (der Rest bleibt unverändert):
```bash
LOCAL_LLM_BASE_URL=http://127.0.0.1:11434/v1
LOCAL_LLM_API_KEY=ollama # Ollama erwartet einen beliebigen Wert
LOCAL_LLM_MODEL=qwen3:30b-a3b # exakter Name aus 'ollama list'
```
Danach Gateway starten — kein `make llm-up` nötig, Ollama läuft im Hintergrund:
```bash
VA_PROFILE=local-dev make run # oder hybrid, wenn STT/TTS Cloud bleiben sollen
```
**Hinweise:**
- `LOCAL_LLM_DISABLE_REASONING=true` (Standard) schickt `chat_template_kwargs:
{enable_thinking: false}` — Ollama ignoriert dieses Feld; die Denkphase muss
im Modell-Alias selbst abgeschaltet werden (`qwen3:30b-a3b` statt
`qwen3:30b-a3b:thinking`) oder über den System-Prompt.
- `ollama list` zeigt alle lokal vorhandenen Modelle mit exaktem Namen.
- Verfügbare Modelle: `https://ollama.com/library` (Suche nach `qwen3`, `llama`, …).
## API-Überblick
| Methode & Pfad | Zweck |