docs: Betriebsprofile, Ollama, Web-UI und Startup-Hinweise dokumentieren
- README: Ollama als LLM-Backend (Alternative zu llama.cpp) mit .env-Snippet - README: Warnung dass Gateway ohne LLM-Server startet, Fehler erst beim ersten Request - BEDIENUNGSANLEITUNG: Abschnitt 4 zu vollstaendiger Profilbeschreibung ausgebaut (cloud / hybrid / local-dev je mit Hardware, Software, Kosten, Latenz, Qualitaet, Einrichtungsbefehlen und Vergleichstabelle) - BEDIENUNGSANLEITUNG: neues Kapitel A0 Web-Interface (Oberflaeche, Ablaeufe, Fehlertabelle) Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
parent
fc75b3b07c
commit
5e6d708038
2 changed files with 261 additions and 6 deletions
37
README.md
37
README.md
|
|
@ -183,9 +183,46 @@ make llm-up # 35B-Modell laden; mit make llm-status auf "HTTP OK" warte
|
|||
make run # Gateway nutzt jetzt das lokale, unzensierte Modell als zentrale KI
|
||||
```
|
||||
|
||||
> **Wichtig:** Gateway und LLM-Server starten **unabhängig** voneinander — `make run`
|
||||
> läuft auch ohne laufenden LLM-Container hoch, ohne Fehlermeldung. Der Fehler
|
||||
> „All connection attempts failed" erscheint erst beim **ersten Request**. Daher immer
|
||||
> zuerst `make llm-up` vollständig abwarten (Status „HTTP OK"), dann `make run`.
|
||||
|
||||
> `VA_PROFILE` ist in `.env` dauerhaft setzbar (aktuell `local-dev`) oder pro Lauf
|
||||
> voranstellbar (`VA_PROFILE=hybrid make run`). Prüfen: `curl http://localhost:8080/api/config`.
|
||||
|
||||
## Ollama als LLM-Backend (Alternative)
|
||||
|
||||
Wer statt des llama.cpp-Docker-Containers lieber **Ollama** nutzt, braucht keinen
|
||||
eigenen Start-Skript: Ollama verwaltet den Server-Prozess selbst und bietet eine
|
||||
**OpenAI-kompatible API** — der Provider `local-openai-compatible` verbindet sich
|
||||
direkt damit.
|
||||
|
||||
**Voraussetzung:** Ollama ist installiert (`ollama --version`) und das gewünschte
|
||||
Modell bereits heruntergeladen (`ollama pull qwen3:30b-a3b`).
|
||||
|
||||
Drei Zeilen in `.env` anpassen (der Rest bleibt unverändert):
|
||||
|
||||
```bash
|
||||
LOCAL_LLM_BASE_URL=http://127.0.0.1:11434/v1
|
||||
LOCAL_LLM_API_KEY=ollama # Ollama erwartet einen beliebigen Wert
|
||||
LOCAL_LLM_MODEL=qwen3:30b-a3b # exakter Name aus 'ollama list'
|
||||
```
|
||||
|
||||
Danach Gateway starten — kein `make llm-up` nötig, Ollama läuft im Hintergrund:
|
||||
|
||||
```bash
|
||||
VA_PROFILE=local-dev make run # oder hybrid, wenn STT/TTS Cloud bleiben sollen
|
||||
```
|
||||
|
||||
**Hinweise:**
|
||||
- `LOCAL_LLM_DISABLE_REASONING=true` (Standard) schickt `chat_template_kwargs:
|
||||
{enable_thinking: false}` — Ollama ignoriert dieses Feld; die Denkphase muss
|
||||
im Modell-Alias selbst abgeschaltet werden (`qwen3:30b-a3b` statt
|
||||
`qwen3:30b-a3b:thinking`) oder über den System-Prompt.
|
||||
- `ollama list` zeigt alle lokal vorhandenen Modelle mit exaktem Namen.
|
||||
- Verfügbare Modelle: `https://ollama.com/library` (Suche nach `qwen3`, `llama`, …).
|
||||
|
||||
## API-Überblick
|
||||
|
||||
| Methode & Pfad | Zweck |
|
||||
|
|
|
|||
Loading…
Add table
Add a link
Reference in a new issue