diff --git a/BEDIENUNGSANLEITUNG.md b/BEDIENUNGSANLEITUNG.md index 653d960..7665547 100644 --- a/BEDIENUNGSANLEITUNG.md +++ b/BEDIENUNGSANLEITUNG.md @@ -86,18 +86,50 @@ pi ## 3. Server starten und stoppen +### GPU-Zuordnung (3-GPU-Setup) + +Bei einem System mit drei GPUs sind die Rollen fest in den Startskripten verankert — +**keine manuelle Konfiguration nötig:** + +| GPU | Modell | Rolle | +|-----|--------|-------| +| GPU 0 (NVIDIA T600) | — | Display / Monitor — wird von den Skripten nicht angetastet | +| GPU 1 (RTX 3090, 24 GB) | Qwen3.6-27B | **Coder** (Port 8001) | +| GPU 2 (RTX 3090, 24 GB) | Qwen3.6-27B | **Judge** (Port 8002) | + +Jeder Server bekommt seine eigene GPU exklusiv — so gibt es keinen VRAM-Konflikt, +auch wenn beide gleichzeitig laufen. + +**Wichtig:** Andere GPU-Prozesse (z. B. TTS-Dienste, Ollama) auf GPU 1 oder GPU 2 können +VRAM belegen und dazu führen, dass ein Server nicht startet. Im Zweifel prüfen: +```bash +nvidia-smi --query-gpu=index,name,memory.used,memory.free --format=csv +``` + ### Beide starten (empfohlen) ```bash +cd ~/pi_coder ./start-servers.sh ``` +Erwartete Ausgabe: +``` +[*] Starte beide Server parallel ... +[✓] Coder (:8001) bereit +[✓] Judge (:8002) bereit +``` + +Dauer: bis zu 5 Minuten. Danach sind beide Modelle im VRAM und sofort antwortbereit. + ### Einzelnen Server neu starten -Z.B. wenn nur der Coder-Server abgestürzt ist: +Z.B. wenn nur der Judge-Server abgestürzt ist: ```bash -./start-coder.sh +./start-judge.sh # Port 8002, GPU 2 +# oder: +./start-coder.sh # Port 8001, GPU 1 ``` ### Beide stoppen @@ -106,6 +138,12 @@ Z.B. wenn nur der Coder-Server abgestürzt ist: ./stop-servers.sh ``` +### Status prüfen + +```bash +./status.sh +``` + ### Alternativer Modellpfad Falls die GGUF-Datei an einem anderen Ort liegt: @@ -833,8 +871,11 @@ HF_HOME=/korrekter/pfad ./start-servers.sh 2. GPU nicht verfügbar: ```bash - nvidia-smi # GPUs sichtbar? - docker run --gpus '"device=1,2"' --rm nvidia/cuda:12.0-base nvidia-smi + nvidia-smi # alle drei GPUs sichtbar? + # GPU 1 (Coder) testen: + docker run --gpus '"device=1"' --rm nvidia/cuda:12.0-base nvidia-smi + # GPU 2 (Judge) testen: + docker run --gpus '"device=2"' --rm nvidia/cuda:12.0-base nvidia-smi ``` 3. Port bereits belegt: