refactor: start-single.sh → start-coding-server.sh, stop-servers.sh → stop-coding-server.sh

Konsistente Benennung: Server-Skripte beschreiben ihre Funktion (coding-server),
nicht das spezifische Modell oder die Architektur. Alle Referenzen in Extension,
Tests, README und BEDIENUNGSANLEITUNG aktualisiert.

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
Dieter Schlüter 2026-06-15 05:45:36 +02:00
commit 3f66d4a387
6 changed files with 40 additions and 40 deletions

View file

@ -63,11 +63,11 @@ dasselbe Modell, derselbe Container, unterschiedliche Persona.
sudo systemctl restart docker
```
- NVIDIA-GPU: empfohlen RTX 3090 (24 GB VRAM). Standard: GPU 1. Überschreibbar mit
`GPU_DEVICE=0 ./start-single.sh`. Bei 3 GPUs: GPU 0 für Display reservieren.
`GPU_DEVICE=0 ./start-coding-server.sh`. Bei 3 GPUs: GPU 0 für Display reservieren.
- GGUF-Modell vorhanden unter:
`$HF_HOME/models/qwen3/Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-IQ4_XS.gguf`
- Standard-Pfad: `HF_HOME=/home/dschlueter/nvme2n1p7_home/huggingface`
- Überschreibbar: `HF_HOME=/anderer/pfad ./start-single.sh`
- Überschreibbar: `HF_HOME=/anderer/pfad ./start-coding-server.sh`
- [pi agent](https://github.com/earendil-works/pi) installiert (`~/.pi/`)
---
@ -86,7 +86,7 @@ cd ~/pi_coder
# /reload
# 4. Server starten
./start-single.sh
./start-coding-server.sh
```
Das Install-Skript sichert eine vorhandene `~/.pi/agent/settings.json` als `.bak` und
@ -105,23 +105,23 @@ Nach späteren Änderungen an `pi-coder-judge-extension.ts` oder `models.json`:
```bash
# Server starten (empfohlen — dauert 13 Minuten)
./start-single.sh
./start-coding-server.sh
# Server auf anderer GPU starten
GPU_DEVICE=0 ./start-single.sh
GPU_DEVICE=0 ./start-coding-server.sh
# Stoppen
./stop-servers.sh
./stop-coding-server.sh
# Status prüfen
./status.sh
```
`start-single.sh` startet den Container und wartet bis HTTP-ready (max. 5 Minuten — die
`start-coding-server.sh` startet den Container und wartet bis HTTP-ready (max. 5 Minuten — die
neue llama.cpp-Version prüft beim Start, ob Modell + KV-Cache in den VRAM passen, was
zusätzliche Zeit kostet).
Wenn der Server bereits läuft und du `start-single.sh` aufrufst, wird der laufende
Wenn der Server bereits läuft und du `start-coding-server.sh` aufrufst, wird der laufende
Container zuerst per `docker rm -f` gestoppt und dann neu gestartet — ein laufender
Inference-Request wird dabei abgebrochen.
@ -149,7 +149,7 @@ Inference-Request wird dabei abgebrochen.
| `-n 16384` | 16K | Maximale Ausgabelänge. |
| `--temp 0.2` | — | Deterministisch — Coder-Rolle. Der Judge-System-Prompt gleicht die etwas höhere Temperatur aus. |
| `--parallel 2` | — | 2 Slots, damit pi agent Folgeanfragen schnell hintereinander stellen kann. |
| `--gpus '"device=1"'` | — | Standard: GPU 1. Überschreibbar: `GPU_DEVICE=0 ./start-single.sh`. |
| `--gpus '"device=1"'` | — | Standard: GPU 1. Überschreibbar: `GPU_DEVICE=0 ./start-coding-server.sh`. |
---
@ -184,16 +184,16 @@ dürfen nennenswert VRAM belegen (z. B. TTS-Dienste, Ollama). Prüfen mit:
nvidia-smi --query-gpu=index,memory.used,memory.free --format=csv
```
Falls der VRAM nicht reicht: Kontext in `start-single.sh` auf `131072` oder `65536` reduzieren.
Falls der VRAM nicht reicht: Kontext in `start-coding-server.sh` auf `131072` oder `65536` reduzieren.
### Anpassung für andere GPU-Konfigurationen
```bash
# Andere GPU verwenden:
GPU_DEVICE=0 ./start-single.sh
GPU_DEVICE=0 ./start-coding-server.sh
# 2 GPUs für einen Server (sehr großer Kontext):
# start-single.sh anpassen:
# start-coding-server.sh anpassen:
--gpus '"device=0,1"' \
--tensor-split 0.5,0.5 \
--main-gpu 0 \
@ -253,8 +253,8 @@ und Extension-Guards gegen Regressionen.
| `settings.json` | pi-agent-Settings (Default-Modell, aktivierte Modelle) — wird von Install-Skript deployt |
| `run-tests.sh` | Tests ausführen |
| `tests/` | Testdateien (pure-logic, config, extension-guards, scripts) |
| `start-single.sh` | Single-Server starten (Port 8001, Coder + Judge) |
| `stop-servers.sh` | Container stoppen |
| `start-coding-server.sh` | Single-Server starten (Port 8001, Coder + Judge) |
| `stop-coding-server.sh` | Container stoppen |
| `status.sh` | Laufstatus anzeigen |
| `install_servers_and_pi_coder_extension.sh` | Extension + models.json + settings.json nach `~/.pi/agent/` deployen |
| `examples/` | Demo-Projekte (Python, Rust, Go, C, Bash, HTML/JS) für Live-Demos |