operations_research/bilder_04/erzeuge_predict_vs_optimize.py
dschlueter 0f9c815b86 Grafik-Upgrade Stufe 1: elf neue Diagramme
Grafik_Upgrade.md verlangt "37 didaktisch wertvolle Visualisierungen". Es sind
19: Die Abschnitte "Modul 1-4" wiederholen die Grafiken 1-18 unter den Nummern
19-36, nur Grafik 37 ist zusaetzlich. Belegt an den Skriptnamen - 38
Nennungen, 19 verschiedene Dateien, erzeuge_kombinatorik_wand.py steht dreimal
darin. Von den 19 betreffen neun bereits vorhandene Diagramme.

Umgesetzt sind die zehn wirklich neuen plus eine elfte, die aus einem
Sachfehler des Auftrags entstand: Grafik 14 sollte in Abschnitt 12.3 stehen,
nannte aber Zahlen aus Kapitel 17. Beide Stellen haben jetzt ihre eigene
Grafik mit ihren eigenen Zahlen.

Vier Vorgaben des Auftrags wurden bewusst nicht befolgt: PNG bei 300 dpi (das
Buch kennt nur SVG - die 33 verwaisten PNGs waren gerade erst geloescht
worden), Matplotlib-Standardfarben (die Buchpalette steht in 33 Diagrammen),
harte Kapitelnummern im Fliesstext ({ref:sec:...} stattdessen) und die
fehlende Byte-Reproduzierbarkeit.

Der eigentliche Ertrag waren die Selbsttests. Jeder Generator prueft seine
Zahlen gegen das, was im Kapitel steht, und bricht bei Abweichung ab. Vier
haben angeschlagen:

* Kombinatorik-Wand: 25! ergibt 491,5 Mio. Jahre, die Tabelle nennt 490 Mio. -
  Rundung auf zwei signifikante Stellen, nicht Fehler des Buchs.
* Laufzeit-Diagramm: Die abgedruckte Prozentspalte laesst sich aus den
  abgedruckten Zeiten nicht exakt nachrechnen (0,001/0,008 ergibt 12 %,
  gedruckt sind 14 %) - die Zeiten sind gerundet, die Prozente nicht.
* Predict-then-Optimize: geratene Datenaufteilung ergab 197,35 statt 200,95
  MSE. Mit TRAINING aus dem Buchprogramm stimmen alle vier Kostenwerte.
* Almgren-Chriss: ein echter Fehler im Buchprogramm.

DER FUND: analytische_loesung() minimiert die eigene Kostenfunktion nicht. Ihr
Pfad kostet 10.860,40 EUR, der DP-Pfad 10.266,24 EUR - ein Gitterverfahren
kann das kontinuierliche Optimum aber nicht unterbieten. periodenkosten()
rechnet das Risiko mit lambda/2, die geschlossene Formel setzt
kappa~^2 = lambda*sigma^2*P0^2/eta ohne dieses Halbe. Mit lambda/2 liefert die
Formel 10.264,85 EUR und denselben Pfad wie die DP, knapp UNTER der
Gitterloesung. Die Grafik zeigt bis zur Entscheidung darueber den DP-Pfad; er
ist der, den das Kapitel abdruckt.

Nachweise: Alle elf Diagramme sind ueber zwei Laeufe byte-identisch. Kein
vorhandenes Diagramm wurde veraendert. Die Lastabwurf-Grafik reproduziert die
Befundtabelle exakt (874.870/2.504.154/28 von 40 gegen 351.356/415.924/0).

Zwei Abbildungen landeten beim automatischen Einfuegen im Codeblock (ihre
Anker standen in abgedruckten Ausgaben) und wurden dahinter verschoben; eine
Pruefung ueber alle elf zeigt null Fehlplatzierungen.

Neu: bilder_04/stil_04.py buendelt Palette, rcParams und speichere().
networkx wurde entgegen der Planung nicht gebraucht - pyproject.toml bleibt
unveraendert. PDF von 781 auf 788 Seiten, 44 Diagramme, 27 Generatoren.
Veroeffentlicht: 25 Dateien.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-09-09 01:11:33 +02:00

139 lines
5.6 KiB
Python

#!/usr/bin/env python3
# erzeuge_predict_vs_optimize.py
"""
Erzeugt das Diagramm zum Predict-then-Optimize-Kapitel:
bilder_04/kap_prognose_entscheidungsguete.svg
Vier Verfahren, zwei Massstaebe: links der Prognosefehler (MSE), rechts die
Kosten je Tag. Die Balken sind absichtlich nebeneinander gestellt, denn der
Befund des Kapitels ist genau ihr Auseinanderlaufen: Das Verfahren mit dem
BESTEN MSE hat die HOECHSTEN Kosten.
Ohne Formel gesagt: Der Prognostiker optimiert seinen Fehler, der Planer traegt
die Kosten - und beide messen etwas anderes. Wer die Prognose verbessert, ohne
zu fragen, wofuer sie gebraucht wird, verbessert die falsche Zahl.
Alle Werte kommen aus Predict_then_Optimize.py: dieselben Daten, dieselbe Saat,
dieselben vier Verfahren. pruefe_befund() stellt sicher, dass die Aussage des
Kapitels im Bild auch wirklich zu sehen ist - sonst waere das Bild ein
Widerspruch zum Text daneben.
Aufruf (aus dem Repository-Wurzelverzeichnis):
python3 bilder_04/erzeuge_predict_vs_optimize.py
Benoetigt: numpy, scipy, scikit-learn, matplotlib
"""
from __future__ import annotations
import os
import sys
import numpy as np
HIER = os.path.dirname(os.path.abspath(__file__))
BASIS = os.path.dirname(HIER)
sys.path.insert(0, HIER)
sys.path.insert(0, os.path.join(
BASIS, "Operations_Research_mit_Python_Version_04_Programme"))
from stil_04 import FARBEN, speichere # noqa: E402
import matplotlib.pyplot as plt # noqa: E402
from scipy.stats import norm # noqa: E402
from sklearn.linear_model import LinearRegression, QuantileRegressor # noqa: E402
from Predict_then_Optimize import (KRITISCHES_VERHAELTNIS, TAGE, # noqa: E402
TRAINING, erzeuge_daten, tageskosten)
KURZ = ["Punkt-\nprognose", "+ Zuschlag aus der\nNormalverteilung",
"+ Zuschlag auf\nKosten trainiert", "Quantil-\nregression"]
def rechne() -> list[tuple[str, float, float]]:
"""Dieselben vier Verfahren wie im Buchprogramm."""
merkmale, nachfrage = erzeuge_daten()[:2]
# Dieselbe Aufteilung wie im Buchprogramm - eine selbst gewaehlte Grenze
# ergaebe andere Zahlen als die abgedruckte Tabelle.
lernen = slice(0, TRAINING)
pruefen = slice(TRAINING, TAGE)
kq = LinearRegression().fit(merkmale[lernen], nachfrage[lernen])
punkt = kq.predict(merkmale[pruefen])
rest = nachfrage[lernen] - kq.predict(merkmale[lernen])
pauschal = norm.ppf(KRITISCHES_VERHAELTNIS) * rest.std()
kandidaten = np.linspace(-10.0, 30.0, 401)
trainingsprognose = kq.predict(merkmale[lernen])
kostenzuschlag = float(kandidaten[np.argmin(
[tageskosten(trainingsprognose + z, nachfrage[lernen])
for z in kandidaten])])
quantil = QuantileRegressor(quantile=KRITISCHES_VERHAELTNIS, alpha=0.0,
solver="highs").fit(merkmale[lernen],
nachfrage[lernen])
quantilprognose = quantil.predict(merkmale[pruefen])
verfahren = [
(KURZ[0], punkt, punkt),
(KURZ[1], punkt, punkt + pauschal),
(KURZ[2], punkt, punkt + kostenzuschlag),
(KURZ[3], quantilprognose, quantilprognose),
]
aus = []
for name, prognose, bestellung in verfahren:
mse = float(((prognose - nachfrage[pruefen]) ** 2).mean())
aus.append((name, mse, tageskosten(bestellung, nachfrage[pruefen])))
return aus
def pruefe_befund(werte) -> None:
"""Die Aussage des Kapitels muss im Bild sichtbar sein."""
bester_mse = min(werte, key=lambda z: z[1])
teuerster = max(werte, key=lambda z: z[2])
if bester_mse[0] != teuerster[0]:
raise SystemExit(
f"Predict-then-Optimize-Bild: Das Verfahren mit dem besten MSE "
f"({bester_mse[0].replace(chr(10), ' ')}) ist nicht das teuerste "
f"({teuerster[0].replace(chr(10), ' ')}). Das Kapitel behauptet "
f"genau das - Bild und Text wuerden sich widersprechen.")
def zeichne(werte) -> None:
figur, achsen = plt.subplots(1, 2, figsize=(9.4, 4.4))
namen = [n for n, _, _ in werte]
y = np.arange(len(namen))[::-1]
for achse, index, titel, einheit, farbe in (
(achsen[0], 1, "Prognosefehler (MSE)", "", FARBEN["zweit"]),
(achsen[1], 2, "Kosten je Tag", "", FARBEN["warnung"])):
wert = [w[index] for w in werte]
bester = min(wert)
farben = [FARBEN["gut"] if abs(w - bester) < 1e-9 else farbe
for w in wert]
achse.barh(y, wert, height=0.62, color=farben, zorder=3)
for stelle, w in enumerate(wert):
achse.text(w * 1.01, y[stelle], f"{w:,.2f}{einheit}"
.replace(",", "."), va="center", fontsize=9,
color=FARBEN["text"])
achse.set_yticks(y)
achse.set_yticklabels(namen if index == 1 else [], fontsize=8.5,
color=FARBEN["text"])
achse.set_xlim(0, max(wert) * 1.22)
achse.set_title(titel, fontsize=10.5, color=FARBEN["text"])
achse.grid(axis="y", visible=False)
figur.suptitle("Grün ist jeweils der beste Wert — und es ist nicht "
"dasselbe Verfahren",
fontsize=11, color=FARBEN["text"], y=1.02)
speichere(figur, "kap_prognose_entscheidungsguete")
if __name__ == "__main__":
werte = rechne()
for name, mse, kosten in werte:
print(f" {name.replace(chr(10), ' '):<40} MSE {mse:>8.2f} "
f"Kosten {kosten:>7.2f} EUR")
pruefe_befund(werte)
print(" Befund bestätigt: bester MSE = höchste Kosten.")
zeichne(werte)