Machine Learning · ausführbarer Walkthrough

Mini-Lab: Schwelle, Metriken und Kalibrierung

Ein Standardbibliothek-Skript prüft zwei Confusion Matrices, Fehlerkosten, Brier Loss und Reliability-Bins.

LernempfehlungZuletzt fachlich geprüft: 2026-09-02
Allgemeines Lernbeispiel

Keine APKV-Daten und keine reale Entscheidung. Die Zahlen illustrieren Metriken; Kostenwerte sind didaktische Annahmen, keine fachlichen APKV-Schwellen.

Ziel & Voraussetzungen

Ziel: Zwei mögliche Schwellen anhand von Accuracy, Precision, Recall, Spezifität, F1, Reviewvolumen und einer expliziten Kostenfunktion vergleichen; anschließend Brier Loss und zwei Kalibrierungsbins prüfen.

  • Python 3, ausschließlich Standardbibliothek.
  • Binäre, vollständig gelabelte Teststichprobe; dieselbe Zielpopulation für beide Schwellen.
  • Didaktische Kosten: FN=5, FP=1, Review=0,2 Einheiten.

Ausführen

  1. Skript öffnen oder speichern.
  2. Im Projektstamm python3 labs/ml_evaluation.py ausführen.
  3. FN_COST und REVIEW_COST verändern: Die Metriken bleiben, die Policy-Empfehlung kann wechseln.
precision = tp / (tp + fp)
recall = tp / (tp + fn)
cost = FN_COST*fn + FP_COST*fp + REVIEW_COST*(tp+fp)
brier = sum((p-y)**2 for p, y in zip(probs, labels)) / len(labels)

Erwartetes Ergebnis

Schwelle A: accuracy=0.864, precision=0.400, recall=0.720, specificity=0.880, f1=0.514, reviews=180, cost=284.0
Schwelle B: accuracy=0.920, precision=0.600, recall=0.600, specificity=0.956, f1=0.600, reviews=100, cost=260.0
Always-negative accuracy: 0.900
Brier Loss: 0.050
Bin 0.0-0.5: mean_p=0.200, observed=0.000, n=2
Bin 0.5-1.0: mean_p=0.800, observed=1.000, n=2

Interpretation: B ist unter der angenommenen Kostenfunktion günstiger, obwohl es weniger Positive findet. Die negative Baseline zeigt, warum Accuracy allein unzureichend ist. Zwei Kalibrierungsbins mit je zwei Fällen sind nur eine Rechenkontrolle, keine belastbare Kalibrierungsdiagnose.

Diagnose & Fallstricke

  • Die Kostenannahmen sind Teil der Policy und müssen mit Stakeholdern und Risiken begründet werden.
  • Schwelle nicht am finalen Test optimieren; dafür Validation- oder Out-of-fold-Prognosen nutzen.
  • Bei kleinen Bins ist der beobachtete Anteil hochvariabel; Binningwahl und Unsicherheit zeigen.
  • Das Skript schreibt keine Dateien; Aufräumen ist nicht nötig.

Transferfrage

Welche zusätzliche Evidenz brauchst du, bevor du eine dieser Schwellen in einen echten Workflow überführst – insbesondere zu Labelqualität, Subgruppen, Drift, Kapazität, Fallback und unbeabsichtigten Anreizen?

Belege auf dieser Seite

  1. Metrics and scoring: quantifying the quality of predictions · geprüft 2026-09-02
  2. Probability calibration · geprüft 2026-09-02