Keine APKV-Daten und keine reale Entscheidung. Die Zahlen illustrieren Metriken; Kostenwerte sind didaktische Annahmen, keine fachlichen APKV-Schwellen.
Ziel & Voraussetzungen
Ziel: Zwei mögliche Schwellen anhand von Accuracy, Precision, Recall, Spezifität, F1, Reviewvolumen und einer expliziten Kostenfunktion vergleichen; anschließend Brier Loss und zwei Kalibrierungsbins prüfen.
- Python 3, ausschließlich Standardbibliothek.
- Binäre, vollständig gelabelte Teststichprobe; dieselbe Zielpopulation für beide Schwellen.
- Didaktische Kosten: FN=5, FP=1, Review=0,2 Einheiten.
Ausführen
- Skript öffnen oder speichern.
- Im Projektstamm
python3 labs/ml_evaluation.pyausführen. FN_COSTundREVIEW_COSTverändern: Die Metriken bleiben, die Policy-Empfehlung kann wechseln.
precision = tp / (tp + fp)
recall = tp / (tp + fn)
cost = FN_COST*fn + FP_COST*fp + REVIEW_COST*(tp+fp)
brier = sum((p-y)**2 for p, y in zip(probs, labels)) / len(labels)Erwartetes Ergebnis
Schwelle A: accuracy=0.864, precision=0.400, recall=0.720, specificity=0.880, f1=0.514, reviews=180, cost=284.0
Schwelle B: accuracy=0.920, precision=0.600, recall=0.600, specificity=0.956, f1=0.600, reviews=100, cost=260.0
Always-negative accuracy: 0.900
Brier Loss: 0.050
Bin 0.0-0.5: mean_p=0.200, observed=0.000, n=2
Bin 0.5-1.0: mean_p=0.800, observed=1.000, n=2Interpretation: B ist unter der angenommenen Kostenfunktion günstiger, obwohl es weniger Positive findet. Die negative Baseline zeigt, warum Accuracy allein unzureichend ist. Zwei Kalibrierungsbins mit je zwei Fällen sind nur eine Rechenkontrolle, keine belastbare Kalibrierungsdiagnose.
Diagnose & Fallstricke
- Die Kostenannahmen sind Teil der Policy und müssen mit Stakeholdern und Risiken begründet werden.
- Schwelle nicht am finalen Test optimieren; dafür Validation- oder Out-of-fold-Prognosen nutzen.
- Bei kleinen Bins ist der beobachtete Anteil hochvariabel; Binningwahl und Unsicherheit zeigen.
- Das Skript schreibt keine Dateien; Aufräumen ist nicht nötig.
Transferfrage
Welche zusätzliche Evidenz brauchst du, bevor du eine dieser Schwellen in einen echten Workflow überführst – insbesondere zu Labelqualität, Subgruppen, Drift, Kapazität, Fallback und unbeabsichtigten Anreizen?
Belege auf dieser Seite
- Metrics and scoring: quantifying the quality of predictions · geprüft 2026-09-02
- Probability calibration · geprüft 2026-09-02