Statistik · ausführbarer Walkthrough

Mini-Lab: A/B-Wirkung und Holm prüfen

Ein reines Python-Lab reproduziert Ratendifferenz, Wald-Intervall, z-Test und Holm-Entscheidungen ohne Fremdpakete.

LernempfehlungZuletzt fachlich geprüft: 2026-09-02
Allgemeines Lernbeispiel

Keine APKV-Daten und kein realer Rollout. Das Lab prüft Rechenwege eines großen Zwei-Gruppen-Beispiels. Wald-Näherungen können bei kleinen Zellen oder extremen Raten schlecht sein.

Ziel & Voraussetzungen

Ziel: Für A=120/400 und B=148/400 absolute und relative Wirkung, ungepooltes 95%-Wald-Intervall, gepoolten z-Test und Holm-Entscheidungen reproduzieren.

  • Python 3; ausschließlich Standardbibliothek.
  • Unabhängige experimentelle Einheiten, genau eine Beobachtung je Einheit.
  • Zweiseitiger Test; Normalnäherung aufgrund ausreichend großer erwarteter Zellen.

Ausführen

  1. Skript öffnen oder speichern.
  2. Im Projektstamm python3 labs/ab_experiment.py ausführen.
  3. Die Mindestwirkung im Skript von 0,04 auf 0,00 ändern und beobachten: Evidenz und Entscheidungskriterium sind nicht dasselbe.
risk_difference = p_b - p_a
se_ci = sqrt(p_a*(1-p_a)/n_a + p_b*(1-p_b)/n_b)
z = risk_difference / se_h0
p_value = erfc(abs(z) / sqrt(2))

Erwartetes Ergebnis

A-Rate: 0.3000
B-Rate: 0.3700
Absolute Differenz: 0.0700
Risk Ratio: 1.2333
95%-Wald-KI: [0.0048, 0.1352]
z: 2.0974
p (zweiseitig): 0.0360
Rollout-Kriterium KI-Untergrenze > 0.04: nein
Holm verworfen: metric-1, metric-2

Interpretation: Das Ergebnis ist unter dem z-Test bei 5% signifikant, aber die untere Intervallgrenze liegt unter der vorab gesetzten Mindestwirkung. Die ASA empfiehlt, Entscheidungen nicht allein von einer p-Wert-Schwelle abhängig zu machen.[1]

Diagnose & Fallstricke

  • Das Wald-Intervall ist eine Näherung; bei kleinen Zellen geeignetere exakte oder score-basierte Verfahren prüfen.
  • Bei Nutzern mit mehreren Zeilen auf Nutzerebene aggregieren oder Abhängigkeit modellieren.
  • Holm nur auf eine fachlich definierte Hypothesenfamilie anwenden; sortierte p-Werte müssen zu ihren IDs zurückgeführt werden.
  • Das Skript prüft keine Randomisierung, Missingness, Spillover, Guardrails oder externe Übertragbarkeit.
  • Aufräumen ist nicht nötig: Das Skript schreibt keine Dateien.

Transferfrage

Welche Empfehlung ändert sich, wenn +4 Prozentpunkte nur ein Planungswert, aber keine harte Rollout-Schwelle waren? Trenne Evidenz, Entscheidungspolitik und Wert der nächsten Information.

Belege auf dieser Seite

  1. ASA Statement on Statistical Significance and P-Values · geprüft 2026-09-02
  2. Bonferroni's method · geprüft 2026-09-02
  3. A Simple Sequentially Rejective Multiple Test Procedure · geprüft 2026-09-02