Sequenzielles Testen · AGILE
Die AGILE-Methode nach Georgiev: ein gruppensequenzielles Error-Spending-Design mit Kim-DeMets Power-Spending (Efficacy ρ=3 ≈ O'Brien-Fleming, non-binding Futility ρ=2), einseitig, Grenzen konvergieren am Ende. Du darfst legal früh stoppen — für Gewinner und für aussichtslose Tests.
Design
Efficacy- & Futility-Grenzen (kritischer z je Stage)
Obere Kurve = Efficacy (Gewinner-Schwelle), untere = Futility (Aufgabe-Schwelle). Kim-DeMets ρ=3 ist früh sehr streng und lockert spät. Die Grenzen laufen bis zur letzten Analyse zusammen — dort fällt zwingend eine binäre Entscheidung. Rot gestrichelt = naiver fixer Wert.
Bias der gemessenen Wirkung je Stopp-Stage
Achtung Winner's-Curse im Sequenziellen: wer früh für Efficacy stoppt, hat den Effekt fast immer zufällig nach oben verzerrt — Stage 1 überschätzt massiv. Deshalb nutzt AGILE bias-korrigierte Schätzer (Fan-DeMets-Lan) für p-Wert, KI und Punktschätzer, nicht den naiven Wert.
Beispiel-Testverlauf
Ein simulierter Test mit echtem Effekt: die z-Statistik wächst mit den Daten. Kreuzt sie die Efficacy-Grenze → Stopp mit Gewinner, oft weit vor dem geplanten Ende.
Auswertung des Beispiel-Stopps
Naive Werte sind verzerrt — Stopps in frühen Stages überschätzen den Effekt systematisch (siehe Bias-Chart oben). AGILE liefert korrigierte Statistik: stage-wise p-Wert nach Tsiatis-Mehta und bias-reduzierter Punktschätzer.
Bei sehr früh gestoppten Gewinnern ist der korrigierte Effekt oft nur halb so groß wie der naive — das ist die ehrliche Erwartung für den Live-Rollout. Lehre: nie den naiven Stopp-Lift kommunizieren.
Worum es geht
Problem: Wer beim fixen Test wiederholt reinschaut und bei p < 0,05 stoppt, bläht die Fehlalarmrate weit über α auf (siehe Sim 4 · Peeking).
AGILE-Lösung: Plane K Analysen und gib α per Kim-DeMets-Power-Funktion über die Stages aus. Jede Stage bekommt eine eigene Schwelle; die Summe der Fehlalarm-Chancen bleibt exakt α. Zusätzlich eine non-binding Futility-Grenze (β-Spending ρ=2): aussichtslose Tests früh beenden. Beides zusammen senkt die Ø Stichprobe drastisch — besonders bei Null- oder Negativ-Effekten.
Preis: Die maximale Stichprobe steigt leicht (Inflation), um Power und Fehlerraten trotz Stopping zu halten. Ø-Ersparnis dominiert klar.
Implementiert: stage-wise p-Wert (Tsiatis-Mehta), bias-reduzierter Punktschätzer + konditionales KI (Fan-DeMets via Stage-wise-Ordering-Inversion, MC). Vereinfacht: keine Futility-Region in KI-Konstruktion, kein „overshoot"-Adjustment auf der Lift-Skala.