Tool 15 — Gratis, keine Anmeldung

Wie lange, bis es etwas bedeutet.

Ein Zwei-Anteile-z-Test, in beide Richtungen. Wie viele Impressions pro Creative du brauchst, bevor ein CTR-Unterschied echt ist — und ob der, den du schon hast, es ist.

Den Test planen

Die Zahlen in diesen Feldern sind ein Beispiel, nicht dein Test. Ersetz sie, bevor du irgendetwas abliest.

CTR, Installationsrate, worum es im Test eben geht.
Nimm zweiseitig, außer es ist dir wirklich egal, ob B schlechter ist.
Kontrolle inklusive, 2 bis 12. Zusätzliche Varianten werden gegen die Kontrolle Bonferroni-korrigiert.

Was Genauigkeit kostet

Stichprobe pro Variante (beide Achsen logarithmisch)
Effekt Zielrate Pro Variante Gesamt Laufzeit

Halbierst du den Effekt, den du nachweisen willst, vervierfacht sich die Stichprobe ungefähr. Genau deshalb werden kleine Tests auf kleine Lifts nie fertig.

Einen Test lesen, den du schon gefahren hast

Gleich große Stichproben pro Variante. Verwendet Konfidenz und Seitigkeit von oben.

z-Statistik
p-Wert
Differenz
Konfidenzintervall

Warum frühes Reinschauen falsch ist

Jedes Mal, wenn du in einen laufenden Test schaust und entscheidest, ob du ihn stoppst, gibst du dem Zufallsrauschen noch eine Chance, über die Signifikanzlinie zu rutschen. Ein täglich kontrollierter Test produziert also weit öfter einen „Gewinner“, als die 5 % versprechen, die dein Konfidenzniveau zusagt. Leg die Stichprobengröße vorher fest, schau einmal hin, wenn du sie erreicht hast, und wenn du wirklich früher abbrechen musst, nimm ein sequenzielles Verfahren statt der Mathematik mit festem Horizont auf dieser Seite.

Wie es rechnet / Einschränkungen

  1. Stichprobe pro Variante = (zα√(2p̄(1−p̄)) + zβ√(p₁(1−p₁)+p₂(1−p₂)))² ÷ (p₂−p₁)², mit p̄ als Mittel der beiden Raten.
  2. zα nutzt α/2 beim zweiseitigen Test, und für Bonferroni wird α durch die Zahl der Vergleiche gegen die Kontrolle geteilt.
  3. Der Rückwärtstest ist der gepoolte z-Test für zwei Anteile; das Konfidenzintervall nutzt den ungepoolten Standardfehler — die übliche Paarung.
  4. Die Normalquantile stammen aus Acklams rationaler Näherung mit einem Halley-Schritt. Die CDF ist ein erfc, gebaut aus den regularisierten unvollständigen Gammafunktionen — unterhalb des Umschaltpunkts eine Reihe, darüber ein Kettenbruch — und behält so ihre relative Genauigkeit tief im Rand, wo die p-Werte leben. Beide sind weit über die angezeigten Stellen hinaus genau.
  5. Impressions gelten als unabhängig. Sind sie nicht: derselbe Nutzer, der dasselbe Creative zweimal sieht, ist eine Meinung, doppelt gezählt — echte Tests haben deshalb etwas weniger Power, als hier steht.
  6. Ein signifikanter CTR-Unterschied ist kein Install-Unterschied und schon gar kein Retention-Unterschied. Creatives, die bei der CTR gewinnen, bringen manchmal die schlechteren Spieler.