Outil 15 — Gratuit, sans inscription

Combien de temps avant que ça veuille dire quelque chose.

Un test z sur deux proportions, dans les deux sens. Combien d’impressions par créa il te faut avant qu’un écart de CTR soit réel, et si celui que tu as déjà l’est.

Préparer le test

Les nombres dans ces champs sont un exemple, pas ton test. Remplace-les avant de lire quoi que ce soit.

CTR, taux d’installation, ce que le test mesure.
Reste en bilatéral, sauf si tu te fiches vraiment de savoir que B est pire.
Contrôle compris, de 2 à 12. Les variantes en plus sont corrigées par Bonferroni contre le contrôle.

Le prix de la précision

Échantillon par variante (échelle log sur les deux axes)
Effet Taux visé Par variante Total Durée

Diviser par deux l’effet que tu veux détecter multiplie l’échantillon par quatre, à peu près. C’est toute la raison pour laquelle les petits tests sur de petits gains ne finissent jamais.

Lire un test que tu as déjà fait tourner

Échantillons égaux par variante. Utilise la confiance et la latéralité réglées plus haut.

Statistique z
Valeur p
Écart
Intervalle de confiance

Pourquoi regarder trop tôt est une erreur

Chaque fois que tu regardes un test en cours et que tu décides de l’arrêter ou non, tu redonnes au bruit aléatoire une chance de franchir la ligne de significativité ; un test consulté tous les jours produira donc un « gagnant » bien plus souvent que les 5 % promis par ton niveau de confiance. Fixe la taille d’échantillon avant de commencer, regarde une fois quand tu l’atteins, et si tu dois vraiment t’arrêter en route, utilise une méthode séquentielle prévue pour ça plutôt que les maths à horizon fixe de cette page.

Comment ça marche / limites

  1. Échantillon par variante = (zα√(2p̄(1−p̄)) + zβ√(p₁(1−p₁)+p₂(1−p₂)))² ÷ (p₂−p₁)², où p̄ est la moyenne des deux taux.
  2. zα utilise α/2 pour un test bilatéral, et α est divisé par le nombre de comparaisons contre le contrôle pour Bonferroni.
  3. Le test inverse est le z-test poolé sur deux proportions ; l’intervalle de confiance, lui, utilise l’erreur type non poolée, comme le veut l’usage.
  4. Les quantiles normaux viennent de l’approximation rationnelle d’Acklam, affinée par une étape de Halley. La CDF, elle, est un erfc construit sur les fonctions gamma incomplètes régularisées — une série en dessous du point de bascule, une fraction continue au-dessus — ce qui lui garde sa précision relative loin dans la queue, là où vivent les p-values. Les deux sont exactes bien au-delà des chiffres affichés.
  5. Les impressions sont supposées indépendantes. Elles ne le sont pas : le même joueur qui voit deux fois la même créa, c’est un avis compté deux fois, ce qui rend les vrais tests un peu moins puissants que ce qui est écrit ici.
  6. Un écart de CTR significatif n’est pas un écart d’installations, et encore moins un écart de rétention. Les créas qui gagnent au CTR ramènent parfois de moins bons joueurs.