Herramienta 15 — Gratis, sin registro
Cuánto falta para que signifique algo.
Un test z de dos proporciones, en los dos sentidos. Cuántas impresiones por creatividad necesitas para que una diferencia de CTR sea real, y si la que ya tienes lo es.
Planificar el test
Los números de estas casillas son un ejemplo, no tu test. Cámbialos antes de leer nada.
Lo que cuesta la precisión
| Efecto | Tasa objetivo | Por variante | Total | Duración |
|---|
Reducir a la mitad el efecto que quieres detectar multiplica la muestra por cuatro, más o menos. Por eso los tests pequeños sobre mejoras pequeñas no terminan nunca.
Leer un test que ya has hecho
Muestras iguales por variante. Usa la confianza y la lateralidad de arriba.
Por qué mirar antes de tiempo está mal
Cada vez que miras un test en marcha y decides si lo paras, le das al ruido otra oportunidad de cruzar la línea de significación, así que un test revisado a diario produce un «ganador» mucho más a menudo que ese 5 % que promete tu nivel de confianza. Fija el tamaño de muestra antes de empezar, mira una sola vez cuando lo alcances, y si de verdad necesitas parar antes usa un método secuencial pensado para eso en lugar de las matemáticas de horizonte fijo de esta página.
Cómo funciona / advertencias
- Muestra por variante = (zα√(2p̄(1−p̄)) + zβ√(p₁(1−p₁)+p₂(1−p₂)))² ÷ (p₂−p₁)², donde p̄ es la media de las dos tasas.
- zα usa α/2 en el test bilateral, y para Bonferroni α se divide entre el número de comparaciones contra el control.
- El test inverso es el z-test de dos proporciones agrupadas; el intervalo de confianza usa el error estándar sin agrupar, que es el emparejamiento habitual.
- Los cuantiles normales salen de la aproximación racional de Acklam con un refinamiento de Halley. La CDF es un erfc construido sobre las funciones gamma incompletas regularizadas — una serie por debajo del punto de cruce y una fracción continua por encima — y así mantiene su precisión relativa en la cola, que es donde viven los p-valores. Ambas son exactas mucho más allá de los dígitos que se muestran.
- Se supone que las impresiones son independientes. No lo son: el mismo usuario viendo la misma creatividad dos veces es una opinión contada dos veces, y eso hace que los tests reales tengan algo menos de potencia de la que dice esto.
- Una diferencia de CTR significativa no es una diferencia de instalaciones, y desde luego no es una diferencia de retención. Las creatividades que ganan en CTR a veces traen peores jugadores.