La prueba estándar
Una prueba z de dos proporciones agrupadas, que es lo que la mayoría de plataformas de pruebas A/B reporta por dentro.
Herramientas / Calculadora de significancia estadística
Introduce visitantes y conversiones de ambas variantes. Obtén el valor p, el lift relativo y una respuesta directa sobre si la diferencia es significativa.
z = (p̂B − p̂A) ÷ √( p̄(1 − p̄)(1/nA + 1/nB) )
Introduce valores para ver el resultado
Visitantes que vieron el control y cuántos de ellos convirtieron.
Los mismos dos números para la retadora. Las conversiones no pueden superar a los visitantes.
Obtienes ambas tasas de conversión, el lift relativo, el estadístico z, el valor p y si supera 0.05.
Que la variante B vaya por delante no es lo mismo que que la variante B sea mejor. Esto separa una diferencia real del ruido normal.
Una prueba z de dos proporciones agrupadas, que es lo que la mayoría de plataformas de pruebas A/B reporta por dentro.
Un lift significativo del 0.2% y un lift no significativo del 40% piden decisiones muy distintas. Se muestran ambos números.
El veredicto usa el corte convencional de 0.05 y lo dice, en vez de esconder el valor p tras una insignia.
Compara tasas de registro o de compra entre dos versiones de página.
Comprueba si una diferencia de apertura o de clic es más que ruido.
Compara la tasa de “sí” entre dos formulaciones de la misma pregunta.
z = (p̂_B − p̂_A) ÷ √( p̄(1 − p̄) × (1/n_A + 1/n_B) ) donde p̄ = (x_A + x_B) ÷ (n_A + n_B)
p̄ es la tasa de conversión agrupada de ambas variantes, y se usa porque la hipótesis nula es que las dos tasas son iguales. El valor p es la probabilidad normal de dos colas para esa z.
Usa una prueba z de dos proporciones. Agrupa las tasas de conversión de ambas variantes, calcula el error estándar de la diferencia, divide la diferencia observada entre él y convierte esa z en un valor p de dos colas.
Si p está por debajo de 0.05, la diferencia se llama estadísticamente significativa por convención.
Que una diferencia así de grande sería poco probable si las dos variantes rindieran igual de verdad. No significa que la diferencia sea grande ni que importe comercialmente.
Lee siempre el lift junto al valor p antes de decidir lanzar.
Depende de tu tasa base y del lift más pequeño que merezca detectarse. Detectar un lift relativo pequeño sobre una tasa base baja puede requerir decenas de miles de visitantes por variante.
La calculadora de tamaño de muestra da una cifra de partida para un margen de error objetivo.
No. Mirar repetidamente y parar en el primer resultado verde infla tu tasa de falsos positivos muy por encima del 5%.
Fija el tamaño de muestra de antemano, ejecuta hasta alcanzarlo y lee el resultado una sola vez.
El veredicto usa el nivel estándar del 95%, es decir p < 0.05. El valor p exacto siempre se muestra, así que puedes aplicar un umbral más estricto si tu contexto lo pide.
No tienes evidencia suficiente de que las variantes difieran. Eso no prueba que sean iguales. O sigues hasta una muestra mayor o aceptas que cualquier diferencia real es probablemente demasiado pequeña para perseguirla.
No directamente. Comparar varias variantes a la vez sube la probabilidad de un falso positivo, así que necesitas un ajuste o una prueba ómnibus. La calculadora de chi cuadrado maneja una tabla de conversiones con varias variantes.
No. Todo se ejecuta en tu navegador.
¿Recolectas respuestas de encuesta frescas? Prueba Formms para un formulario con enlace corto y QR.
Formms crea la encuesta desde un prompt, luego puedes pegar los conteos de vuelta en estas calculadoras cuando quieras.
Ver un formulario demo →