Calculadora de pruebas A/B
Significancia estadística para una prueba A/B, con soporte para más de una variante, un intervalo de confianza en la mejora y un planificador de tamaño de muestra.
Resultado de la prueba
Mejor resultado
-
Ingresa los datos de tu prueba
| Grupo | Tasa | Dif. abs. | Mejora rel. | IC del 95 % en dif. | z | Valor p | Resultado |
|---|
Cómo funciona
Una calculadora de significancia para pruebas A/B determina si la diferencia en las tasas de conversión entre un control y una o más variantes es estadísticamente real y no solo producto del azar, mediante una prueba z de dos proporciones. El planificador de tamaño de muestra calcula cuántos visitantes necesita una prueba antes de ejecutarla.
- Ingresa tus datos
Visitantes y conversiones para el control, luego cada variante que probaste.
- Elige un nivel de confianza
El 95 % es el valor predeterminado habitual. Agrega una segunda o tercera variante si probaste más de una.
- Lee el valor p
Un valor por debajo de tu umbral de significancia indica que es poco probable que la diferencia se deba al azar.
La prueba z de dos proporciones
z = (tasa(variante) − tasa(control)) / √(agrupada × (1−agrupada) × (1/n(control) + 1/n(variante)))
La tasa agrupada es el total de conversiones dividido por el total de visitantes en ambos grupos. El valor p proviene de la distribución normal estándar: una prueba de dos colas verifica una diferencia en cualquier dirección, mientras que una prueba de una cola solo verifica una mejora. Un valor p por debajo de tu umbral de significancia, 0,05 al 95 % de confianza, significa que es poco probable que el resultado sea producto del azar.
Tamaño de muestra, antes de ejecutar la prueba
n = (z(confianza) + z(potencia))² × (p1(1−p1) + p2(1−p2)) / (p2 − p1)²
p1 es la tasa base y p2 la tasa que deseas detectar. Planificar con anticipación evita el sesgo de observación, es decir, detener una prueba antes de tiempo porque parece significativa, lo cual infla los falsos positivos. Un efecto mínimo detectable más pequeño o un nivel de confianza más alto requieren una muestra mayor.
Antes de declarar un ganador
Ejecuta la prueba durante al menos un ciclo comercial completo, generalmente de una a dos semanas, para capturar la variación por día de la semana, incluso si la significancia aparece antes. Cada grupo generalmente necesita al menos 100 conversiones para obtener un resultado confiable. Un resultado estadísticamente significativo no garantiza que la mejora se mantenga tras el lanzamiento, solo indica que es poco probable que sea ruido aleatorio en estos datos.
Preguntas frecuentes
¿Qué significa significancia estadística en una prueba A/B?
La significancia estadística significa que es poco probable que la diferencia observada en las tasas de conversión entre el control y una variante se deba al azar. Con un 95 % de confianza, un valor p inferior a 0,05 indica que solo hay un 5 % de probabilidad de que el resultado sea una casualidad. Esto no garantiza que la mejora se mantenga en producción, solo que existe suficiente evidencia estadística para actuar según el resultado con una confianza razonable.
¿Cuántas conversiones necesito para alcanzar significancia en una prueba A/B?
No existe un número único: depende de la tasa de conversión base y del tamaño del aumento que deseas detectar. Como regla general, cada grupo necesita al menos 100 conversiones, e idealmente varios cientos, para obtener un resultado confiable. Usa el modo Planificar tamaño de muestra: ingresa la tasa base y el efecto mínimo detectable para obtener la cantidad exacta de visitantes necesaria por grupo antes de iniciar la prueba.
¿Qué es un valor p en una prueba A/B?
El valor p es la probabilidad de que la diferencia observada, o una mayor, ocurra si en realidad no hay ninguna diferencia real entre los grupos. Un valor p de 0,03 significa que solo hay un 3 % de probabilidad de que el resultado se deba a variaciones aleatorias. La mayoría de los equipos usa un umbral de p inferior a 0,05, confianza del 95 %, antes de declarar un ganador, aunque una decisión de alto riesgo puede requerir un p inferior a 0,01, confianza del 99 %.
¿Es lo mismo la significancia estadística que el tamaño de la muestra?
No. La significancia estadística es un resultado, el valor p, que depende de los datos reales recopilados. El tamaño de la muestra es un dato de planificación que controla qué tan sensible es una prueba para detectar un aumento determinado. Ejecutar una prueba hasta alcanzar significancia sin planificar previamente el tamaño de la muestra puede provocar un sesgo de observación, detener una prueba antes de tiempo porque los resultados parecen significativos por azar, lo cual infla la tasa de falsos positivos.
¿Puedo comparar más de una variante con el control al mismo tiempo?
Sí. Agrega hasta cuatro variantes y cada una se prueba contra el control con su propia prueba z, intervalo de confianza y valor p, para que puedas ver todos los resultados uno al lado del otro. Probar varias variantes a la vez aumenta la probabilidad de que una parezca significativa por pura suerte, así que trata un resultado límite entre muchas variantes con precaución adicional y considera volver a probarlo por separado.