Saltar al contenido principal

Calculadora de significación para pruebas A/B

Introduce los visitantes y las conversiones de cada variante. Esto es una prueba Z de dos proporciones, así que te da el valor p de tus dos proporciones, el intervalo de confianza sobre la mejora real y una respuesta clara sobre lo que el resultado justifica y lo que no.

Variant A (control)

Variant B (treatment)

Hypothesis direction

Enter your test results to begin

You get the p-value, the effect size, and a confidence interval together — because a p-value on its own does not tell you whether the result matters.

Obtener un valor p a partir de dos proporciones

Debajo del envoltorio A/B esto es una prueba Z de dos proporciones, y sirve para cualquier par de proporciones: tasas de conversión y de clics, tasas de defectos, tasas de aprobados, tasas de curación, respuestas de sí/no en una encuesta. Si tus datos son recuentos de éxitos sobre un total, esta es la calculadora adecuada haya o no un experimento de por medio.

Introduce recuentos, no porcentajes. Si lo único que tienes es una tasa, deshaz la cuenta: una tasa de conversión del 4.2% sobre 12 000 visitantes son 504 conversiones. Redondear un porcentaje informado te cuesta aquí muy poco; escribir 4.2 en la casilla de conversiones en lugar de 504 te cuesta la respuesta entera.

El estadístico es:

z = (p₁ − p₂) / √( p̄ (1 − p̄) (1/n₁ + 1/n₂) )

donde p̄ es la proporción combinada: todos los éxitos sobre todos los ensayos. La combinación es deliberada: bajo la hipótesis nula las dos tasas son idénticas, así que la mejor estimación de esa tasa compartida usa las dos muestras a la vez. La z resultante va a la distribución normal estándar, lo que significa que puedes comprobar a mano cualquier resultado de aquí con la calculadora de puntuación Z a valor p.

Dos casos para los que esto no sirve. Si estás contrastando una proporción frente a un objetivo fijo en lugar de dos entre sí, quieres un contraste de una proporción, que esta calculadora no ejecuta, aunque es un paso corto a mano. Con p̂ tu tasa observada, p₀ el objetivo y n tu tamaño de muestra, el estadístico es z = (p̂ − p₀) / √(p₀(1 − p₀) / n); mete esa z en la calculadora de puntuación Z a valor p para obtener el valor p. Y si el número esperado de éxitos en alguna casilla baja de unos 5, la aproximación normal deja de ser fiable: usa en su lugar la prueba exacta de Fisher, y fíjate en el aviso que lanza la calculadora.

El problema de ir mirando

Casi todos los errores en pruebas A/B son una versión del mismo: mirar el panel y parar en cuanto el resultado se pone verde. Parece eficiente. Es la vía más rápida para publicar cambios que no hacen nada.

Un valor p por debajo de 0.05 promete una tasa de falsos positivos del 5% para un único contraste planificado de antemano. Si compruebas el resultado cada día durante dos semanas y paras en la primera lectura significativa, has ejecutado en la práctica catorce contrastes y has informado solo del que salió. La tasa real de falsos positivos sube por encima del 30%.

La solución no es complicada: decide tu tamaño de muestra antes de empezar, ejecuta el contraste hasta el final y mira una sola vez. Si de verdad necesitas hacer un seguimiento continuo, necesitas un método de contraste secuencial diseñado para eso, no un valor p de horizonte fijo consultado una y otra vez.

Una nota sobre cómo se calcula esto

El estadístico de contraste usa el error estándar combinado, que es el correcto bajo la hipótesis nula, donde se asume que ambas tasas son iguales. El intervalo de confianza usa el error estándar sin combinar, que es el correcto para estimar una diferencia que no estás asumiendo que sea cero.

Usar uno para las dos cosas es un fallo muy extendido en las calculadoras A/B, y produce un intervalo de confianza que discrepa de su propio valor p: un intervalo que excluye el cero junto a un resultado no significativo, o al revés. Si alguna vez has visto eso y has supuesto que era un artefacto de redondeo, no lo era.

La significación no es lo mismo que el impacto

Con suficiente tráfico, casi cualquier diferencia acaba siendo estadísticamente significativa. Una mejora de conversión del 5.00% al 5.04% superará p < 0.05 con unos pocos millones de visitantes, y casi con seguridad no compensa el coste de ingeniería de publicarla.

Por eso el intervalo de confianza está junto al valor p en los resultados y no enterrado debajo. El intervalo te dice el rango de mejoras que tus datos respaldan. Si va del +0.1% al +6%, has establecido que la variante probablemente es mejor y no has aprendido casi nada sobre cuánto. Decide qué mejora justificaría de verdad el cambio antes de ejecutar el contraste, y comprueba si el intervalo la supera.

Antes de empezar un contraste

  • Fija el tamaño de la muestra por adelantado. No "hasta que parezca significativo".
  • Decide la mejora mínima que merece publicarse. La significación sin un umbral es un número sin una decisión.
  • Ejecuta semanas completas. El tráfico de un martes no se comporta como el de un domingo; una semana a medias mete un sesgo de fábrica.
  • Contrasta un cambio cada vez, o acepta que no vas a poder atribuir el resultado.
  • Cuenta a cada visitante una vez. Las mediciones repetidas de la misma persona rompen el supuesto de independencia en el que se apoya el contraste.

Preguntas frecuentes

¿Cómo calculo un valor p a partir de dos proporciones?

Usa una prueba Z de dos proporciones, que es lo que ejecuta esta calculadora. Introduce el número de ensayos y el número de éxitos de cada grupo: visitantes y conversiones, o lo que sea equivalente en tus datos. El estadístico es z = (p₁ − p₂) / √(p̄(1 − p̄)(1/n₁ + 1/n₂)), donde p̄ es la proporción combinada de las dos muestras, y el valor p es el área correspondiente de la distribución normal estándar. Introduce recuentos y no porcentajes: una tasa del 4.2% sobre 12 000 visitantes son 504 conversiones.

¿Puedo usar esto para proporciones que no tienen nada que ver con pruebas A/B?

Sí. El contraste subyacente compara dos proporciones cualesquiera: tasas de defectos de dos líneas de producción, tasas de aprobados de dos cohortes, tasas de respuesta a dos envíos, tasas de curación en dos brazos de un ensayo. La etiqueta A/B no es más que el uso más habitual. Los únicos requisitos son que cada observación cuente una vez y caiga en exactamente una de dos categorías, y que los dos grupos sean independientes entre sí.

¿Cómo sé si mi prueba A/B es significativa?

Introduce los visitantes y las conversiones de cada variante. Si el valor p cae por debajo de tu nivel de significación — normalmente 0.05 — la diferencia es estadísticamente significativa. Pero mira el intervalo de confianza antes de actuar: si abarca desde "apenas compensa" hasta "enorme", has detectado un efecto sin medirlo lo bastante bien como para planificar con él.

¿Puedo parar mi contraste en cuanto salga significativo?

No, y este es el error más caro que se comete en pruebas A/B. Comprobar una y otra vez y parar en el primer resultado significativo infla tu tasa de falsos positivos del 5% al 30% o más, porque en la práctica estás ejecutando muchos contrastes e informando solo del que salió. Decide tu tamaño de muestra antes de empezar, y luego ejecútalo hasta ahí.

¿Debo usar un contraste unilateral o bilateral para las pruebas A/B?

Bilateral. De verdad te importa si tu variante rinde peor, no solo si rinde mejor: publicar un cambio que perjudica calladamente la conversión es justo el desenlace que intentas evitar. El contraste unilateral divide tu valor p entre dos sin añadir ninguna evidencia, y por eso gusta a los proveedores y desconfían de él los estadísticos.

¿Qué tamaño de muestra necesito?

Depende de tu tasa de conversión de partida y de la mejora más pequeña que merezca la pena detectar. Detectar una mejora relativa del 10% sobre una base del 5% necesita en torno a 30 000 visitantes por variante con un 80% de potencia. Los efectos más pequeños necesitan muchísimo más tráfico: reducir a la mitad el efecto que quieres detectar cuadruplica la muestra necesaria.

¿Por qué me avisa la calculadora sobre los recuentos pequeños?

La prueba Z de dos proporciones se apoya en una aproximación normal que necesita un número razonable de eventos esperados en cada casilla, en torno a 5 o más. Con recuentos de conversión muy bajos la aproximación se rompe y el valor p deja de ser fiable. En esa situación, la prueba exacta de Fisher da una respuesta de fiar.

Mi contraste no es significativo. ¿Significa que las variantes son idénticas?

No. Significa que no has reunido evidencia suficiente para distinguirlas. Mira el intervalo de confianza sobre la diferencia: si va del −2% al +3%, puedes concluir razonablemente que cualquier efecto real es pequeño. Si va del −8% al +12%, tu contraste simplemente no tenía potencia y la respuesta honesta es que sigues sin saberlo.