Saltar al contenido principal

Calculadora de tamaño de la muestra

Cuántas observaciones necesitas, decidido antes de recoger ninguna. Para dos tasas de conversión o dos medias, con una tabla que muestra lo que te daría realmente un contraste más pequeño y más asequible.

What are you comparing?

Hypothesis direction

Enter what you want to detect

Fixing the sample size before you start is what makes the p-value at the end mean what it claims to mean.

Por qué esto va primero

Todas las demás calculadoras de este sitio son para cuando los datos ya existen. Esta es para antes, y el orden importa más de lo que parece.

Un valor p por debajo de 0.05 promete una tasa de falsos positivos del 5% para un único contraste planificado de antemano. Cada parte de esa frase sostiene peso. Decide tu tamaño de muestra después de ver moverse los números y la promesa se evapora: ya no estás ejecutando un contraste, estás ejecutando uno por cada vistazo e informando del que te favorece. Fijar n por adelantado no es diligencia burocrática: es lo que hace que el valor p final signifique lo que dice.

Los cuatro números

EntradaQué esValor habitual
Base de partidaDónde estás ahoraDe tus propios datos
Efecto mínimo detectableEl cambio más pequeño que merece la penaUna decisión de negocio, no estadística
αTasa de falsos positivos que aceptas0.05
PotenciaProbabilidad de captar un efecto real0.80, o 0.90 cuando perder uno sale caro

La segunda fila es la que la gente falla, normalmente por meter la mejora que espera en lugar de la más pequeña que cambiaría lo que hace. La esperanza infla el efecto, lo que encoge la muestra, lo que produce un contraste demasiado pequeño para detectar lo que realmente pasa. Pregúntate más bien: ¿por debajo de qué mejora no nos molestaríamos en publicar esto? Ese es el número.

Los efectos pequeños son cuadráticamente caros

El tamaño de muestra necesario escala con 1/efecto², lo que tiene consecuencias que casi nadie prevé:

Base → objetivoMejora relativaPor variante
5% → 7.5%50%~1500
5% → 6%20%~8200
5% → 5.5%10%~31 200
5% → 5.25%5%~122 000

Cada vez que el efecto se reduce a la mitad, el tráfico se multiplica aproximadamente por cuatro. Si tu sitio recibe 2000 visitantes por semana y por variante, la segunda fila es un mes y la cuarta bastante más de un año, momento en el que la estacionalidad y los cambios del sitio han contaminado la comparación de todos modos. Saber eso por adelantado es mucho mejor que descubrirlo en la sexta semana.

Lo que te hace un contraste sin potencia

No se limita a no encontrar cosas. Un contraste con un 30% de potencia que sí sale significativo ha sobreestimado el efecto casi por necesidad: solo una fluctuación muestral inusualmente grande podría haber superado el umbral. Así que el hallazgo se replica mal y parece más impresionante que la verdad.

Ese es el mecanismo que hay detrás de buena parte de la crisis de replicación, y se aplica igual a un equipo de marketing que publica un cambio que midió una mejora del 30% y entrega un 4%. La tabla de potencia de los resultados está ahí para que veas lo que estás comprando antes de comprometerte, en lugar de deducirlo después.

La fórmula del tamaño de la muestra

Todas las fórmulas de tamaño muestral de esta página son la misma idea reordenada: el número de observaciones por grupo que hacen falta para que un efecto de un tamaño dado supere el umbral de significación una fracción dada de las veces. El trabajo lo hacen dos cuantiles de la distribución normal: zα, fijado por tu nivel de significación, y zβ, fijado por tu potencia. Con α = 0.05 bilateral y un 80% de potencia son 1.960 y 0.842.

Para dos proporciones, la fórmula estándar de aproximación normal, con la varianza combinada en el término de α y la varianza sin combinar en el de la potencia:

n = (zα√(2p̄(1−p̄)) + zβ√(p₁(1−p₁) + p₂(1−p₂)))² / (p₂ − p₁)²

Para dos medias, la equivalente expresada mediante la d de Cohen, la diferencia de medias dividida entre la desviación estándar combinada:

n = 2(zα + zβ)² / d²

La segunda forma es la que hay que mirar si quieres entender el comportamiento y no solo aplicarlo, porque en ella se ve todo lo que hace caro contrastar. El efecto está en el denominador y está elevado al cuadrado, que es todo el coste cuadrático de más arriba: reduce d a la mitad y n se multiplica por cuatro. La potencia y α entran solo a través de los dos términos z, así que apretarlas sale comparativamente barato: pasar de un 80% a un 90% de potencia sube zβ de 0.842 a 1.282 y la n necesaria en torno a un tercio, no por un factor de cuatro. Cada fórmula da el tamaño de un grupo; dóblalo para el total de los dos.

Ambas son aproximaciones que asumen grupos de igual tamaño y una distribución muestral normal. Son las que usan la mayoría de los manuales y la mayoría de las herramientas de A/B, y se vuelven optimistas cuando la n necesaria es pequeña o las tasas son extremas: la calculadora lo dice cuando el número esperado de conversiones por grupo baja de unas 10. Una vez ejecutado el contraste, la calculadora de pruebas A/B te da el valor p y el intervalo sobre la mejora que realmente observaste.

Preguntas frecuentes

¿Cuántos visitantes necesito para una prueba A/B?

Depende de tu tasa de partida y de la mejora más pequeña que te importe. Detectar un salto del 5% al 6% — una mejora relativa del 20% — necesita unos 8200 visitantes por variante con un 80% de potencia y α = 0.05. Reducir eso a la mitad, hasta una mejora relativa del 10%, requiere en torno a 31 000 por variante. Los efectos pequeños son caros, y el coste sube con el cuadrado de la precisión que quieras.

¿Qué es la potencia estadística?

La probabilidad de detectar un efecto que está realmente ahí. Una potencia del 80% significa que, si tu efecto hipotetizado es real, tienes un 80% de probabilidad de acabar con un resultado significativo, y un 20% de que se te escape. El 80% es convención y no ley; el 90% es habitual en el trabajo clínico, donde pasar por alto un efecto real sale caro.

¿Cuál es la fórmula del tamaño de la muestra?

Para comparar dos medias es n = 2(zα + zβ)² / d², donde d es la d de Cohen y los dos términos z son cuantiles normales fijados por tu nivel de significación y tu potencia: 1.960 y 0.842 con α = 0.05 bilateral y un 80% de potencia. Para dos proporciones se aplica la misma estructura con la varianza combinada en el término de α: n = (zα√(2p̄(1−p̄)) + zβ√(p₁(1−p₁) + p₂(1−p₂)))² / (p₂ − p₁)². Las dos dan el tamaño de un grupo, así que dobla el resultado para el total.

¿Por qué detectar un efecto más pequeño cuesta tantísimo más?

Porque el tamaño de muestra necesario escala con el inverso del cuadrado del efecto. Reducir a la mitad el efecto que quieres detectar cuadruplica las observaciones que necesitas; detectar un tercio requiere nueve veces más. Esto es lo más sorprendente de la planificación de contrastes, y la razón de que el "ejecutémoslo y ya veremos" tienda a producir contrastes sin potencia que no encuentran nada.

¿Puedo parar mi contraste antes si sale significativo?

No, y este es el error más caro que se comete al contrastar. Un valor p de horizonte fijo promete una tasa de falsos positivos del 5% para un contraste planificado de antemano. Comprobarlo a diario durante dos semanas y parar en la primera lectura significativa equivale a ejecutar catorce contrastes e informar del que salió, lo que empuja la tasa real de falsos positivos por encima del 30%. Si necesitas hacer un seguimiento continuo, necesitas un diseño secuencial construido para eso.

¿Y si no puedo conseguir tantas observaciones?

Entonces ejecuta un contraste más pequeño sabiendo lo que te da. La tabla de los resultados muestra la potencia que obtienes con varias fracciones de la muestra ideal. Un contraste con un 40% de potencia no es inútil, pero conviene saber por adelantado que va a pasar por alto el efecto más veces de las que lo encuentre, y que cualquier resultado significativo que llegue a producir probablemente exagerará el tamaño del efecto.

¿Debo usar un contraste unilateral para reducir el tamaño de la muestra?

Solo si un resultado en la dirección contraria fuera a tratarse genuinamente igual que la ausencia de diferencia, y en la mayoría de las pruebas A/B no sería así, porque publicar un cambio que perjudica calladamente la conversión es justo el desenlace que intentas evitar. El contraste unilateral sí reduce la muestra necesaria, pero lo compra renunciando a la capacidad de detectar el daño.