Calculadora de intervalos de confianza
Para una media o una proporción, a partir de datos en bruto o de estadísticos resumen. Sin veredicto de significación en lo alto: el rango de valores que tus datos respaldan es el hallazgo, no una nota al pie de otro.
Enter your data to begin
An interval answers the question a p-value cannot: not whether an effect exists, but what range of values your data are actually compatible with.
Result
Confidence interval
Point estimate
Margin of error
What this means
What it does not mean
Report it (APA)
Sobre qué se afirma el "95% de confianza"
Es una afirmación sobre el procedimiento, no sobre este intervalo. Construye intervalos así a partir de muchas muestras y en torno al 95% de ellos contendrán el valor verdadero. Esa es la garantía, y es una garantía real.
Lo que no es es un 95% de probabilidad de que el valor verdadero esté entre los dos números que tienes delante. El valor verdadero está fijo; lo que se mueve es el intervalo. Una vez que has calculado un intervalo concreto, o contiene el valor o no lo contiene, y nada en el marco frecuentista asigna una probabilidad a cuál de las dos cosas. Si quieres la afirmación a la que la gente tiende por instinto — "dados estos datos, hay un 95% de probabilidad de que el valor esté aquí dentro" — eso es un intervalo de credibilidad bayesiano, y necesita una probabilidad previa.
En la práctica los dos suelen aterrizar en sitios parecidos, y por eso la mala lectura persiste sin hacer mucho daño visible. Aun así merece la pena saber cuál de los dos tienes en la mano.
Qué hace ancho a un intervalo
Tres cosas, y solo tres:
- La variabilidad. Datos más ruidosos, intervalo más ancho. No hay nada que hacer salvo medir con más cuidado.
- El tamaño de la muestra. La anchura escala con 1/√n, que es una relación más dura de lo que parece: para reducir la anchura a la mitad necesitas cuatro veces los datos, y para ganar un decimal más de precisión necesitas cien veces más.
- El nivel de confianza. Exigir un 99% en lugar de un 95% ensancha el intervalo en torno a un 30%. Ese es el precio de equivocarse menos veces.
La relación con √n es la que pilla a quienes planifican estudios. Pasar de 100 a 400 observaciones reduce tu intervalo a la mitad; pasar de 400 a 800 apenas lo estrecha. Si necesitas una precisión concreta, calcula el tamaño de la muestra antes de empezar: la calculadora de tamaño de la muestra hace esa aritmética.
Por qué las proporciones llevan el intervalo de Wilson
Casi todos los manuales enseñan el intervalo de Wald para una proporción: p ± z√(p(1−p)/n). Es sencillo, se recuerda bien, y es lo bastante malo como para que los estadísticos lleven décadas argumentando en su contra.
Los fallos son concretos. Su cobertura real cae muy por debajo del nivel nominal cuando p está cerca de 0 o de 1, así que un intervalo de Wald "del 95%" puede acertar bastante menos del 95% de las veces. Produce alegremente límites por debajo de 0 o por encima de 1, que son valores imposibles para una proporción. Y cuando todas las observaciones caen del mismo lado — 0 éxitos de 20, por ejemplo — se colapsa a anchura cero, afirmando certeza perfecta a partir de veinte observaciones.
El intervalo de puntuación de Wilson corrige los tres invirtiendo el contraste de puntuación en lugar de aproximar con la proporción observada. Se queda dentro de [0, 1] por construcción, se mantiene cerca de su cobertura nominal con p extremas, y da una respuesta sensata con 0 de 20: aproximadamente del 0% al 16%. Eso es lo que informa esta calculadora.
El intervalo dice más que el valor p
Para una diferencia, los dos coinciden por construcción: un intervalo del 95% que excluye el cero significa p < 0.05. Pero el intervalo lleva información que el valor p tira.
Piensa en dos estudios que informan ambos de p = 0.04. El primero tiene un intervalo de 0.2 a 14.0; el segundo, de 5.8 a 6.2. Los valores p son idénticos y los hallazgos no se parecen ni de lejos: el primero ha detectado algo sin medirlo, y el segundo lo ha medido con precisión. Informa solo del valor p y esa distinción desaparece.
Lo mismo vale para los resultados nulos, en la dirección que más importa. Un resultado no significativo cuyo intervalo va de −0.05 a +0.06 sí respalda un "ningún efecto relevante". Uno que va de −4 a +9 significa que el estudio no pudo saberlo. Los dos se redactan como "ninguna diferencia significativa", y solo uno de ellos debería.
Preguntas frecuentes
¿Cómo calculo un intervalo de confianza?
Para una media: intervalo = media ± t* × (SD / √n), donde t* es el valor crítico de la distribución t a tu nivel de confianza con n − 1 grados de libertad. Para una proporción, esta calculadora usa el intervalo de puntuación de Wilson en lugar del p ± z√(p(1−p)/n) de manual, porque la versión de manual se porta muy mal cuando la proporción está cerca de 0 o de 1. Pega tus datos o introduce arriba los estadísticos resumen.
¿Qué significa realmente un intervalo de confianza del 95%?
Significa que el procedimiento funciona el 95% de las veces: si repitieras el estudio muchas veces y construyeras un intervalo de la misma forma cada vez, en torno al 95% de esos intervalos contendrían el valor verdadero. No significa que haya un 95% de probabilidad de que este intervalo en concreto lo contenga: el valor verdadero está fijo y es el intervalo el que varía de una muestra a otra.
¿Por qué es tan ancho el intervalo?
Porque no tienes muchos datos, o los datos varían mucho, o las dos cosas. La anchura escala con SD / √n, lo que tiene una consecuencia incómoda: reducir la anchura a la mitad exige cuatro veces la muestra. Un intervalo ancho no es un defecto del cálculo: es un informe fiel de lo poco que fija el estudio, y es justo la información que un valor p esconde.
¿Cuál es la diferencia entre un intervalo de confianza y un margen de error?
El margen de error es la mitad de la anchura del intervalo, la parte del ±. "52.3 con un margen de error de 3.1" y "un intervalo de 49.2 a 55.4" son la misma afirmación. En el periodismo de encuestas se prefiere el margen de error porque es un solo número; resulta menos útil para proporciones cercanas a 0 o a 1, donde el intervalo honrado no es simétrico.
¿Por qué se usa aquí el intervalo de Wilson para las proporciones?
Porque el intervalo de Wald de manual es genuinamente poco fiable. Su cobertura real cae muy por debajo del nivel nominal cuando la proporción está cerca de 0 o de 1, puede producir límites por debajo de 0 o por encima de 1, y se colapsa a anchura cero cuando todas las observaciones caen del mismo lado, afirmando certeza perfecta a partir de 20 observaciones. Wilson no tiene ninguno de esos modos de fallo y no necesita corrección por continuidad. Los estadísticos llevan décadas recomendándolo; la mayoría de las calculadoras siguen enviando Wald porque es el que enseñaron.
¿Un intervalo de confianza que excluye el cero significa que el resultado es significativo?
Para una diferencia, sí: un intervalo del 95% que excluye el cero y un valor p por debajo de 0.05 son la misma afirmación hecha de dos maneras. El intervalo lleva más información, eso sí, porque además te dice el rango de diferencias que tus datos respaldan. Por eso las revistas piden cada vez más el intervalo junto al valor p en lugar de en su lugar.