Saltar al contenido principal

Calculadora de correlación

Pega dos columnas emparejadas para obtener la r de Pearson, su valor p y r², además de un intervalo de confianza sobre la propia correlación, que es el número que te dice con cuánta precisión has medido la relación.

Hypothesis direction

Paste your paired X and Y values

You get the p-value, the effect size, and a confidence interval together — because a p-value on its own does not tell you whether the result matters.

Mantén los pares alineados

Cada fila es una observación medida en dos variables, así que el orden de las dos columnas tiene que coincidir: la tercera X debe ir con la tercera Y. Copiar dos columnas directamente de una hoja de cálculo conserva eso automáticamente; ordenar una columna y la otra no lo destruye en silencio, y la calculadora no tiene forma de detectarlo.

Las dos casillas deben contener por tanto el mismo número de valores. Si no lo hacen, el emparejamiento está roto en algún punto y la calculadora lo dice en lugar de recortar hasta la columna más corta: descartar calladamente la cola produciría una correlación de un conjunto de datos que no tienes.

La fuerza y la significación son preguntas distintas

Este es el error característico con las correlaciones, así que vale la pena exponerlo con números. El valor p pregunta si r se distingue de cero. La propia r pregunta cómo de fuerte es la relación. El tamaño de la muestra manda sobre lo primero y no tiene nada que ver con lo segundo.

nrpVarianza compartida
100.600.06736%
200.440.05219%
1000.200.0464%
10000.070.0270.5%

Todas las filas de la mitad inferior superan p < 0.05 mientras describen una relación más débil que la fila de encima. La fila de arriba describe una relación lo bastante fuerte como para actuar sobre ella y no llega al umbral. Informa siempre de los dos números.

El intervalo sobre r

El intervalo de confianza se calcula mediante la transformación z de Fisher, y por eso no es simétrico alrededor de r: la distribución muestral de una correlación es asimétrica, tanto más cuanto r se acerca a ±1, y un intervalo simétrico se saldría de 1 con correlaciones fuertes.

Es el número más útil del panel, porque muestra lo poco que fija una muestra pequeña. Doce observaciones que dan r = 0.5 producen un intervalo que va aproximadamente de −0.10 a 0.83: los datos son compatibles con que no haya ninguna relación y con que haya una muy fuerte. Ese es un hallazgo distinto de r = 0.5 con n = 200, y el valor p por sí solo no los distinguirá.

Lo que la r de Pearson no puede ver

Mide únicamente la asociación lineal. Una parábola perfecta — una relación tan pulcra como pueda existir — devuelve r ≈ 0. Una relación fuerte en los valores bajos y plana en los altos queda promediada en algo intermedio. Ninguna de las dos aparece en el coeficiente.

También es frágil frente a los valores atípicos. En una muestra de veinte, un solo punto descolgado puede fabricar una correlación de 0.6 a partir de puro ruido, o aplanar una real hasta dejarla en nada. El cuarteto de Anscombe — cuatro conjuntos de datos con medias, varianzas y correlaciones idénticas pero formas completamente distintas — existe justo para señalar esto. Representa tus datos antes de fiarte del número.

Si la relación es monótona pero curva, o los datos son ordinales o muy asimétricos, usa la correlación de rangos de Spearman. Si ya tienes r y solo necesitas el valor p, el conversor de correlación a valor p toma r y n directamente.

Preguntas frecuentes

¿Cómo calculo una correlación a partir de datos en bruto?

Pega tus valores X en una casilla y los valores Y correspondientes en la otra, en el mismo orden. La calculadora obtiene la r de Pearson, la contrasta frente a cero e informa de r² y de un intervalo de confianza sobre r. Las dos columnas tienen que tener el mismo número de valores: cada fila es una observación medida dos veces, y un desajuste significa que el emparejamiento está roto.

¿Qué me dice el valor p sobre una correlación?

Solo si la relación se distingue de cero. No es una medida de fuerza: eso es r. Los dos discrepan con frecuencia: con n = 1000, una r de 0.07 es significativa (p = 0.027) y explica medio punto porcentual de la varianza; con n = 10, una r de 0.60 explica el 36% y no es significativa (p = 0.067). El tamaño de la muestra manda sobre la significación; r manda sobre la importancia.

¿Qué es un buen coeficiente de correlación?

Depende enteramente del campo. En física, una r = 0.9 podría indicar un problema con el aparato; en psicología, una r = 0.3 es un hallazgo sólido; en economía, una r = 0.2 entre dos series macro puede ser relevante. Elevar al cuadrado ayuda a calibrar: r = 0.5 significa que las dos variables comparten el 25% de su varianza y que el 75% es otra cosa.

¿Cuál es la diferencia entre r y r²?

r va de −1 a +1 y lleva la dirección de la relación. r² va de 0 a 1, deja caer el signo y da la proporción de varianza que comparten las dos variables. r² suele ser el número que da que pensar: una correlación de 0.4, que suena respetable, explica el 16% de la variación y deja el 84% sin explicar.

¿Qué supone la r de Pearson?

Que la relación es lineal y que no la está empujando un puñado de puntos. Una parábola perfecta da una r cercana a cero pese a haber una relación determinista, y un solo valor atípico puede crear o destruir una correlación fuerte en una muestra pequeña. Representa tus datos antes de fiarte del coeficiente. Para relaciones monótonas pero curvas, o para datos ordinales y muy asimétricos, la correlación de rangos de Spearman es mejor herramienta.

¿Una correlación significativa significa que una variable causa la otra?

No, y ningún valor p por pequeño que sea cambia eso. Una correlación es compatible con que X cause Y, con que Y cause X, con que una tercera variable cause ambas, con un efecto de selección en cómo se recogieron los datos o con la casualidad. Establecer la causalidad exige un experimento o un diseño que descarte las alternativas: la correlación es donde empieza ese trabajo, no donde termina.