Saltar al contenido principal

Calculadora de chi-cuadrado

Escribe una tabla de contingencia directamente — de 2×2 hasta 5×5 — o pega una desde una hoja de cálculo. Obtienes el valor p, las frecuencias esperadas con las que se calculó y la V de Cramér, porque un estadístico chi-cuadrado por sí solo no te dice nada sobre la fuerza de la asociación.

Table size

Observed counts
C1
C2
C3
C4
C5
R1
R2
R3
R4
R5

El chi-cuadrado es siempre de cola derecha — cualquier discrepancia entre las frecuencias observadas y las esperadas empuja χ² hacia arriba, así que no hay ninguna dirección que elegir. Por qué.

Fill in your table to begin

You get the p-value, the expected counts behind it, and Cramér’s V — because χ² grows with sample size and says nothing on its own about how strong the association is.

Qué pregunta este contraste

Una tabla de contingencia cruza dos variables categóricas: tratamiento contra resultado, canal contra conversión, región contra preferencia. El contraste de independencia de chi-cuadrado le hace una sola pregunta: ¿están relacionadas las dos variables, o una tabla como esta aparecería igualmente si no lo estuvieran?

La maquinaria es más simple de lo que parece. Los totales de tus filas y columnas implican lo que tendría cada casilla si las variables no estuvieran relacionadas: esa es la frecuencia esperada, el total de la fila por el total de la columna dividido entre el total general. El chi-cuadrado suma la distancia al cuadrado entre lo observado y lo esperado, escalada por lo esperado, en todas las casillas. Un total grande significa que tu tabla no se parece a la tabla independiente.

Introducir tu tabla

Introduce recuentos, nunca porcentajes ni promedios. Esto hace tropezar a la gente más que ninguna otra cosa de aquí: una tabla de porcentajes de fila que sumen 100 producirá un estadístico chi-cuadrado, y carecerá de sentido, porque toda la noción de evidencia del contraste es cuántas observaciones hay detrás de cada proporción. Si tienes porcentajes, multiplícalos antes por los tamaños de grupo.

La casilla de pegado acepta una tabla copiada directamente de Excel, de Google Sheets o de un CSV. Los tabuladores, las comas y los puntos y comas funcionan todos como separadores, y la cuadrícula se redimensiona sola para ajustarse a lo que hayas pegado. Las filas desiguales se rechazan en lugar de rellenarse con ceros: una casilla que faltara y se rellenara en silencio con un 0 cambiaría todas las frecuencias esperadas de su fila y de su columna.

Cada observación tiene que caer en exactamente una casilla, y las casillas tienen que ser independientes entre sí. Medir a las mismas personas dos veces — antes y después — rompe ese supuesto, y el contraste adecuado ahí es el de McNemar y no este.

2×2, 3×3 y mayores

El tamaño de la tabla cambia dos cosas: los grados de libertad, (filas − 1) × (columnas − 1), y qué puedes informar razonablemente como efecto.

TabladfMedida de efecto natural
2 × 21Diferencia de proporciones, odds ratio, phi
2 × 3, 3 × 22V de Cramér
3 × 34V de Cramér
4 × 49V de Cramér
5 × 516V de Cramér

Solo el caso 2 × 2 tiene una única diferencia a la que merezca la pena ponerle un intervalo de confianza, así que ese es el único caso en que esta calculadora muestra uno. Para cualquier tabla mayor, el panel de estimación lo dice en lugar de inventarse un número: una tabla 4 × 4 significativa te dice que las variables están relacionadas en algún sitio, y averiguar dónde pasa por mirar qué casillas más aportaron al total, no una sola cifra de resumen.

Lee la tabla de esperadas

Las frecuencias esperadas se imprimen con cada resultado, y merecen un momento de tu atención en lugar de que pases de largo. Son la hipótesis nula hecha concreta: la tabla que habrías obtenido si no estuviera pasando nada.

También cargan con el único supuesto real del contraste. La distribución chi-cuadrado aproxima bien la verdadera distribución muestral del estadístico cuando las frecuencias esperadas son saludables, y mal cuando no lo son: el suelo convencional es 5 en cada casilla. Cualquier casilla por debajo se resalta. Fíjate en que esto va de las frecuencias esperadas, no de las observadas: una casilla con cero observaciones está perfectamente bien si su frecuencia esperada es holgada.

La significación no es fuerza

Este es el modo de fallo propio del chi-cuadrado, y vale la pena decirlo sin rodeos: χ² escala con el tamaño de la muestra. Toma un reparto de 55/45 frente a 45/55. Con n = 100 da χ²(1) = 1.02 y p = 0.31, nada que informar. Con n = 2000 ese mismo reparto da χ²(1) = 20.0 y p < 0.001, abrumador. El mismo patrón, la misma importancia práctica, veredictos opuestos.

Por eso la V de Cramér está aquí junto al valor p. La V vuelve a dividir por el tamaño de la muestra, así que se queda quieta a medida que n crece: las dos tablas de arriba dan V = 0.10, una asociación pequeña, que es la descripción honrada de ambas. Lee el valor p para saber si la asociación es real y la V para saber si vale algo.

Y mira los porcentajes. Una tabla 2 × 2 de recuentos es difícil de leer directamente; esa misma tabla expresada en porcentajes de fila suele hacer evidente el hallazgo de una forma que ningún estadístico de resumen consigue.

¿Ya tienes el estadístico?

Si tu software te ha dado un valor de chi-cuadrado y sus grados de libertad, no necesitas volver a meter la tabla: el conversor de chi-cuadrado a valor p toma el estadístico directamente. Esa página cubre además los contrastes de bondad de ajuste, los de razón de verosimilitudes y el de McNemar, que producen todos un estadístico chi-cuadrado pero no una tabla de contingencia que escribirías aquí.

Preguntas frecuentes

¿Cómo obtengo un valor p de una tabla de 2 por 2?

Introduce arriba los cuatro recuentos. La calculadora obtiene la frecuencia esperada de cada casilla bajo independencia, suma las desviaciones al cuadrado para conseguir el estadístico chi-cuadrado y lee el área de la cola derecha de la distribución chi-cuadrado con 1 grado de libertad. Esa área es tu valor p. También informa de la diferencia de proporciones con un intervalo de confianza, que es el número que te dice si la asociación es lo bastante grande como para importar.

¿Cuáles son los grados de libertad de una tabla de contingencia?

df = (filas − 1) × (columnas − 1). Una tabla 2 × 2 tiene df = 1, una 3 × 3 tiene df = 4 y una 5 × 5 tiene df = 16. El tamaño de la muestra no entra nunca en el cálculo: si te ves usando n, tienes la fórmula equivocada. La calculadora muestra los df del tamaño de tabla actual junto a la cuadrícula.

¿Y si mis frecuencias esperadas están por debajo de 5?

La distribución chi-cuadrado es una aproximación a la verdadera distribución muestral del estadístico, y se degrada cuando las frecuencias esperadas se hacen pequeñas. La regla habitual es que toda frecuencia esperada debería ser al menos 5. La calculadora imprime la tabla de esperadas completa y resalta cualquier casilla que se quede corta. Para una tabla 2 × 2, la prueba exacta de Fisher da una respuesta de fiar con cualquier tamaño; para tablas mayores, fusionar categorías escasas es la solución habitual cuando tiene sentido de fondo.

¿Debo aplicar la corrección de continuidad de Yates?

Esta calculadora no la aplica, y casi todo el consejo moderno coincide. La corrección de Yates se diseñó para que la aproximación chi-cuadrado coincidiera con la prueba exacta de Fisher en una tabla 2 × 2, pero se pasa de frenada: es marcadamente conservadora, produce valores p demasiado grandes y cuesta potencia real. Si tus recuentos son lo bastante pequeños como para que la corrección parezca necesaria, ejecuta la prueba exacta de Fisher en lugar de aproximar una aproximación.

¿Qué es la V de Cramér y por qué se muestra?

Mide la fuerza de la asociación en una escala de 0 a 1, y se muestra porque el chi-cuadrado por sí solo no puede. El estadístico chi-cuadrado crece con el tamaño de la muestra, así que el mismo reparto porcentual da χ²(1) = 1.02 con n = 100 y χ²(1) = 20.0 con n = 2000: insignificante y luego abrumador, para un patrón idéntico. La V vuelve a dividir por eso. Sus referencias cambian según la dimensión menor de la tabla, cosa que la calculadora tiene en cuenta.

¿Esto es un contraste de independencia o de bondad de ajuste?

De independencia. Pregunta si la variable de las filas y la de las columnas están relacionadas, usando los totales de filas y columnas para deducir qué aspecto tendría la tabla si no lo estuvieran. Un contraste de bondad de ajuste compara una sola fila de recuentos observados con unas frecuencias esperadas que aportas tú, y tiene df = categorías − 1. Si ya tienes el estadístico chi-cuadrado de cualquiera de los dos, el conversor de chi-cuadrado a valor p termina el trabajo.