Calculadora de ANOVA de un factor
Pega de dos a seis grupos de valores en bruto. Obtienes el estadístico F, su valor p exacto, η² y las medias por grupo, porque una F ómnibus te dice que algo difiere, y las medias son por donde se empieza a averiguar el qué.
Paste each group to begin
You get the F-statistic, its p-value, η², and a per-group summary — because an omnibus F tells you that something differs, not what.
Results
P-value
Estimate
Effect size
Group summaries
Where the difference actually is. F says only that at least one of these means is out of line — comparing them here is the first step towards knowing which.
What this means
What it does not mean
Report it (APA)
¿Por qué no hacer simplemente pruebas t?
Porque los errores se acumulan. Cada contraste con α = 0.05 arrastra su propio riesgo del 5% de falso positivo, y comparar todos los pares de grupos significa ejecutar muchos contrastes. Tres grupos dan tres comparaciones y en torno a un 14% de probabilidad de al menos un falso positivo. Cinco grupos dan diez comparaciones y cerca del 40%. Seis dan quince y algo más de la mitad.
El ANOVA sustituye todos ellos por una sola pregunta — ¿hay alguna diferencia entre estos grupos? — respondida con la tasa de error que realmente elegiste. Esa es toda la razón de que exista. No es una prueba t más potente; es una forma de preguntar una vez en lugar de muchas.
Qué está midiendo la F
La F es un cociente de dos estimaciones de la varianza. El numerador mide cuánto se separan las medias de grupo de la media general; el denominador mide cuánto se dispersan las observaciones dentro de sus propios grupos.
F = (varianza entre grupos) / (varianza dentro de los grupos)
Si todos los grupos procedieran de la misma población, ambos números estimarían lo mismo y su cociente rondaría el 1. Una F grande significa que las medias están más separadas de lo que el ruido interno de los grupos puede explicar. Ese planteamiento explica también por qué el contraste es siempre de cola derecha: una F cercana a cero significa que los grupos se parecen, que es exactamente lo que predice la hipótesis nula.
El problema del contraste ómnibus
Una F significativa establece que al menos un grupo difiere de los demás. No dice cuál, no dice cuántos y no dice por cuánto. Esto es una propiedad del contraste, no una carencia de ninguna calculadora en concreto, y por eso esta no muestra una estimación única del efecto ni un intervalo, y en su lugar imprime las medias de grupo.
El paso siguiente correcto es un procedimiento post hoc: la HSD de Tukey para todas las comparaciones por parejas, la de Dunnett si estás comparando varios tratamientos contra un control, o pruebas t con corrección de Bonferroni si solo te importan unos pocos pares concretos decididos de antemano. Lo que no debes hacer es ejecutar pruebas t por parejas sin ajustar después del ANOVA: eso restablece exactamente la inflación del error de la que el ANOVA te estaba protegiendo.
Informa de η² junto al valor p
La eta cuadrado es la parte de la varianza total que queda entre los grupos. Responde a la pregunta que la F no puede: no "¿hay una diferencia?", sino "¿qué parte de lo que estoy midiendo explica la pertenencia al grupo?".
Los dos números divergen deprisa con el tamaño de la muestra. Seis grupos de 500 detectarán una diferencia que explica el 1% de la varianza con p < 0.001, y ese hallazgo es real y casi con seguridad inútil. Las referencias convencionales sitúan una η² de 0.01 como pequeña, 0.06 como mediana y 0.14 como grande, aunque, como con todas esas etiquetas, la respuesta honesta depende de tu campo.
Los supuestos, por orden de importancia
- Independencia. Cada observación pertenece a un grupo y no depende de ninguna otra. Las medidas repetidas sobre los mismos sujetos rompen esto y necesitan en su lugar un ANOVA de medidas repetidas. Este es el supuesto que no puedes reparar a posteriori.
- Igualdad de varianzas. Importa sobre todo cuando los tamaños de grupo son desiguales. La calculadora avisa cuando la SD del grupo mayor supera el doble de la del menor; el ANOVA de Welch es la solución.
- Normalidad de los residuos. El más citado y el menos crítico de los tres. Con grupos por encima de unos 30, el teorema central del límite te sostiene. La asimetría acusada o los valores atípicos claros en grupos pequeños son el riesgo de verdad, y la prueba de Kruskal-Wallis es la alternativa.
Si ya tienes un estadístico F salido de un software y solo necesitas el valor p, la calculadora de puntuación F a valor p lo toma directamente. Para dos grupos en lugar de tres o más, usa la calculadora de prueba t, y fíjate en que coinciden exactamente, ya que F(1, df) = t(df)².
Preguntas frecuentes
¿Cuándo debo usar un ANOVA en lugar de pruebas t?
Siempre que estés comparando tres medias de grupo o más a la vez. Ejecutar en su lugar todas las pruebas t por parejas infla mucho tu tasa de falsos positivos: con cinco grupos hay diez comparaciones, y con α = 0.05 la probabilidad de al menos un resultado "significativo" espurio ronda el 40%. El ANOVA hace una sola pregunta — ¿hay algún grupo distinto? — con la tasa de error que elegiste.
Mi ANOVA es significativo. ¿Qué grupos difieren?
El contraste F no puede decírtelo, y eso es una limitación real y no una carencia de esta calculadora. Es un contraste ómnibus: solo establece que al menos una media de grupo se sale de la línea de las demás. Para averiguar dónde, ejecuta comparaciones post hoc como la HSD de Tukey, que controlan la tasa de error en toda la familia de contrastes por parejas. La tabla de resumen por grupo de arriba es el sitio por donde empezar a mirar.
¿Qué es la eta cuadrado?
La proporción de la varianza total que queda entre los grupos y no dentro de ellos: el equivalente en ANOVA de la r². Una η² de 0.15 significa que el 15% de la variación de tu resultado se explica por la pertenencia al grupo y el 85% no. Es lo que te dice si una F significativa importa: con datos suficientes, una diferencia entre grupos demasiado pequeña como para actuar sobre ella superará igualmente p < 0.05.
¿Qué supuestos hace el ANOVA de un factor?
Tres. Que las observaciones son independientes; que los residuos son aproximadamente normales; y que los grupos tienen varianzas parecidas. El primero es el que no puedes arreglar después. La normalidad importa menos a medida que crecen los tamaños de grupo, gracias al teorema central del límite. Las varianzas desiguales importan sobre todo cuando los tamaños de grupo también lo son: la calculadora lo señala cuando la SD del grupo mayor supera el doble de la del menor.
¿Y si las varianzas de mis grupos son muy distintas?
Usa el ANOVA de Welch, que prescinde del supuesto de igualdad de varianzas igual que hace la prueba t de Welch, o una prueba de Kruskal-Wallis si los datos son además muy poco normales. El ANOVA de un factor clásico es razonablemente robusto cuando los tamaños de grupo son iguales y cada vez menos fiable cuando no lo son: varianzas desiguales más n desiguales es la combinación que produce valores p genuinamente engañosos.
¿Mis grupos necesitan el mismo número de observaciones?
No. Los diseños desequilibrados están bien y el ANOVA de un factor los maneja directamente. El equilibrio importa de forma indirecta, eso sí: con tamaños de grupo iguales el contraste tolera bien las varianzas desiguales, y con tamaños desiguales no. Si tus grupos difieren mucho en tamaño, comprueba las varianzas antes de fiarte del valor p.