Calculadora de tamaño del efecto
La d de Cohen y la g de Hedges para dos grupos, con un intervalo de confianza sobre la estimación, porque un tamaño del efecto medido a partir de veinte observaciones es bastante menos seguro de lo que sugieren sus dos decimales.
Enter two groups to begin
An effect size expresses a difference in standard deviations, which makes it comparable across studies and independent of how much data you collected.
Result
Confidence interval
Point estimate
Margin of error
What this means
What it does not mean
Report it (APA)
Por qué un valor p no basta
Un valor p responde a "¿podría ser esto casualidad?". Un tamaño del efecto responde a "¿cómo de grande es?". Son preguntas distintas y solo una de las dos suele ser la pregunta que tenías.
La distancia se abre porque p depende del tamaño de la muestra y d no. Dos grupos que difieren en 0.3 desviaciones estándar producen p = 0.35 con 20 por grupo y p < 0.001 con 500 por grupo. El efecto es idéntico en ambos casos. Lo único que cambió fue la evidencia.
Por eso también los metaanálisis se hacen sobre tamaños del efecto y no sobre valores p. La d se expresa en desviaciones estándar, así que estudios que midieron el mismo constructo en escalas distintas se vuelven directamente comparables, cosa que un conjunto de valores p nunca podrá ser.
La d de Cohen y la g de Hedges
Estiman lo mismo. La d divide la diferencia de medias entre la desviación estándar combinada; la g multiplica la d por un factor de corrección que elimina el sesgo al alza que arrastra la d en muestras pequeñas.
| Por grupo | Factor de corrección | Efecto sobre d = 0.80 |
|---|---|---|
| 5 | 0.903 | 0.72 |
| 10 | 0.958 | 0.77 |
| 20 | 0.980 | 0.78 |
| 50 | 0.992 | 0.79 |
Así que: informa de la g cuando los grupos sean pequeños, y deja de importar por encima de unos 20 por grupo. Muchos paquetes de software etiquetan la g como "d corregida" o "d corregida por sesgo", que es lo mismo.
Las referencias de Cohen, y sus límites
0.2 pequeño, 0.5 mediano, 0.8 grande. Cohen las propuso para la investigación en ciencias del comportamiento y se sentía abiertamente incómodo haciéndolo: quería que quienes investigan se calibraran frente a su propia literatura, y ofreció los números como parche para los campos que no tenían ninguna.
Cincuenta años después se aplican a todo, y así es como una d de 0.25 en una intervención educativa se descarta por "pequeña" cuando representaría un éxito considerable de política pública, y una d de 0.9 en una tarea de laboratorio donde la manipulación es evidente se celebra como "grande" cuando no tiene nada de particular. La referencia útil es la distribución de efectos que informan otros estudios de tu área.
Una lectura más concreta: d = 0.5 significa que el miembro medio de un grupo puntúa por encima de aproximadamente el 69% del otro grupo. Una d = 0.8 lo sitúa por encima del 79%. Incluso un efecto "grande" deja las dos distribuciones solapándose mucho, cosa que conviene recordar antes de describir un tamaño del efecto como espectacular.
El intervalo sobre d
Un tamaño del efecto es una estimación, y con los tamaños de muestra habituales no es una estimación precisa. Doce por grupo dando d = 0.8 vienen con un intervalo que va de −0.03 a 1.63: esos mismos datos son compatibles con que no haya efecto y con que haya uno enorme.
Esto importa sobre todo en la literatura de estudios pequeños, donde una d llamativa se cita sin su intervalo, no consigue replicarse, y el fracaso se trata como un enigma. Casi nunca había enigma: la estimación original era compatible con casi cualquier cosa, y la replicación aterrizó en otro punto de ese rango.
La calculadora informa del intervalo junto a la estimación puntual por esa razón. Si cruza el cero, dilo cuando lo redactes: eso es un hallazgo distinto de un intervalo que no lo cruza.
Preguntas frecuentes
¿Cómo se calcula la d de Cohen?
Divide la diferencia entre las dos medias de grupo entre la desviación estándar combinada: d = (media₁ − media₂) / s_combinada, donde s_combinada = √(((n₁−1)s₁² + (n₂−1)s₂²) / (n₁+n₂−2)). Pega arriba tus datos en bruto, o cambia a "Media y SD" e introduce n, media y desviación estándar de cada grupo.
¿Qué es un tamaño del efecto grande?
Cohen sugirió 0.2 como pequeño, 0.5 como mediano y 0.8 como grande, y dijo explícitamente que los ofrecía a regañadientes, para la investigación en ciencias del comportamiento y a falta de algo mejor. No son universales. En educación, un efecto de 0.2 puede justificar un cambio de política; en un ensayo de un fármaco para una dolencia leve, puede que 0.5 no compense los efectos secundarios. La referencia que importa es lo que encuentran otros trabajos de tu campo.
¿Cuál es la diferencia entre la d de Cohen y la g de Hedges?
Estiman la misma cantidad, pero la d está sesgada al alza en muestras pequeñas y la g le aplica la corrección estándar. La corrección es insignificante por encima de unos 20 por grupo e importa por debajo: con 5 por grupo encoge la estimación en torno a un 10%. Informa de la g cuando tus grupos sean pequeños, y ten en cuenta que muchos paquetes etiquetan la g como "d corregida".
¿Por qué un tamaño del efecto necesita un intervalo de confianza?
Porque es una estimación como cualquier otra, y sorprendentemente imprecisa con tamaños de muestra pequeños. Doce por grupo dando d = 0.8 suelen producir un intervalo que abarca aproximadamente de 0 a 1.6: los datos son compatibles con que no haya efecto y con que haya uno muy grande. Citar el 0.8 a secas da a entender una precisión que el estudio no tiene.
¿Puedo tener un valor p significativo y un tamaño del efecto minúsculo?
Sí, y es lo normal en conjuntos de datos grandes. p depende tanto del tamaño del efecto como de la cantidad de datos; d depende solo del efecto. Con 100 000 observaciones por grupo, una d de 0.01 superará p < 0.001 y no significará nada en la práctica. También ocurre lo contrario: una d considerable en un estudio pequeño puede no llegar a ser significativa, lo cual dice algo del estudio y no del efecto.
¿Qué tamaño del efecto debo usar para otros contrastes?
La d de Cohen para una diferencia entre dos medias. La h de Cohen para una diferencia entre dos proporciones: la calculadora de pruebas A/B la informa. La V de Cramér para una tabla de contingencia, en la calculadora de chi-cuadrado. La eta cuadrado para el ANOVA. La r² para una correlación. Todas responden a la misma pregunta en las unidades del contraste que ejecutaste: ¿qué parte de lo que mediste explica realmente la agrupación?