Cómo interpretar correctamente los valores p
Casi todo el mundo sabe calcular un valor p. Muchas menos personas saben decir qué significa sin cometer uno de cinco errores concretos. Aquí está cada uno, y la formulación correcta que lo sustituye.
9 min de lectura · Última revisión: 7 de agosto de 2026
Por qué esto cuesta tanto
La enseñanza de la estadística está muy escorada hacia el cálculo. Se aprende a producir un valor p mucho antes —a veces en lugar de— aprender qué representa. El resultado es una capacidad generalizada de calcular bien un número y describirlo mal.
Los errores que siguen no son rebuscados. Aparecen de forma rutinaria en artículos publicados, en notas de prensa y en paneles de analítica.
Error 1: "Hay un 5% de probabilidad de que la hipótesis nula sea cierta"
Por qué es incorrecto: el valor p se calcula suponiendo que la hipótesis nula es cierta. Un número derivado bajo un supuesto no puede medir a la vez la probabilidad de ese supuesto.
Las dos cantidades difieren enormemente. P(datos | nula) es lo que tienes. P(nula | datos) es lo que quieres, y llegar hasta ahí exige saber cuán plausible era tu hipótesis de antemano. Para una hipótesis con una probabilidad previa del 50%, observar p = 0.05 deja la probabilidad de que la nula sea cierta en torno al 29%, casi seis veces la cifra que la gente supone.
Di en su lugar: "Si no hubiera ningún efecto, veríamos datos así de extremos aproximadamente el 5% de las veces".
Error 2: "p = 0.001 significa un efecto más fuerte que p = 0.04"
Por qué es incorrecto: los valores p reflejan tanto el tamaño del efecto como el tamaño de la muestra, y no puedes separarlos a partir del valor p solo.
Un caso concreto. El estudio A encuentra una mejora de 2 puntos con n = 10 000 e informa p = 0.001. El estudio B encuentra una mejora de 15 puntos con n = 30 e informa p = 0.04. El estudio B encontró un efecto más de siete veces mayor. El estudio A tenía más datos.
Di en su lugar: compara tamaños del efecto y sus intervalos de confianza. Para eso están.
Error 3: "No significativo quiere decir que no hay efecto"
Por qué es incorrecto: la ausencia de evidencia no es evidencia de ausencia. Un resultado no significativo significa que tus datos no fueron lo bastante sorprendentes bajo la nula, y eso puede deberse a que no hay efecto o a que tu estudio era demasiado pequeño para detectarlo.
El intervalo de confianza resuelve la ambigüedad al instante. Si tu intervalo sobre una diferencia va de −0.3 a +0.4 puntos, tienes buena evidencia de que cualquier efecto real es pequeño. Si va de −12 a +18 puntos, no has aprendido prácticamente nada. Ambos pueden producir p = 0.6.
Di en su lugar: "No encontramos evidencia suficiente de un efecto", seguido del intervalo para que quien lee pueda juzgar qué se ha descartado.
Error 4: Tratar el 0.05 como una línea nítida
Por qué es incorrecto: p = 0.049 y p = 0.051 representan una evidencia prácticamente idéntica. Declarar uno un descubrimiento y el otro un resultado nulo es un artefacto del umbral, no una propiedad de los datos.
Esta dicotomía provoca distorsiones reales: los resultados justo por debajo de la línea se publican y los que quedan justo por encima desaparecen, así que la literatura exagera sistemáticamente los efectos.
Di en su lugar: informa el valor p exacto y trátalo como una medida continua de evidencia. Nuestra guía sobre qué significa realmente "p < 0.05" desarrolla el umbral en detalle, incluido qué comprobar antes de actuar sobre un resultado que lo supera.
Error 5: Ignorar cuántos contrastes has hecho
Por qué es incorrecto: α = 0.05 controla la tasa de falsos positivos de un contraste planificado de antemano. Haz veinte contrastes independientes y la probabilidad de al menos un falso positivo ronda el 64%.
Esto se aplica mucho más ampliamente de lo que se suele pensar: probar varios resultados, varios subgrupos, varias especificaciones de modelo, o revisar una prueba A/B cada día hasta que salga significativa. Cada una es una forma de multiplicidad, y la última es la razón de que la tasa práctica de falsos descubrimientos en la investigación publicada ronde el 30%.
Di en su lugar: preregistra tu análisis principal, o aplica una corrección e informa cuántas comparaciones hiciste.
Ejemplo resuelto: un resultado significativo
Un ensayo compara un tratamiento nuevo frente a un control. La mejora media es 4.2 puntos
mayor en el brazo de tratamiento, con t(198) = 2.31, p = .022, IC 95% [0.61, 7.79].
Lo que puedes decir: los datos son incompatibles con la ausencia de efecto del tratamiento al nivel del 5%. La mejor estimación es una mejora de 4.2 puntos, y los datos son compatibles con cualquier valor entre 0.6 y 7.8.
Lo que no puedes decir: que hay un 97.8% de probabilidad de que el tratamiento funcione; que el efecto es exactamente de 4.2 puntos; o que se ha establecido un beneficio clínicamente relevante, porque el extremo inferior del intervalo, 0.6, puede ser demasiado pequeño como para importarle a un paciente.
Ejemplo resuelto: un resultado no significativo
El mismo ensayo, con 40 pacientes en lugar de 200: una diferencia de 4.2 puntos con
t(38) = 1.03, p = .31, IC 95% [−4.05, 12.45].
El efecto estimado es idéntico. Lo único que cambió es la precisión. El intervalo abarca ahora desde un daño relevante hasta un beneficio grande.
Lo que puedes decir: este estudio era demasiado pequeño para determinar si el tratamiento ayuda. Los datos siguen siendo compatibles con un beneficio sustancial.
Lo que no puedes decir: que el tratamiento no funciona, ni que los dos grupos son equivalentes. Informar solo "p = .31, no significativo" dejaría a quien lee exactamente con la impresión equivocada, y por eso los intervalos deben aparecer en todo informe.
Una lista de comprobación antes de informar
- ¿He informado el valor p exacto y no solo un umbral?
- ¿He informado un tamaño del efecto en unidades con sentido?
- ¿He informado un intervalo de confianza?
- ¿He dicho cuántos contrastes hice?
- ¿Decidí el análisis antes de ver los datos?
- Si el resultado es nulo, ¿he dicho si el estudio podría haber detectado un efecto?
Nuestra calculadora de prueba t informa el tamaño del efecto y el intervalo junto al valor p de forma predeterminada, así que los tres primeros salen gratis.