Saltar al contenido principal

Cómo interpretar correctamente los valores p

Casi todo el mundo sabe calcular un valor p. Muchas menos personas saben decir qué significa sin cometer uno de cinco errores concretos. Aquí está cada uno, y la formulación correcta que lo sustituye.

9 min de lectura · Última revisión: 7 de agosto de 2026

Por qué esto cuesta tanto

La enseñanza de la estadística está muy escorada hacia el cálculo. Se aprende a producir un valor p mucho antes —a veces en lugar de— aprender qué representa. El resultado es una capacidad generalizada de calcular bien un número y describirlo mal.

Los errores que siguen no son rebuscados. Aparecen de forma rutinaria en artículos publicados, en notas de prensa y en paneles de analítica.

Error 1: "Hay un 5% de probabilidad de que la hipótesis nula sea cierta"

Por qué es incorrecto: el valor p se calcula suponiendo que la hipótesis nula es cierta. Un número derivado bajo un supuesto no puede medir a la vez la probabilidad de ese supuesto.

Las dos cantidades difieren enormemente. P(datos | nula) es lo que tienes. P(nula | datos) es lo que quieres, y llegar hasta ahí exige saber cuán plausible era tu hipótesis de antemano. Para una hipótesis con una probabilidad previa del 50%, observar p = 0.05 deja la probabilidad de que la nula sea cierta en torno al 29%, casi seis veces la cifra que la gente supone.

Di en su lugar: "Si no hubiera ningún efecto, veríamos datos así de extremos aproximadamente el 5% de las veces".

Error 2: "p = 0.001 significa un efecto más fuerte que p = 0.04"

Por qué es incorrecto: los valores p reflejan tanto el tamaño del efecto como el tamaño de la muestra, y no puedes separarlos a partir del valor p solo.

Un caso concreto. El estudio A encuentra una mejora de 2 puntos con n = 10 000 e informa p = 0.001. El estudio B encuentra una mejora de 15 puntos con n = 30 e informa p = 0.04. El estudio B encontró un efecto más de siete veces mayor. El estudio A tenía más datos.

Di en su lugar: compara tamaños del efecto y sus intervalos de confianza. Para eso están.

Error 3: "No significativo quiere decir que no hay efecto"

Por qué es incorrecto: la ausencia de evidencia no es evidencia de ausencia. Un resultado no significativo significa que tus datos no fueron lo bastante sorprendentes bajo la nula, y eso puede deberse a que no hay efecto o a que tu estudio era demasiado pequeño para detectarlo.

El intervalo de confianza resuelve la ambigüedad al instante. Si tu intervalo sobre una diferencia va de −0.3 a +0.4 puntos, tienes buena evidencia de que cualquier efecto real es pequeño. Si va de −12 a +18 puntos, no has aprendido prácticamente nada. Ambos pueden producir p = 0.6.

Di en su lugar: "No encontramos evidencia suficiente de un efecto", seguido del intervalo para que quien lee pueda juzgar qué se ha descartado.

Error 4: Tratar el 0.05 como una línea nítida

Por qué es incorrecto: p = 0.049 y p = 0.051 representan una evidencia prácticamente idéntica. Declarar uno un descubrimiento y el otro un resultado nulo es un artefacto del umbral, no una propiedad de los datos.

Esta dicotomía provoca distorsiones reales: los resultados justo por debajo de la línea se publican y los que quedan justo por encima desaparecen, así que la literatura exagera sistemáticamente los efectos.

Di en su lugar: informa el valor p exacto y trátalo como una medida continua de evidencia. Nuestra guía sobre qué significa realmente "p < 0.05" desarrolla el umbral en detalle, incluido qué comprobar antes de actuar sobre un resultado que lo supera.

Error 5: Ignorar cuántos contrastes has hecho

Por qué es incorrecto: α = 0.05 controla la tasa de falsos positivos de un contraste planificado de antemano. Haz veinte contrastes independientes y la probabilidad de al menos un falso positivo ronda el 64%.

Esto se aplica mucho más ampliamente de lo que se suele pensar: probar varios resultados, varios subgrupos, varias especificaciones de modelo, o revisar una prueba A/B cada día hasta que salga significativa. Cada una es una forma de multiplicidad, y la última es la razón de que la tasa práctica de falsos descubrimientos en la investigación publicada ronde el 30%.

Di en su lugar: preregistra tu análisis principal, o aplica una corrección e informa cuántas comparaciones hiciste.

Ejemplo resuelto: un resultado significativo

Un ensayo compara un tratamiento nuevo frente a un control. La mejora media es 4.2 puntos mayor en el brazo de tratamiento, con t(198) = 2.31, p = .022, IC 95% [0.61, 7.79].

Lo que puedes decir: los datos son incompatibles con la ausencia de efecto del tratamiento al nivel del 5%. La mejor estimación es una mejora de 4.2 puntos, y los datos son compatibles con cualquier valor entre 0.6 y 7.8.

Lo que no puedes decir: que hay un 97.8% de probabilidad de que el tratamiento funcione; que el efecto es exactamente de 4.2 puntos; o que se ha establecido un beneficio clínicamente relevante, porque el extremo inferior del intervalo, 0.6, puede ser demasiado pequeño como para importarle a un paciente.

Ejemplo resuelto: un resultado no significativo

El mismo ensayo, con 40 pacientes en lugar de 200: una diferencia de 4.2 puntos con t(38) = 1.03, p = .31, IC 95% [−4.05, 12.45].

El efecto estimado es idéntico. Lo único que cambió es la precisión. El intervalo abarca ahora desde un daño relevante hasta un beneficio grande.

Lo que puedes decir: este estudio era demasiado pequeño para determinar si el tratamiento ayuda. Los datos siguen siendo compatibles con un beneficio sustancial.

Lo que no puedes decir: que el tratamiento no funciona, ni que los dos grupos son equivalentes. Informar solo "p = .31, no significativo" dejaría a quien lee exactamente con la impresión equivocada, y por eso los intervalos deben aparecer en todo informe.

Una lista de comprobación antes de informar

  • ¿He informado el valor p exacto y no solo un umbral?
  • ¿He informado un tamaño del efecto en unidades con sentido?
  • ¿He informado un intervalo de confianza?
  • ¿He dicho cuántos contrastes hice?
  • ¿Decidí el análisis antes de ver los datos?
  • Si el resultado es nulo, ¿he dicho si el estudio podría haber detectado un efecto?

Nuestra calculadora de prueba t informa el tamaño del efecto y el intervalo junto al valor p de forma predeterminada, así que los tres primeros salen gratis.

Seguir leyendo

¿Listo para hacer los cálculos?

Nuestra calculadora muestra la distribución sombreada, el valor p exacto y una lectura en lenguaje claro de lo que respalda.

Abrir la calculadora de valor p

Preguntas frecuentes

Si p = 0.05, ¿cuál es la probabilidad real de que la hipótesis nula sea cierta?

Depende de cuán plausible fuera la hipótesis antes de recoger los datos, pero es muy superior al 5%. Para una hipótesis con las mismas probabilidades a priori, observar p = 0.05 deja alrededor de un 29% de probabilidad de que la nula sea cierta. Esta distancia entre lo que la gente supone y lo que es cierto es la mayor fuente aislada de exceso de confianza en la investigación.

¿Cómo debo informar un resultado no significativo?

Da la estimación, el intervalo de confianza y el valor p, y luego di qué descarta el intervalo. "Ninguna diferencia significativa (p = .31)" es casi por completo inútil. "La diferencia fue de 4.2 puntos, IC 95% [−4.1, 12.5], p = .31; este estudio no pudo distinguir un beneficio relevante de la ausencia de efecto" sí es un hallazgo real.

¿Qué es el p-hacking?

Ajustar el análisis hasta que el valor p cruza tu umbral: probar varios resultados, descartar observaciones incómodas, añadir participantes hasta que salga significativo, o pasar de bilateral a unilateral a posteriori. Cada decisión es defendible por separado, y eso es justo lo que hace tan fácil caer en esta práctica sin querer.

¿Debería dejar de usar valores p?

No: usados correctamente responden a una pregunta legítima. El problema no es el valor p, sino la costumbre de informarlo solo y de leerlo como algo que no es. Infórmalo con un tamaño del efecto y un intervalo, trátalo como evidencia continua, y hace su trabajo.