Saltar al contenido principal

Qué significa realmente "p < 0.05"

Este es el número sobre el que se actúa y el número que se lee mal. Esto es exactamente lo que te autoriza a decir un valor p por debajo de 0.05, y las cuatro cosas que constantemente se entiende que significa y no significa.

8 min de lectura · Última revisión: 7 de agosto de 2026

La respuesta corta

Un valor p por debajo de 0.05 significa: si genuinamente no hubiera ningún efecto, unos datos al menos tan extremos como los tuyos aparecerían menos del 5% de las veces. Tus datos son incómodos de explicar como coincidencia, así que por convención rechazas la hipótesis nula y llamas al resultado estadísticamente significativo.

Esa es toda la afirmación. Es una afirmación sobre lo sorprendentes que serían tus datos en un mundo sin efecto, no sobre lo probable que es ese mundo, ni sobre lo grande que resultó ser tu efecto.

Las cuatro cosas que no significa

Cada una de estas es una frase distinta de la anterior, y cada una es incorrecta.

La lectura erróneaPor qué es incorrecta
"Hay un 95% de probabilidad de que mi hipótesis sea cierta" El valor p se calcula suponiendo que la nula es cierta. No puede después decirte la probabilidad de que lo sea. Eso necesitaría una probabilidad previa.
"Solo hay un 5% de probabilidad de que esto sea casualidad" El mismo error, reformulado. El 5% es con qué frecuencia se verían así los datos dado que no hay efecto, no con qué frecuencia un hallazgo significativo es erróneo.
"El efecto es grande" La significación escala con el tamaño de la muestra. Una mejora de conversión del 0.04% supera p < 0.05 con tráfico suficiente y no vale nada.
"El resultado se replicará" Un único p justo por debajo de 0.05 es evidencia débil. Los estudios con una potencia del 80% que obtienen p = 0.04 se replican mucho menos de lo que la gente espera.

La segunda fila merece un número, porque es la lectura errónea que más cuesta. Supón que una de cada diez hipótesis que alguien se molesta en contrastar es realmente cierta, y que los estudios tienen un 80% de potencia. Contrasta 1000: 100 son reales y 80 salen significativas; 900 son callejones sin salida y 45 salen significativas igualmente (el 5% de 900). Así que 125 hallazgos superan p < 0.05, y 45 de ellos —el 36%— son falsos. El 5% nunca fue la probabilidad de que tu resultado significativo sea erróneo.

Qué hacer cuando tu valor p está por debajo de 0.05

Cinco cosas, en este orden, antes de redactarlo o desplegarlo:

  1. Mira el tamaño del efecto. La d de Cohen, una diferencia de medias, una mejora, un odds ratio: la medida natural que corresponda. Esta es la pregunta que de verdad te importa, y el valor p no la ha respondido.
  2. Mira el intervalo de confianza. Si va de "trivial" a "enorme", has detectado algo sin medirlo. Ese es un hallazgo distinto de un intervalo estrecho alrededor de un valor útil, aunque el p sea idéntico.
  3. Comprueba que solo hiciste un contraste. Si probaste varios resultados, varios subgrupos o varias especificaciones de modelo, tu tasa real de falsos positivos no es del 5%. Con diez contrastes y α = 0.05 ronda el 40%. Corrígelo, o di claramente que el análisis fue exploratorio.
  4. Comprueba que no paraste antes de tiempo. Vigilar un contraste y pararlo en cuanto sale significativo infla la tasa de error de forma drástica. El tamaño de la muestra debería haberse fijado de antemano.
  5. Informa el valor exacto, no el umbral. "p = .032" transmite información; "p < .05" la tira y esconde la diferencia entre .049 y .001.

¿Y si está por encima de 0.05?

No has conseguido rechazar la hipótesis nula. Eso no es en absoluto lo mismo que demostrar que no hay efecto: significa que tus datos no fueron lo bastante sorprendentes, y eso puede ocurrir porque no hay nada ahí o porque no recogiste datos suficientes para verlo. Fíjate en la formulación: el desenlace es "no rechazar" y no "aceptar", y la diferencia no es pedantería.

El intervalo de confianza te dice cuál de las dos. Un intervalo de −0.05 a +0.06 respalda genuinamente "ningún efecto relevante". Un intervalo de −4 a +9 significa que el estudio no pudo distinguirlo, e informarlo como "ninguna diferencia significativa" induce a error. Si necesitas establecer que un efecto está ausente, eso requiere un contraste de equivalencia, no un p no significativo.

Por qué 0.05, y si tiene que serlo

No hay ninguna razón matemática. Ronald Fisher lo propuso en los años veinte como una regla orientativa cómoda —una probabilidad entre veinte, un número redondo que encajaba con las tablas impresas de la época— y esperaba que cada investigador eligiera un umbral adecuado a su situación. Se petrificó igualmente en un criterio universal.

Otros campos eligieron distinto en cuanto cambió el coste de un falso positivo. La física de partículas exige aproximadamente 3 × 10⁻⁷ antes de llamar descubrimiento a algo. La genómica trabaja en torno a 5 × 10⁻⁸ porque contrasta millones de hipótesis a la vez. Ninguno de los dos está siendo quisquilloso; ambos responden a la misma pregunta que Fisher pretendía que respondieras, y obtienen un número distinto.

Así que no, no tiene que ser 0.05, pero sí tiene que elegirse antes de ver los datos. Escoger el umbral cuando ya ha llegado el valor p es como un umbral deja de significar nada. Nuestra guía para elegir alfa desarrolla cómo fijarlo de forma deliberada.

p = 0.049 y p = 0.051

Son la misma evidencia. Nada cambia en la naturaleza entre uno y otro; solo cae en medio una línea trazada por convención. Tratar uno como un descubrimiento y el otro como un resultado nulo es la costumbre más extraña que ha producido el umbral de 0.05.

Un umbral es útil cuando tienes que tomar una decisión binaria: desplegar o no desplegar, aprobar o no aprobar. No es útil como descripción de la evidencia, y un valor p es una medida continua de evidencia. Ambas cosas pueden ser ciertas: usa α para decidir, e informa el p exacto, el tamaño del efecto y el intervalo para que quien te lea pueda sopesarlo por su cuenta.

Un pequeño tecnicismo, ya que la gente pregunta: la convención es estrictamente menor que. Un p = 0.05 exacto no supera α = 0.05. En la práctica, un resultado que cae con esa precisión sobre la línea debería informarse como lo que es —limítrofe— en lugar de empujarse hacia un lado.

Cómo informarlo

Da el estadístico de contraste, los grados de libertad, el valor p exacto y el tamaño del efecto, con el intervalo de confianza sobre la propia diferencia al lado. En estilo APA la primera parte se ve así: t(28) = 2.14, p = .041, d = 0.78. Fíjate en las normas de la casa para el valor p: sin cero a la izquierda, tres decimales y p < .001 en lugar de un número más pequeño.

Todas las calculadoras de este sitio generan esa cadena por ti, y sombrean el área de la cola para que puedas ver el valor p en lugar de solo leerlo. Empieza por la calculadora de valor p si tienes un estadístico de contraste, o por la calculadora de prueba t si tienes datos en bruto.

Seguir leyendo

¿Listo para hacer los cálculos?

Nuestra calculadora muestra la distribución sombreada, el valor p exacto y una lectura en lenguaje claro de lo que respalda.

Abrir la calculadora de valor p

Preguntas frecuentes

¿Qué significa que el valor p sea menor que 0.05?

Significa que, si genuinamente no hubiera ningún efecto, unos datos al menos tan extremos como los tuyos aparecerían menos del 5% de las veces. Por convención rechazas entonces la hipótesis nula y llamas al resultado estadísticamente significativo. No significa que haya un 95% de probabilidad de que tu hipótesis sea cierta, y no dice nada sobre lo grande que es el efecto.

¿Por qué el p valor tiene que ser menor que 0.05?

No tiene por qué serlo. 0.05 es una convención que Ronald Fisher propuso en los años veinte como regla orientativa cómoda, y se quedó. La física de partículas usa unos 3 × 10⁻⁷ y la genómica unos 5 × 10⁻⁸, porque un falso positivo les cuesta mucho más. La única regla que sí importa es que elijas tu umbral antes de ver los datos.

¿Qué haces si el valor p es menor que 0.05?

Rechazas la hipótesis nula, pero comprueba cuatro cosas antes de tratarlo como un hallazgo. Mira el tamaño del efecto, porque la significación no implica importancia. Mira el intervalo de confianza, porque uno ancho significa que detectaste un efecto sin medirlo. Confirma que hiciste un solo contraste planificado y no muchos, ya que diez contrastes con α = 0.05 conllevan cerca de un 40% de probabilidad de falso positivo. Y confirma que no dejaste de recoger datos en cuanto el resultado salió significativo. Después informa el valor p exacto en lugar de solo "p < .05".

¿p < 0.05 significa que solo hay un 5% de probabilidad de que el resultado sea erróneo?

No, y esta es la lectura errónea del umbral que más cuesta. El 5% es con qué frecuencia verías datos como los tuyos si no hubiera efecto. La probabilidad de que un hallazgo significativo sea realmente falso depende de con qué frecuencia son ciertas de partida las hipótesis que se contrastan. Si una de cada diez es real y los estudios tienen un 80% de potencia, alrededor del 36% de los hallazgos significativos son falsos positivos.

¿Un valor p de exactamente 0.05 es significativo?

Según la convención estricta, no: la significación exige que p sea menor que alfa, no igual. En la práctica, un resultado que cae exactamente sobre la línea se informa mejor como limítrofe, con el valor exacto, el tamaño del efecto y el intervalo de confianza, en lugar de empujarlo hacia un lado de un umbral que era arbitrario de partida.

¿Un valor p más pequeño es un mejor resultado?

Un valor p más pequeño es evidencia más fuerte contra la hipótesis nula, pero no es un efecto mayor ni más útil. El p depende tanto del tamaño del efecto como del tamaño de tu muestra, así que un p muy pequeño puede venir de un efecto grande, de una muestra grande o de ambos. Mira el tamaño del efecto para saber si el hallazgo importa.