Calculadora de prueba t
Pega dos columnas directamente desde una hoja de cálculo, o trabaja con la media y la desviación estándar si es todo lo que tienes. Obtienes el valor p, la d de Cohen y un intervalo de confianza juntos, porque el valor p por sí solo no puede decirte si merece la pena actuar sobre esa diferencia.
Paste your data to begin
You get the p-value, the effect size, and a confidence interval together — because a p-value on its own does not tell you whether the result matters.
Results
P-value
Estimate
Effect size
What this means
What it does not mean
Report it (APA)
¿Qué prueba t necesitas?
| Tu situación | Contraste |
|---|---|
| Dos grupos separados | Prueba t independiente (de dos muestras) — la predeterminada aquí |
| Los mismos sujetos, dos veces | Prueba t para datos emparejados — antes/después, pares emparejados |
| Un grupo frente a un valor fijo | Prueba t de una muestra — frente a un objetivo, un baremo o cero |
| Tres grupos o más | ANOVA de un factor |
| Tasas o proporciones | Prueba Z de dos proporciones |
Si solo tienes la media y la desviación estándar
Mucha gente llega aquí con estadísticos resumen en lugar de números en bruto: una tabla de un artículo publicado, una cifra de un informe, una línea en el correo de un colega. Cambia la entrada de arriba de Datos en bruto a Media y SD, introduce n, la media y la desviación estándar de cada grupo, y obtienes el mismo valor p, la misma d de Cohen y el mismo intervalo de confianza que te habrían dado los valores subyacentes.
Estadísticamente no se pierde nada, porque un estadístico t se construye enteramente a partir de esos tres números. Para dos grupos independientes, con la fórmula de Welch:
t = (media₁ − media₂) / √(sd₁²/n₁ + sd₂²/n₂)
Ejemplo trabajado. Grupo 1: media 52.3, SD 8.1, n = 30. Grupo 2: media 47.9, SD 9.4, n = 28. El numerador es 4.4. El denominador es √(65.61/30 + 88.36/28) = √(2.187 + 3.156) = 2.311. Así que t = 1.904, los grados de libertad de Welch–Satterthwaite salen 53.5, y p = 0.0624: una diferencia de 4.4 puntos que no llega a ser significativa con 0.05. Escribe esos seis números arriba y eso es exactamente lo que verás.
Para una muestra frente a un valor fijo la fórmula es t = (media − μ) / (sd / √n) con df = n − 1; elige “Una muestra frente a un valor” e introduce tu μ₀.
El único contraste que los estadísticos resumen no pueden sostener es la prueba t para datos emparejados, así que esa opción desaparece en este modo. Un contraste emparejado trabaja sobre la diferencia dentro de cada par, y la desviación estándar de esas diferencias no es recuperable a partir de dos SD de grupo: depende de lo correlacionados que estén los pares, algo que los estadísticos resumen sencillamente no registran. Una calculadora que te deje hacerlo igualmente está ejecutando un contraste de muestras independientes y etiquetándolo como emparejado.
Una cosa que conviene comprobar antes de empezar: ¿tu fuente informa de la desviación estándar o del error estándar? Se confunden constantemente y se diferencian en un factor de √n, así que tomar uno por el otro con n = 30 cambia tu estadístico t más de cinco veces. Si el número salió de una barra de error, lee el pie de figura. Para convertirlo, sd = se × √n.
Los datos en bruto siguen siendo la mejor entrada cuando los tienes. El resumen bajo cada casilla informa de la n, la media y la SD que se han leído realmente, que es una forma rápida de cotejar tus cifras con su fuente, y solo los valores en bruto te dejan ver la asimetría y los valores atípicos que harían de la prueba t la herramienta equivocada desde el principio.
Pegar tus datos
Las casillas aceptan lo que sea que te dé una hoja de cálculo: valores separados por comas, tabuladores, puntos y comas, espacios o saltos de línea. Copiar una columna directamente de Excel, de Google Sheets o de un CSV funciona sin ninguna limpieza.
Cualquier cosa que no sea un número se comunica en lugar de descartarse en silencio. Eso importa: saltarse calladamente un N/A perdido cambia tu tamaño de muestra y por tanto tu valor p, y nunca te enterarías. El resumen en vivo bajo cada casilla muestra la n, la media y la desviación estándar que se están usando realmente, así que puedes confirmar la lectura antes de fiarte del resultado.
Por qué la prueba de Welch es la predeterminada
La prueba t de Student clásica asume que ambos grupos comparten la misma varianza poblacional. Ese supuesto rara vez se contrasta, se incumple con frecuencia, y cuando falla el contraste da valores p demasiado pequeños: la dirección que produce falsos positivos.
La prueba t de Welch prescinde del supuesto. Ajusta los grados de libertad mediante la ecuación de Welch–Satterthwaite, y por eso normalmente verás en los resultados unos df fraccionarios como 21.34. Eso es correcto y esperable. Cuando las varianzas sí son iguales, la de Welch casi no te cuesta potencia, lo que la convierte en la mejor opción predeterminada en prácticamente todos los casos. R la usa como predeterminada desde hace años.
La opción de varianzas iguales sigue disponible para los trabajos de clase que exijan la versión combinada. Si la eliges y las varianzas se diferencian en más de un factor de cuatro, la calculadora te lo dice.
Lee el intervalo, no solo el valor p
El intervalo de confianza es el número más útil del panel de resultados y el que más se ignora. Te dice el rango de diferencias con el que tus datos son compatibles, en las unidades originales de tu medición.
Si en cambio quieres el efecto en una escala estandarizada, la calculadora de tamaño del efecto informa de la d de Cohen y la g de Hedges con un intervalo propio.
Un resultado significativo cuyo intervalo va de 0.1 a 12.0 no es el mismo hallazgo que uno que va de 5.8 a 6.2, aunque el valor p sea idéntico. Y un resultado no significativo cuyo intervalo abarca de −0.05 a 0.06 sí sugiere que no hay ningún efecto relevante, mientras que uno que abarca de −4 a +9 significa que tu estudio sencillamente no pudo saberlo. Informar solo de "p > .05" tira esa distinción a la basura.
Preguntas frecuentes
¿Puedo calcular un valor p solo con la media y la desviación estándar?
Sí, siempre que tengas también los tamaños muestrales. Cambia la entrada de arriba a "Media y SD" e introduce n, la media y la desviación estándar de cada grupo: obtienes el mismo valor p, la misma d de Cohen y el mismo intervalo de confianza que habrían producido los valores en bruto, porque un estadístico t se construye enteramente a partir de esos tres números. El único contraste que esto no puede sostener es la prueba t para datos emparejados, que necesita las diferencias dentro de cada par. Lo otro que pierdes es la posibilidad de ver la asimetría y los valores atípicos, que es justo donde una prueba t tiene más probabilidades de engañarte.
¿El número que tengo es la desviación estándar o el error estándar?
Se diferencian en un factor de √n — se = sd / √n — y se confunden constantemente en tablas publicadas y en pies de figura. Usar un SE donde la fórmula quiere una SD deja tu estadístico t demasiado grande y tu valor p demasiado pequeño. Si una cifra salió de una barra de error, mira en el pie cuál de los dos representa. Para volver atrás, sd = se × √n.
¿Cuál es la diferencia entre una prueba t emparejada y una independiente?
Usa una prueba t para datos emparejados cuando cada valor de un grupo se corresponde con un valor concreto del otro: la misma persona medida antes y después, o pares emparejados. Usa un contraste independiente cuando los dos grupos contienen sujetos distintos sin ningún emparejamiento natural. El emparejamiento elimina la variación entre sujetos, así que un contraste emparejado es bastante más potente cuando procede. Usarlo cuando los datos no están genuinamente emparejados es un error grave.
¿Debo usar la prueba t de Welch o la combinada de Student?
La de Welch, en casi todos los casos. No asume que los dos grupos tengan varianzas iguales, y cuando resulta que lo son casi no pierde potencia. Los estadísticos llevan décadas recomendándola como opción predeterminada, y R la usa de forma predeterminada. Esta calculadora usa la de Welch salvo que marques expresamente la casilla de varianzas iguales.
¿Cuántos datos necesito para una prueba t?
Técnicamente dos valores por grupo, pero eso da casi ninguna potencia para detectar nada. Como suelo práctico, apunta al menos a 15 o 20 por grupo para un efecto moderado. Si tus grupos son pequeños y claramente no normales, una prueba U de Mann-Whitney es mejor elección que una prueba t.
¿Qué es la d de Cohen y por qué importa?
La d de Cohen expresa la diferencia entre dos medias en unidades de desviación estándar, lo que la hace comparable entre estudios e independiente del tamaño de la muestra. Por convención, 0.2 es pequeña, 0.5 mediana y 0.8 grande. Importa porque un valor p solo te dice que un efecto es detectable: con 100 000 observaciones, una d de 0.01 será altamente significativa y completamente irrelevante.
¿Mis datos tienen que seguir una distribución normal?
La prueba t asume que la distribución muestral de la media es aproximadamente normal, lo cual es un requisito más débil que el de que lo sean los datos mismos. Gracias al teorema central del límite, las muestras por encima de unos 30 por grupo son bastante robustas frente a la no normalidad. La asimetría acusada o los valores atípicos marcados en muestras pequeñas son el problema de verdad: inspecciona tus datos antes de fiarte del resultado.