Calculadora de significancia estadística · gratuita

¿Esa diferencia es real o es ruido?

El 42 % contra el 37 % parece una diferencia. Con 400 respuestas por grupo, no lo es. Esta calculadora de significancia compara dos porcentajes y te dice si puedes afirmarlo en la junta.

Grupo 1

Grupo 2

Nivel de confianza exigido

Veredicto

No puedes afirmar que haya diferencia

La diferencia de 4.0 puntos cabe dentro de lo que el azar produce con estas muestras. No significa que los grupos sean iguales: significa que estos datos no alcanzan para distinguirlos. Con más entrevistas la misma diferencia podría volverse significativa.

Diferencia
+4.0 pts
Valor z
1.155
Valor p
0.248

La diferencia real está entre -2.8 y 10.8 puntos, con 95 % de confianza. Si ese intervalo cruza el cero, la diferencia no es distinguible del azar.

Cómo se calcula

Es la prueba Z de dos proporciones, la misma que produce las letras de significancia de un banner book:

p̂ = (x₁ + x₂) / (n₁ + n₂) ← proporción combinada

ee = √(p̂ · (1 − p̂) · (1/n₁ + 1/n₂))

z = (p₁ − p₂) / ee

El valor p sale de la normal estándar a dos colas. La diferencia se declara significativa cuando |z| supera el valor crítico del nivel exigido: 1.645 al 90 %, 1.96 al 95 % y 2.576 al 99 %. Para el intervalo de confianza de la diferencia se usa el error estándar sin combinar, porque la proporción combinada sólo vale para la prueba, donde se parte de suponer que no hay diferencia.

Tres trampas al leer significancia

«No significativo» no es «iguales»

Significa que estos datos no alcanzan para distinguirlos. Con más muestra, la misma diferencia puede volverse significativa. Es un límite de la evidencia, no una conclusión.

Significativo no es importante

Con muestras grandes, medio punto sale significativo y no cambia ninguna decisión. Por eso el intervalo de confianza dice más que el sí o el no: muestra si el efecto es grande o trivial.

Comparar todo contra todo

Si haces veinte comparaciones al 95 %, una saldrá significativa por azar aunque no haya nada. Decide qué vas a comparar antes de ver los datos, no después.

Preguntas frecuentes

¿Cómo sé si la diferencia entre dos porcentajes es significativa?

Comparando la diferencia observada con la que el azar podría producir dados los tamaños de muestra. La prueba estándar para dos porcentajes es la Z de dos proporciones: calcula un valor z y, a partir de él, un valor p. Si el valor p es menor que el nivel exigido (0.05 para el 95 % de confianza) la diferencia se considera significativa. Un ejemplo que sorprende: 42 % contra 38 % con 400 respuestas por grupo NO es significativa; con 1,000 por grupo, la misma diferencia sí lo es. El tamaño de muestra decide tanto como la diferencia.

¿Qué significa exactamente que una diferencia «no sea significativa»?

No significa que los grupos sean iguales. Significa que estos datos no alcanzan para distinguirlos: la diferencia observada cabe dentro de lo que el azar produce con esas muestras. Es un límite de la evidencia, no una conclusión sobre la realidad. Reportar «no hay diferencia» cuando lo correcto es «no podemos afirmar que la haya» es uno de los errores más comunes en la lectura de resultados, y lleva a decisiones tomadas sobre algo que nunca se demostró.

¿Qué es el valor p y cómo se interpreta?

El valor p es la probabilidad de observar una diferencia al menos tan grande como la que viste, si en realidad no hubiera ninguna diferencia entre los grupos. Un valor p de 0.03 quiere decir que, sin diferencia real, resultados así de extremos aparecerían el 3 % de las veces. No es la probabilidad de que tu hipótesis sea cierta, que es como se malinterpreta casi siempre. Por convención se toma 0.05 como umbral al 95 % de confianza, pero el umbral es una decisión, no una ley de la naturaleza.

¿Por qué el intervalo de confianza importa más que el sí o el no?

Porque dice cuánta diferencia hay, no sólo si la hay. Un resultado puede ser significativo y a la vez irrelevante: con muestras enormes, una diferencia de medio punto sale significativa y no cambia ninguna decisión de negocio. El intervalo de confianza de la diferencia te da el rango plausible, y ahí se ve si el efecto es grande o trivial. Si el intervalo cruza el cero, la diferencia no es distinguible del azar.

¿Sirve esta prueba para comparar subgrupos de un mismo estudio?

Sí, siempre que los subgrupos sean independientes entre sí: hombres contra mujeres, una plaza contra otra, un segmento contra otro. No sirve para comparar dos respuestas de las mismas personas (por ejemplo, antes y después de probar un producto), porque esas mediciones están emparejadas y requieren una prueba distinta. Tampoco conviene usarla decenas de veces sobre el mismo estudio sin ajustar: al hacer muchas comparaciones, algunas salen significativas por puro azar.

¿Qué pasa si tengo muy pocas respuestas en un grupo?

La prueba Z se apoya en una aproximación normal que deja de ser fiable cuando hay muy pocos casos: la regla habitual pide al menos 5 casos esperados en cada celda. Con menos, el resultado puede parecer válido y no serlo, así que esta calculadora avisa cuando ocurre. En ese escenario corresponde una prueba exacta, como la de Fisher, o simplemente reconocer que la base es demasiado pequeña para concluir.

Esto mismo, pero en cada celda de tu estudio

Un banner book hace esta prueba en cada cruce y marca con una letra la columna contra la que cada porcentaje es significativamente mayor. Es lo que entrega Bravok Tabular, con precio cerrado por estudio y las muestras abribles completas.

Otras herramientas gratuitas

Todas funcionan en el navegador, sin registro y con la fórmula a la vista. Lo que escribes no sale de tu equipo.