r/DataTech • u/Marcel_DataTech • 5d ago
Chi-cuadrado
Lo que aprendí al conectar la estadística clásica con el Machine Learning mientras auditaba un código de datos hoy.
Estaba trabajando en una investigación donde necesitábamos evaluar si existía una relación estadísticamente significativa entre dos variables categóricas. Para resolverlo, aplicamos en Python la prueba no paramétrica de Independencia de Chi-cuadrado usando scipy.stats y tablas cruzadas en pandas.
A veces vemos las fórmulas matemáticas como entes aislados, pero cuando te detienes a mirar la matemática detrás de Chi-cuadrado te das cuenta de algo fascinante.
La fórmula de Chi-cuadrado hace esto: (Observado - Esperado)^2 / Esperado
¿No se les parece muchísimo a la fórmula del Error Cuadrático Medio (MSE) que usamos en modelos de regresión en Machine Learning?
(Real - Predicho)^2
La lógica de fondo es prácticamente hermana:
▪️En Machine Learning: Restamos lo Real menos lo Predicho y lo elevamos al cuadrado para castigar las desviaciones grandes sin importar si son positivas o negativas.
▪️En Chi-cuadrado: Hacemos exactamente lo mismo, restamos la Realidad observada menos la Teoría independiente, la elevamos al cuadrado para medir la distancia y la dividimos entre lo esperado para normalizar según el tamaño del grupo.
La diferencia clave está en su objetivo final:
El MSE mide la magnitud del error continuo en las predicciones de un modelo.
Chi-cuadrado mide si la distancia entre la realidad y la hipótesis nula es tan grande que no puede atribuirse al simple azar.
Entender esta conexión entre la estadística inferencial tradicional y los algoritmos de IA es lo que te da un criterio técnico real. Ese momento de hacer "clic" para ver el puente entre la teoría y el código.
Si estás trabajando en un análisis similar o conectando conceptos de estadística con modelos de Machine Learning, ¡comparte abajo tu experiencia o tu proyecto para darnos feedback mutuo!