Mostrando entradas con la etiqueta Regresión. Mostrar todas las entradas
Mostrando entradas con la etiqueta Regresión. Mostrar todas las entradas

viernes, 31 de octubre de 2025

NÚMEROS

Regresión lineal


Estadística descriptiva.Regresión

He dejado el estudio de la regresión lineal para el final de este recorrido por la estadística descriptiva, debido a la posición fronteriza que ocupa entre la estadística descriptiva y la estadística inferencial, pues introduce procedimientos que permiten ir más allá de la mera descripción de los datos.

Dada una distribución bivariada, tanto su representación gráfica como el uso de una serie (ya vista) de estadísticos nos permiten apreciar la existencia de cierto grado de relación entre las dos variables intervinientes. Esta relación puede presentar diferente grado de intensidad, pero su mera existencia no es suficiente para identificarla como lineal. Hablaremos de relación lineal cuando la asociación entre ambas variables pueda ser adecuadamente descrita mediante una función lineal. La representación gráfica de esta función es una recta, de lo que deriva el nombre de regresión lineal.

Cuando no existe relación estadística entre ambas variables, podemos considerarlas independientes. En ese caso, el conocimiento de los valores de una de ellas no proporciona información sobre los valores de la otra y, por tanto, no podemos utilizar una variable para predecir la otra. Debemos tener presente, no obstante, que una relación lineal débil o incluso inexistente no implica necesariamente independencia, ya que puede existir entre las variables una relación de naturaleza no lineal (1).

El objetivo del análisis de regresión es estudiar cómo se relacionan dos o más variables y construir un modelo matemático que permita estimar el valor de una variable a partir de los valores conocidos de otra u otras. En el caso de la regresión lineal, el objetivo es encontrar la recta que mejor se ajuste a la nube de puntos, de acuerdo con un determinado criterio de ajuste, y utilizarla como modelo para realizar estimaciones o predicciones (2).

Se trata, pues, de estimar el comportamiento de una variable a partir de otra. Denominaremos variable dependiente, endógena o explicada a aquella cuyo comportamiento pretendemos estimar, y variable independiente, exógena o explicativa a aquella que utilizamos como referencia para realizar dicha estimación. Sin embargo, en una distribución bivariada no disponemos necesariamente de una relación causal que determine cuál de las dos variables debe desempeñar cada papel. Por ello, podemos plantear dos rectas de regresión: la de una variable sobre la otra y la de la segunda sobre la primera, aunque habitualmente trabajaremos con una de ellas en función del objetivo del análisis.

  • y = a + bx (x como variable independiente)
  • x = a + by (y como variable independiente)

... siendo (3)...

  • y la variable dependiente (valor a predecir)
  • x la variable independiente (valor que influye en el valor de y)
  • a la ordenada al origen, esto es, valor de y cuando x = 0
  • b la pendiente o cambio en y por cada unidad de cambio en x

También debemos asumir que no existe una distribución lineal exacta, que ninguna recta puede pasar por todos los puntos que dibuja la distribución real. Por ello nos vemos limitados a elegir, de entre todas las rectas posibles, aquella que reduce al mínimo el error o diferencia entre el valor real y el esperado (para y, e =yi-yi').

Dado que esta diferencia puede ser positiva o negativa, utilizamos su suma al cuadrado (Sum(yi -yi')2 como fórmula para el cálculo del error cuadrático total.

Aceptando como objetivo el error cuadrático mínimo, el problema de la regresión lineal se limita a calcular los valores de a y de b.

  • Para a =Md(y) - (Sxy/Sx2) * Md(x)
  • Para b = Sxy/Sx2

Propiedades de la regresión lineal:

  • La pendiente de la recta y sobre x es la covarianza (CVxy) dividida por la varianza de x, mientras que la pendiente de x sobre y es la covarianza CVxy dividida por la varianza de y
  • La recta pasa por el punto formado por las medias Md(x) y Md(y). Este punto se llama centro de gravedad de la distribución bidimensional xy
  • El producto de las pendientes de las rectas de regresión es igual al coeficiente de correlación de Pearson al cuadrado (b+b' = r2)

En todo caso, la viabilidad de la recta de regresión como representación de la distribución se obtiene calculando su bondad de ajuste o coeficiente de determinación

NOTAS
1 Por ahora daremos por válida esta formulación, pero al igual que en el caso de la correlación, también sobre estas cuestiones tendremos que volver más adelante, ya la linealidad no es la única relación posible entre variables. Posiblemente sea la preferida y deseable para ciertos estudios, pero no es la única, como veremos en su momento.
2 De ahí que habláramos al inicio de esta entrada de que la regresión lineal no se limitaba a la descripción del comportamiento de una (o dos) variable(s).
3 En otras formulaciones se denominan a y b como alfa y beta o se invierten las posiciones (y = ax + b). En cualquier caso, lo importante es tener claro que la pendiente (para nosotros b) multiplica a la variable independiente y a ello se le suma el valor de la ordenada de origen (para nosotros a).