← Volver a Aprende con CDIA

Fundamentos del aprendizaje estadísticoRegresión lineal

BásicoAprendizaje estadístico9 min de lectura

Regresión lineal

La recta que mejor describe una relación entre variables: el modelo más simple e interpretable del aprendizaje automático.

La regresión lineal busca la línea recta que mejor describe la relación entre una variable que queremos predecir y una o más variables que usamos como pistas. Es el "hola mundo" del aprendizaje automático: simple, transparente y sorprendentemente útil.

Un ejemplo cotidiano

Imagina que queremos predecir el precio de una casa () a partir de sus metros cuadrados (). Si dibujamos muchas casas como puntos en un gráfico, notaremos que, en general, a más metros, mayor precio. La regresión lineal traza la recta que pasa "por el medio" de esa nube de puntos.

metros cuadrados → precio →
Cada punto es una casa; la recta minimiza la distancia (al cuadrado) a todos ellos.

El modelo

Con una sola variable, el modelo es la ecuación de una recta:

donde:

  • es el valor predicho (el "sombrero" indica predicción),
  • es el intercepto (el valor de cuando ),
  • es la pendiente (cuánto cambia por cada unidad de ).

Cuando tenemos varias pistas () hablamos de regresión lineal múltiple:

¿Qué significa "la mejor" recta?

Para cada casa real comparamos su precio verdadero con el que predice la recta . La diferencia es el error o residuo:

La recta ideal es la que hace esos errores lo más pequeños posible en conjunto. Para medirlo usamos el error cuadrático medio (MSE, por sus siglas en inglés):

Elevamos al cuadrado por dos razones: así los errores positivos y negativos no se cancelan, y penalizamos más los errores grandes.

Encontrar los coeficientes

"Entrenar" el modelo significa elegir y que minimizan el MSE. A este método se le llama mínimos cuadrados. Para el caso de una variable, la solución tiene una fórmula cerrada elegante:

donde y son los promedios de e . Fíjate que la pendiente no es otra cosa que la covarianza entre e dividida por la varianza de .

En la práctica, con muchas variables, se resuelve en forma matricial:

¿Qué tan buena es la recta? El

El coeficiente de determinación nos dice qué fracción de la variación de los datos logra explicar el modelo:

Vale entre y . Un significa que el modelo explica el 85% de la variabilidad observada; el 15% restante queda como ruido o factores que no medimos.

Un ejemplo numérico paso a paso

Supongamos cinco casas, con sus metros cuadrados () y su precio en millones ():

(m²) (millones)
5060
7078
9095
110118
130139

Los promedios son y . Aplicando la fórmula de mínimos cuadrados:

El modelo queda . La lectura es directa: cada metro cuadrado adicional agrega ≈ 0,99 millones al precio estimado. Para una casa de predecimos millones.

En código

Con scikit-learn, reproducir exactamente este ejemplo son tres líneas:

from sklearn.linear_model import LinearRegression
import numpy as np

X = np.array([[50], [70], [90], [110], [130]])  # metros cuadrados
y = np.array([60, 78, 95, 118, 139])            # precio en millones

modelo = LinearRegression().fit(X, y)

print(modelo.intercept_, modelo.coef_[0])  # ≈ 8.9  y  0.99
print(modelo.predict([[100]]))             # ≈ 107.9 millones
print(modelo.score(X, y))                  # R², cercano a 1

intercept_ es , coef_ son las pendientes y score devuelve el .

Cuando la fórmula cerrada no alcanza: descenso de gradiente

La solución matricial es exacta, pero invertir la matriz se vuelve costoso (o inestable) con muchísimas variables. En esos casos se ajustan los coeficientes de forma iterativa, dando pasos en la dirección que más reduce el error:

donde es la tasa de aprendizaje. Es el mismo motor que entrena a las redes neuronales, solo que aquí la función a minimizar es especialmente simple (convexa, con un único mínimo).

Regularización: cuando sobran variables

Con muchas variables el modelo puede sobreajustarse: memoriza el ruido de los datos de entrenamiento y generaliza mal. La regularización añade una penalización al tamaño de los coeficientes para mantenerlos "a raya":

  • Ridge () penaliza : encoge todos los coeficientes hacia cero sin eliminarlos.
  • Lasso () penaliza : puede llevar coeficientes exactamente a cero, haciendo selección de variables automática.

El hiperparámetro controla cuánta penalización aplicar: recupera la regresión clásica, y valores grandes producen modelos más simples y robustos.

Supuestos que conviene recordar

La regresión lineal asume, entre otras cosas, que:

  1. La relación entre e es aproximadamente lineal.
  2. Los errores tienen media cero y varianza constante (homocedasticidad).
  3. Las observaciones son independientes entre sí.

Cuando estos supuestos se violan demasiado, las predicciones pierden confiabilidad y conviene revisar los datos o probar otros modelos.

Tabla resumen

ConceptoFórmulaQué representa
ModeloLa recta que predice a partir de
InterceptoValor de cuando
PendienteCambio en por cada unidad de
ResiduoError de una predicción individual
Función de costoLo que el modelo minimiza
SoluciónMínimos cuadrados en forma matricial
Bondad de ajusteFracción de la variación explicada (0 a 1)
Cuándo usarlaCuándo evitarla
La salida es un número continuo (precio, temperatura, ventas)La salida es una categoría → usa regresión logística
La relación es aproximadamente linealLa relación es claramente curva o compleja
Quieres un modelo interpretable y rápidoHay muchas interacciones no lineales entre variables

Para llevar

La regresión lineal traza la recta que minimiza la suma de los errores al cuadrado. Es interpretable —cada coeficiente tiene un significado claro— y por eso sigue siendo la primera herramienta que todo científico de datos prueba antes de complicar el modelo.