← Volver a Aprende con CDIA

Fundamentos del aprendizaje estadísticoMétricas de regresión

IntermedioAprendizaje estadístico9 min de lectura

Métricas de regresión

Cómo medir cuánto se equivoca un modelo que predice números: MAE, MSE, RMSE y R², qué castiga cada una y cuál reportar según la pregunta que tengas.

Entrenaste una regresión lineal para predecir el precio de una casa. Traza su recta, hace predicciones… ¿y ahora qué? ¿Cómo sabes si es buena? Con clasificación mirábamos aciertos y errores en una matriz de confusión, pero aquí no hay "acierto" ni "error": hay un número predicho que casi nunca cae exacto sobre el real. Lo que medimos es cuánto se equivoca, y por eso necesitamos otras métricas.

El residuo: la materia prima de todo

Todo parte de una idea simple. Para cada dato, el residuo es la diferencia entre el valor real y el que predijo el modelo:

Si predijiste $92 millones para una casa que se vendió en $100, el residuo es $8 millones. Un residuo positivo significa que te quedaste corto; uno negativo, que te pasaste. Todas las métricas que siguen son distintas formas de resumir esos residuos en un solo número.

metros cuadrados → precio →
Cada segmento punteado es un residuo: la distancia vertical entre el dato real y la predicción de la recta.

MAE: el error promedio, en las unidades de siempre

El error absoluto medio (Mean Absolute Error) es el más intuitivo: toma el valor absoluto de cada residuo y los promedia.

Un MAE de $5 millones significa, literalmente, que el modelo se equivoca en promedio $5 millones por casa. Esa es su gran virtud: se lee en las mismas unidades del dato y se lo puedes explicar a cualquiera. Su otra característica es que trata todos los errores por igual: equivocarse $10 millones una vez pesa lo mismo que equivocarse $1 millón diez veces.

MSE y RMSE: castigar los errores grandes

El error cuadrático medio (Mean Squared Error) eleva cada residuo al cuadrado antes de promediar:

Al elevar al cuadrado, un error de 10 no pesa 10 sino 100. Es decir, el MSE penaliza mucho más los errores grandes que muchos errores pequeños. Eso es deseable cuando una predicción muy desviada es especialmente costosa: para tasar una casa, fallar por $50 millones es mucho peor que fallar por $5 diez veces, aunque el MAE los vería parecidos.

El problema del MSE es que sus unidades son "pesos al cuadrado", que no significan nada. Por eso casi siempre reportamos su raíz, el RMSE (Root Mean Squared Error):

Así volvemos a las unidades originales (pesos), pero conservando ese castigo extra a los errores grandes. Una regla práctica: si el RMSE es bastante mayor que el MAE, tienes unos pocos errores muy grandes tirando del promedio —vale la pena ir a buscarlos—.

R²: ¿mejor que adivinar el promedio?

MAE y RMSE te dan un número en pesos, pero no responden "¿esto es bueno o malo?". Un RMSE de $5 millones es excelente para tasar casas y ridículo para predecir el precio de un café. El coeficiente de determinación () resuelve eso comparando tu modelo contra la predicción más tonta posible: decir siempre el promedio.

El numerador es el error de tu modelo; el denominador, el error de predecir siempre el promedio . Se interpreta como una proporción:

  • — predicciones perfectas, error cero.
  • — tu modelo no es mejor que decir el promedio a ciegas.
  • — sí, puede ser negativo: significa que lo haces peor que el promedio.

Un suele leerse como "el modelo explica el 85 % de la variabilidad del precio". Su ventaja es que no tiene unidades, así que sirve para comparar problemas distintos; su trampa es que siempre sube al agregar más variables, aunque sean inútiles (por eso existe el ajustado, que penaliza variables de más).

Cuál usar

No hay una métrica "correcta", hay una que responde tu pregunta:

  • MAE cuando quieres un error honesto y fácil de explicar, y todos los errores importan por igual.
  • RMSE cuando los errores grandes son especialmente caros y quieres que el modelo los evite.
  • cuando necesitas una nota sin unidades para comparar modelos o comunicar "qué tan bien" explica el fenómeno.

En la práctica se reportan juntas: el RMSE dice cuánto se equivoca en pesos, y el dice si eso es mucho o poco para el problema. Y, como siempre, se calculan sobre datos que el modelo no vio en el entrenamiento —con validación cruzada— porque medir el error sobre los mismos datos con que aprendió es engañarse solo.