Calculando las sesgos y la variación en los modelos de aprendizaje supervisados: un enfoque paso a paso

La diferencia y la varianza son conceptos importantes en el aprendizaje supervisado que ayudan a evaluar el rendimiento de los modelos. Entender cómo calcular estas métricas puede mejorar la selección y ajuste de modelos.

Comprender las parcialidades y las diferencias

La diferencia se refiere al error introducido por aproximar un problema del mundo real con un modelo simplificado. La variación mide cuánto las predicciones del modelo fluctúan para diferentes conjuntos de datos de entrenamiento. Ambos influyen en la precisión y la capacidad de generalización del modelo.

Cálculo de las Bias

La parcialidad se calcula comparando la predicción promedio del modelo con el valor verdadero. Los pasos incluyen:

Cálculo de la variación

La variación mide la variabilidad de las predicciones del modelo. Para calcularlo:

Ejemplo práctico

Supongamos que usted tiene un conjunto de datos y entrena un modelo cinco veces en diferentes subconjuntos. Para un punto de prueba específico, las predicciones son 3.2, 3.8, 3.5, 3.7, y 3.3. El valor verdadero es 4.0.

La predicción media es 3.5. El sesgo cuadrado es (4.0 - 3.5)^2 = 0.25. La varianza se calcula mediante la promediación de las desviaciones cuadradas de cada predicción de 3.5, que resulta en 0.14.