Table of Contents
Los árboles de decisión son un elemento básico de los flujos de trabajo de aprendizaje automático, preciados por su estructura intuitiva y su interpretación directa. Potencian todo desde evaluaciones de riesgo crediticio hasta el diagnóstico médico, a menudo sirviendo como el algoritmo de ir a los científicos de datos que necesitan explicar las predicciones a los actores no técnicos. Sin embargo, a pesar de su robustez, los árboles de decisión no son inmunes a un problema sutil pero persistente:
En este artículo, exploraremos qué es la multicollinearidad, por qué importa específicamente para los árboles de decisión, y un conjunto de estrategias de acción para mitigar su impacto. Ya sea que usted es un científico de datos que enseña un curso o un practicante que refina un modelo de producción, estas técnicas le ayudarán a construir árboles de decisión más limpios y generalizables.
¿Qué es la multicollinearidad?
Multicollinearidad se refiere a una situación en la que dos o más variables predictoras en un problema de regresión o clasificación están relacionadas linealmente con un alto grado. Cuando la correlación entre variables es fuerte, los datos subyacentes contienen información sobreimpuesta que puede confundir muchos modelos de aprendizaje estadístico y automático. En modelos lineales, la multicollinearidad infla errores estándar y hace que las estimaciones de coeficiente no sean compatibles.
Hay dos tipos primarios de multicollinearidad que deben ser conscientes de:
- Perfect multicollinearity — un predictor es una combinación lineal de otros. Esto es raro en datos reales a menos que una característica haya sido duplicada involuntariamente.
- La multicollinearidad de alto (imperfecto)] — los predictores están fuertemente, pero no perfectamente correlacionados. Esto es mucho más común y es el foco de la mayoría de las estrategias de mitigación.
Por qué la multicollinealidad sigue siendo importante en los árboles de decisión
Los árboles de decisión no son paramétricos y a menudo se describen como inmunes a la multicollinearidad. Aunque es cierto que los árboles no requieren las mismas suposiciones de independencia como modelos lineales, las características correlativas todavía presentan problemas prácticos:
- Sesgo de selección de segmentos] — cuando hay dos características muy correlativas disponibles, el árbol puede elegir arbitrariamente uno para la primera división, ignorando el otro. Esto hace que los árboles individuales inestables; pequeños cambios en los datos pueden hacer que el árbol se mueva que característica que se elige.
- Overfitting] — características redundantes ofrecen múltiples oportunidades para que el árbol se divida en esencia la misma información, aumentando la profundidad y la complejidad sin mejorar la generalización.
- La importancia de la característica más destacada — las puntuaciones de importancia se dividen entre los predictores correlacionados, diluyendo la aparente contribución de cada uno y dificultando la identificación de las variables que realmente impulsan las predicciones.
- ] La interpretación disminuida] — un árbol que se divide en ambos y (que son casi idénticos) es más confuso y más difícil de podar que uno construido con características limpias e independientes.
For these reasons, teaching practitioners to detect and handle multicollinearity before feeding data into a decision tree is a core part of building robust models.
Detectar Multicollinearidad en sus datos
Antes de decidir cómo arreglar la multicollinearidad, primero debe identificarla. Dos de las herramientas de detección más comunes son la matriz de correlación y el Factor de Inflación de Variancia (VIF).
Usando una matriz de correlación
El enfoque más simple es calcular coeficientes de correlación entre todas las características numéricas de Pearson. Una mapa de calor de la matriz de correlación revela rápidamente racimos de variables altamente correlativas. Una regla común del pulgar es a pares de bandera con para una investigación posterior, aunque el umbral puede ser ajustado basado en el conocimiento de dominio.
Factor de inflación de la variabilidad
El VIF mide cuánto se infla la varianza de un coeficiente de regresión debido a la multicollinearidad. Para cada característica, VIF se calcula registrando esa característica contra todos los demás y utilizando la fórmula . Un VIF superior a 5 o 10 se considera a menudo un signo de multicollinearidad problemática, aunque estos umbrales no son absolutos. Muchas bibliotecas estadísticas ofrecen una función VIF fuera del cuadro;
External resource:] La documentación VIF proporciona detalles y ejemplos de la aplicación.
Estrategias para manejar la multicollinearidad en los árboles de decisión
Una vez que haya identificado las características multicolores, el siguiente paso es decidir cómo manejarlas. Las siguientes estrategias son especialmente eficaces para los modelos de árboles de decisión.
1. Selección de características
La selección de los valores es a menudo la solución más simple e interpretable. El objetivo es retener sólo un subconjunto de predictores que están más débilmente correlacionados entre sí, mientras que preserva la señal predictiva.
- umbral de correlación] — computar la matriz de correlación y eliminar una característica de cada par correlacionado por encima de un umbral elegido (por ejemplo, ). Que característica que usted cae debe ser guiado por la experiencia de dominio, el costo de característica, o la facilidad de medición.
- Selección basada en VIF — computativamente VIF para todas las características, suelte el VIF más alto sobre un corte, y repita hasta que todas las características restantes tengan valores VIF aceptables.
- Métodos de desbrochado — utilizar la selección de futuro, la eliminación atrasada o la eliminación de características recursivas (RFE) específicamente adaptado al algoritmo de árbol de decisiones. Aunque computacionalmente más caros, estos métodos optimizan directamente para el rendimiento de los árboles.
La selección de las características tiene el beneficio añadido de reducir los costos de recogida y almacenamiento de datos en los sistemas de producción, y mantiene el árbol simple y fácil de explicar.
2. Reducción de la dimensión con PCA
Cuando las características de desplegamiento son indeseables porque cada variable tiene un significado de dominio único, el análisis principal de componentes (PCA) ofrece una alternativa: transforma los predictores originales correlacionados en un conjunto más pequeño de componentes no relacionados que capturan la mayor parte de la varianza en los datos.
- Advantages] — PCA elimina la multicollinearidad por completo, reduce el ruido y puede mejorar la generalización cuando el número de características es grande en relación con el número de muestras.
- Trade-offs] — la mayor desventaja es la pérdida de interpretabilidad. Un componente es una combinación lineal ponderada de características originales; puede ser difícil explicar qué significa una división en en términos de negocio. Además, PCA no es supervisada y puede descartar información que no se captura por varianza pero es importante para la variable objetivo.
A pesar de estos cambios, PCA es una poderosa herramienta para la preparación de datos para los árboles de decisión, especialmente cuando se combina con métodos de conjunto.
3. Regularización en modelos de base arbolada
Aunque la regularización se asocia con mayor frecuencia con modelos lineales (páginas L1/L2, los árboles de decisión tienen sus propias formas de regularización que pueden reducir el exceso de equipamiento estimulado por características multicolores:
- Las muestras mínimas por división] — aumentando obligan al árbol a requerir más datos antes de hacer una división, reduciendo la posibilidad de dividirse en una característica redundante puramente por casualidad.
- Profundidad máxima] — La capping impide que el árbol crezca lo suficientemente profundo como para explotar las características correlativas.
- ] Disminución de la impureza mínima — el ajuste garantiza que sólo se realizan divisiones que reduzcan significativamente la impureza, filtrando las divisiones impulsadas por el ruido de la multicoloración.
- La poda de cost-complexity (CCP)] — post-pruning with permite que el árbol sea cortado después del crecimiento, eliminando ramas que dependen de divisiones redundantes.
Aplicar una fuerte regularización puede ayudar a un árbol de decisiones a ignorar correlaciones espurias, pero no es una bala de plata, no aborda el problema subyacente de las características redundantes.
]Recurso externo: La documentación de la ciencia sobre la poda de la complejidad de los costos proporciona un claro ejemplo de cómo aplicar la regularización de los árboles.
4. Métodos conjuntos: Bosques aleatorios y bosificación de ingredientes
Los métodos de conjunto son quizás la forma más robusta de manejar la multicollinearidad en los modelos arbolados. Combinando muchos árboles, se asemeja a las inestabilidades causadas por las características correlativas y producen predicciones más estables.
- Random Forests] — cada árbol se entrena en una muestra de arranque de los datos y considera sólo un subconjunto aleatorio de características en cada división. Esta característica aleatoria rompe el dominio de cualquier prededor correlativo único, obligando al bosque a explorar divisiones alternativas. La predicción final es un promedio sobre muchos árboles, que se suaviza sobre la opción de características arbitrarias.
- ] Máquinas de Boosting de Gradiente (GBMs)] — el impulso de la construcción de árboles secuencialmente, cada una corregiendo los errores de su predecesor. Las características relacionadas pueden ser seleccionadas a través de los árboles, pero el refinamiento iterativo reduce el impacto de la multicollinearidad en el rendimiento general.
Los métodos conjuntos no eliminan la multicollinealidad, pero lo hacen mucho menos dañino. Para muchos practicantes, el uso de un Bosque Aleatorio o GBM es la manera más simple de ignorar el problema sin preprocesamiento explícito.
Implementación práctica: Guía de paso a paso
Caminemos por un flujo de trabajo representativo para manejar la multicollinearidad en un proyecto de árbol de decisiones. Usaremos un conjunto de datos hipotético de viviendas con características como el vídeo cuadrado, número de dormitorios, número de baños, tamaño de lotes y año construido, muchos de los cuales están naturalmente correlacionados.
Paso 1: Detectar la multicollinearidad
En primer lugar, computar la matriz de correlación y VIF para todas las características numéricas. En nuestro ejemplo, el material cuadrado y el número de dormitorios pueden tener una correlación de 0.82, y los valores VIF para ambos podrían superar 6. Esto confirma la multicollinearidad problemática.
Paso 2: Elija una estrategia de mitigación
Debido a que la interpretación es importante para un modelo de estado real, optamos por selección de objetos en lugar de PCA. Decidimos mantener el material cuadrado (que es más granular y a menudo más predictivo) y el número de gotas de habitaciones. También revisamos para otros pares correlativos y eliminamos el tamaño de lote si muestra VIF por encima de 10 después de la primera gota.
Paso 3: Capacitar al Árbol de la Decisión
Con el conjunto de características reducidas, entrenamos un árbol de decisión usando un razonable (por ejemplo, 6) y (por ejemplo, 20) para evitar el sobreajuste. El árbol resultante es más simple, con menos nodos, y los puntajes de importancia característica se concentran ahora en variables genuinamente distintas.
Paso 4: Validar y comparar
Comparamos el árbol entrenado en el conjunto de datos completo contra el árbol entrenado en las características seleccionadas. Aunque el árbol completo podría lograr un error de entrenamiento ligeramente inferior, el árbol de la alimentación seleccionado debe demostrar mejores puntuaciones de la validación cruzada y menos varianza entre pliegues.
Para una capa extra de robustez, también formamos un Bosque Aleatorio en el conjunto de datos original. El rendimiento del bosque debe coincidir o superar el del árbol de decisiones podados, confirmando que los métodos de conjunto son una alternativa viable cuando la selección de características no es deseable.
Pitfalls comunes y cómo evitarlos
Incluso con las mejores intenciones, pueden ocurrir errores cuando se maneja la multicollinearidad en los árboles de decisión. Aquí están los obstáculos más frecuentes:
- Desmontaje de funciones de mayor tamaño] — desplegar una variable sólo porque está correlacionada con otra puede desperdiciar una señal valiosa. Considere siempre la contribución predictiva de cada característica y utilice el conocimiento de dominio para guiar la eliminación.
- Ignorar los efectos de interacción — en algunos casos, dos características correlativas juntas llevan información que ni lleva sola. La eliminación de una persona puede dañar el rendimiento. En estas situaciones, la reducción de la dimensionalidad o los métodos de conjunto son mejores opciones.
- Aplicando PCA sin escalar — PCA es sensible a la escala de características. Siempre estandarizar los predictores numéricos a cero media y varianza unitaria antes de realizar PCA.
- Suponiendo que los umbrales VIF sean universales] — un VIF de 10 es un corte común, pero en pequeños conjuntos de datos o dominios con fuertes correlaciones naturales, incluso los umbrales inferiores pueden ser apropiados. Examinar el contexto en lugar de aplicar ciegamente reglas.
- ]Forgetting to check after feature engineering — multicollinearity can be introduced when creating polynomial features, ratios, or interaction terms. Re-evaluate correlations after every feature engineering step.
Conclusión
La multicollinearidad no puede romper un modelo de árbol de decisión de la misma manera que rompe una regresión lineal, pero todavía socava la estabilidad, la interpretabilidad y la generalización. Detectando características correlativas tempranamente, aplicando una selección de características reflexivas o reducción de la dimensionalidad, y complementando árboles con métodos de conjunto como los Bosques Aleatorios, se pueden construir modelos tanto precisos como resistentes.
External resource: Para una inmersión más profunda en el VIF y su aplicación para la selección, vea el Wikipedia article on Variance Inflation Factor. Para un tutorial práctico sobre la construcción de árboles de decisión con escikit‐learn, consulte el