Introducción: Árboles de decisión y la necesidad de la pureza

Los árboles de decisión son uno de los algoritmos de aprendizaje supervisados más intuitivos y ampliamente utilizados en el aprendizaje automático. Modelan las decisiones como estructura de árboles, donde los ganglios internos representan pruebas sobre características, las ramas representan los resultados de esas pruebas, y los nodos de hoja representan predicciones finales. Si usted está clasificando si un correo electrónico es spam o predecir los precios de la casa, los árboles de decisión ofrecen un enfoque transparente y legible.

El reto principal en la construcción de un árbol de decisión es decidir donde ] dividir los datos en cada nodo. El algoritmo debe elegir la característica y el valor dividido que mejor separa las clases de destino. Aquí es donde entropía] viene en. Entropía, prestada de la teoría de la información, proporciona una medida matemática de incertidumbre o de la impureza en un mínimo homogeneidad.

¿Qué es la Entropía?

En el lenguaje cotidiano, la entropía se refiere a aleatoriedad o caos. En el contexto de los árboles de decisión, la entropía cuantifica la cantidad de imprevisibilidad en un conjunto de datos con respecto a la variable objetivo. Si todos los ejemplos en un nodo pertenecen a la misma clase, el nodo es pura] y su entropía es cero.

Para un problema de clasificación binaria (por ejemplo, positivo vs. negativo), la entropía se define como:

Entropy = –p+ log2(p+) – p− log2(p−)

donde p+ es la proporción de ejemplos positivos y p− = 1 – p+. La base de logaritmo 2 se utiliza porque la información en bits se mide en binario. Cuando hay más de dos clases, la fórmula se generaliza a:

Entropía = – la divina pi log2(pi) para todas las clases i.

El valor resultante oscila entre 0 (perfectamente puro) y log2(k) para clases de k (impureza máxima). Para un caso binario, la entropía máxima es 1.0 cuando p+ = p− = 0.5.

Un ejemplo rápido

Considere un conjunto de datos de 10 muestras con 5 positivos y 5 negativos. Entropía = –0.5 log2(0.5) – 0.5 log2(0.5) = –0.5 * (–1) – 0.5 * (–1) = 0.5 + 0.5 = 1.0. Ahora considere un conjunto de datos con 9 positivos y 1 negativo: entropía = –0.9 log2(0.9) – 0.1 log2(0.1) 069 – 0.9

¿Por qué Base 2?

La elección de la base 2 está enraizada en la teoría de la información de Claude Shannon. Un poco es la unidad fundamental de la información, representando una opción binaria. Usando la base 2 significa entropía da el número promedio de bits necesarios para codificar la clase de una muestra aleatoria. Si ya sabes la distribución, la entropía inferior significa que se requieren menos bits para comunicar el resultado.

Gain de información: Cómo se dividen las guías de la entropía

Simplemente calcular la entropía no es suficiente; el objetivo es reducir] después de dividir. La ganancia de información (IG) mide la reducción esperada en la entropía causada por la partición de los datos según una característica. La característica y el valor dividido que producen el mayor beneficio de la información son elegidos para el nodo.

La fórmula para el aumento de la información es:

]Información Ganar = Entropía(parente) – gia (previaSi permanece inquieto / tóxicoS habit) * Entropy(Si)

donde S es el conjunto de datos de padres, Si son los subconjuntos de niños después de la división, y TEN. La duración denota el número de muestras. La suma es un promedio ponderado de las entropías de los niños.

Ejemplo de trabajo

Imagine un nodo padre con 30 muestras: 16 clase A y 14 clase B. Entropy(parent) = –(16/30) log2(16/30) – (14/30) log2(14/30) ♥ 0.996.

Ahora considere una división en la alimentación X que crea dos niños: Child1 tiene 20 muestras (15 A, 5 B) → entropía = –0,75 log2(0,75) – 0.25 log2(0,25) ♥ 0,8111; Child2 tiene 10 muestras (1 A, 9 B) → entropía = –0,1 log2(0.1) – 0,9 log2(0,9) ♥ 0,69/0 0,6/0.

Si otra división produce IG superior, esa división es preferida. El algoritmo evalúa todas las características y posibles umbrales de división para encontrar el mejor.

Limitaciones de la información obtenida

La ganancia de información tiende a favorecer las características con muchos valores distintos (por ejemplo, una columna de identificación única) porque dividirse en tal característica crea muchos niños puros, dando un alto IG. Esto puede llevar a la sobreajustación. Para contrarrestar eso, variantes como Gain Ratio] (utilizados en C4.5) normalizar IG por la información intrínseca de la combinación de los resultados.

Comparando la Entropía con la Impureza Gini

La impureza Gini es un criterio de división alternativo utilizado en el algoritmo CART (Arboles de clasificación y regresión). Mide la probabilidad de clasificar erróneamente una muestra elegida al azar si fue etiquetada aleatoriamente según la distribución de clases en el nodo.

Gini = 1 – bah pi2

Para un caso binario, Gini = 2p+(1 – p+). Maximum Gini es 0.5 (clase equilibrada) y mínimo es 0 (pura).

Tanto la entropía como la impureza Gini son funciones convexas, lo que significa que se comportan de forma similar en la práctica. La elección entre ellos suele descender a la eficiencia computacional: Gini no requiere logaritmos, por lo que puede ser ligeramente más rápido. Sin embargo, la entropía tiene una justificación más fuerte de la información-teorética. Muchas bibliotecas, incluyendo el scikit-learn, pueden elegir; empíricamente, las diferencias son pequeñas.

Entropía en árboles de regresión

Los árboles de decisión también pueden resolver problemas de regresión (predecir valores continuos). En la regresión, la entropía no es apropiada porque el objetivo no es categórico. En cambio, el algoritmo utiliza reducción de la variabilidad] o error cuadrado medio (MSE) como criterio de división. La idea es análoga: en cada nodo, nos separamos para minimizar la suma ponderada de variada de los valores del niño.

Para la regresión, la cantidad se llama a menudo ]mean squared error reduction] o ]ttal varianza reducción. El principio es exactamente el mismo que el aumento de la información: mide la impureza (variancia) del padre, luego el promedio ponderado de los niños, y maximice la diferencia.

Construyendo un árbol de decisión completo: desde la raíz hasta la hoja

Ahora que entendemos la entropía y la ganancia de información, vamos a caminar a través de cómo un algoritmo de aprendizaje de árboles de decisión (como ID3, C4.5, o CART) construye un árbol:

  1. Comienza con el conjunto de datos completo en el nodo raíz.
  2. Calcular la impureza de la raíz utilizando entropía (para clasificación) o varianza (para regresión).
  3. Para cada característica, evalúa cada punto de división posible (para características numéricas, clasificar valores y considerar puntos intermedios entre valores distintos consecutivos; para características categóricas, considere subconjuntos o codificación de un solo toque).
  4. Ganancia de información exacta (o relación de ganancia, reducción de Gini, etc.) para cada división.
  5. Elija la división que produce el mayor beneficio.
  6. Partition the data] y repiten de forma recurrente los pasos 2-5 para cada nodo infantil.
  7. ] Criterios de tarificación impiden el crecimiento infinito: profundidad máxima, muestras mínimas por hoja, disminución mínima de la impureza o cuando todas las muestras en un nodo pertenecen a una clase.
  8. Prune] el árbol (ya sea pre-corriendo a través de hiperparametros o post-corriendo ramas que no mejoran el rendimiento en un conjunto de validación) para combatir el exceso de ajuste.

Manejo de características categorísticas y numéricas

Trabajos de división basados en la entropía para ambos tipos de características, pero el enfoque difiere:

  • Características numéricas: El algoritmo clasifica los valores y pruebas únicos cada umbral posible. Por eficiencia, a menudo sólo se considera umbrales entre valores ordenados consecutivos donde la etiqueta de clase cambia.
  • Características categóricas: Para las divisiones binarias, el algoritmo puede considerar categorías de agrupación en dos subconjuntos. Para las divisiones multi-way (como en ID3), cada categoría se convierte en una rama. Sin embargo, los datos de fragmentos de varias vías se dividen rápidamente y son propensos a la sobreajustación, por lo que la mayoría de las implementaciones modernas utilizan divisiones binarias incluso para características categóricas.

Manejo de valores perdidos

Los conjuntos de datos del mundo real suelen contener valores perdidos. Los árboles de decisiones pueden manejarlos de varias maneras:

  • Separaciones de superficie: Al dividirse en una función, se utiliza una función de respaldo que mejor imita la división para las muestras que faltan en la característica principal.
  • ]Exposiciones prácticas: Asignar una muestra a múltiples niños con pesos proporcionales a la probabilidad de cada niño basada en datos no inmisos.
  • :Inscluye la imputación simple: Reemplazar los valores perdidos con el modo o mediana antes de construir el árbol.

Muchas bibliotecas, como scikit-learn, no manejan los valores perdidos internamente y esperan que se imputedan de antemano. XGBoost y LightGBM, sin embargo, aprenden la mejor dirección para los valores perdidos durante la formación.

Superada y ensayando

Un árbol de decisión que se cultiva a máxima profundidad memorizará perfectamente los datos de entrenamiento, incluyendo el ruido, lo que conduce a una mala generalización. La reducción de la entropía continúa hasta que cada hoja es pura, pero esto rara vez beneficia el rendimiento de la prueba.

Pre-pruning (Early Stopping)

Parar el crecimiento de los árboles antes de que se supere aplicando restricciones: limitar la profundidad máxima, requerir un número mínimo de muestras por hoja, o requerir una reducción mínima de la impureza (por ejemplo, la disminución de la entropía debe ser √≥ 0.01). Estos hiperparametros se sintonizan utilizando la validación cruzada.

Post-pruning (Cost-Complexity Pruning)

Crece el árbol completamente, luego elimina ramas que añaden poco valor. El algoritmo considera un intercambio entre la complejidad del árbol (número de hojas) y el error de entrenamiento. Un parámetro de complejidad (alfa) penaliza hojas adicionales. El Scikit-learn ofrece una poda de la complejidad de los costos a través de .

Ambas técnicas de poda ayudan a asegurar que las divisiones de entropía no sean demasiado granulares y que el árbol siga siendo interpretable mientras se generaliza bien.

Entropía en Métodos de Ensemble

Aunque un único árbol de decisión puede ser inestable (pequeños cambios en los datos pueden resultar en un árbol muy diferente), la entropía sigue siendo un concepto fundamental en métodos conjuntos:

  • Bosques de remo : Construir muchos árboles utilizando muestras de arranque y subconjuntos de características aleatorias. Cada árbol utiliza típicamente entropía o Gini para dividir.
  • Arbolado de granito: Se construyen árboles secuencialmente para corregir errores de árboles anteriores. La entropía se utiliza como objetivo (a través de la pérdida de la inter-entropía) para clasificar bosques en bibliotecas como XGBoost.

Comprender la entropía ayuda a interpretar por qué una división particular fue elegida en cualquier árbol individual, lo cual es esencial para el depuración modelo y el análisis de importancia.

Consideraciones prácticas al utilizar la entropía

Primero, compute entropy usando logarithms cuidadosamente — evite log(0) no definido definiendo 0 log2(0) como 0. Segundo, tenga en cuenta que los cálculos de entropía son sensibles al desequilibrio de clase; un nodo con 99% una clase y 1% otro tiene baja entropía pero puede no indicar una buena división si la clase minoritaria es importante. En ese caso, clases de ponderación o utilizar métricas alternativas (por ejemplo, F1)

Además, los árboles de decisión con entropía pueden ser intensivos en memoria para grandes conjuntos de datos porque evalúan todas las características y puntos de división. Las bibliotecas usan algoritmos como surtido y escan para calcular la entropía para las características numéricas en el tiempo O(n log n).

Referencias externas para una lectura más profunda:

Más allá de la clasificación: Entropía e información Ganada en la selección de características

La entropía no sólo se utiliza dentro de los árboles de decisión — también los poderes cuentan con técnicas de selección. ]Información corporal entre función y objetivo está directamente relacionado con el aumento de la información. Puede clasificar las características por su información mutua para reducir la dimensionalidad antes de entrenar otros modelos.

Por ejemplo, si la característica X tiene alta información mutua con el objetivo Y, entonces saber X reduce sustancialmente la incertidumbre sobre Y. Esto es exactamente la reducción de la entropía alcanzada por dividir en X. Las bibliotecas como scikit-learn proporcionan y ].

Limitaciones de los árboles de decisión basados en la entropía

A pesar de su poder, los árboles de decisión construidos con entropía tienen algunos inconvenientes:

  • Instability: Las pequeñas variaciones de conjunto de datos pueden cambiar drásticamente la estructura de los árboles.
  • Bias hacia características con muchos niveles: La ganancia de información favorece las características de alta cardiopatía. La relación de ganancia o el uso de sólo divisiones binarias ayuda.
  • Pobre manejo de la estructura aditiva: Los árboles son modelos constantes desgarrables, por lo que luchan por aprender relaciones lineales.
  • Naturaleza extrema: El algoritmo hace que las divisiones locales sean óptimas, lo que puede no ser globalmente óptimo.

En la práctica, la combinación de árboles de decisión basados en la entropía con métodos adecuados de afinación y conjunto de hiperparametros produce modelos robustos para muchos conjuntos de datos tabulares.

Conclusión: Entropía como una Fundación para las Diferencias Insightful

Entropy proporciona una forma de principio, teórica de información para evaluar la calidad de una división al construir un árbol de decisiones. Mediante la medición del trastorno en un conjunto de datos y el objetivo de reducirlo a cada paso, podemos construir árboles que partan eficientemente y con precisión el espacio de características. Ya sea que sea un estudiante aprendizaje de máquina o un practicante que implemente modelos, la comprensión profundiza su comprensión de cómo los árboles de decisiones “pensan”.

A medida que aplica los árboles de decisión, recuerde que la entropía es una herramienta, no un fin.Póngala con validación adecuada, poda y ensemble técnicas para desbloquear todo su potencial. Y si usted está administrando los oleoductos de datos para el aprendizaje automático, herramientas como Directus pueden ayudarle a recoger, organizar y servir los conjuntos de datos de alta calidad que dependen los árboles de decisión.