¿Qué son los árboles de decisión y por qué trabajan para la analítica de RRHH

La atrición del empleado —la tasa a la que los trabajadores dejan una organización— es un problema costoso. La restitución de un empleado puede costar entre el 50% y el 200% de su salario anual cuando se integre en la contratación, a bordo y la pérdida de productividad. La analítica de RRHHHHHH tiene como objetivo identificar a los empleados en riesgo temprano para que las estrategias de retención puedan aplicarse antes de que una carta de renuncia se ponga en el escritorio del administrador.

Un árbol de la decisión] es un algoritmo de aprendizaje supervisado que modela las decisiones y sus posibles consecuencias como estructura de árboles. Cada nodo interno representa una prueba en una característica (por ejemplo, “¿Es la satisfacción del trabajo menos de 3 en una escala de 5 puntos?”), cada rama corresponde al resultado de esa prueba, y cada nodo de hoja tiene una clase predicha, en este caso, “delea”

Para la analítica de RRHHH, los árboles de decisión ofrecen un ajuste natural porque los resultados son fáciles de comunicar a los actores no técnicos. Un gerente de RRH puede ver un diagrama simple de árboles y ver inmediatamente que los empleados con puntajes de compromiso bajos y cortos de tenencia son los mayores riesgos de vuelo — ningún misterio de la caja negra requerido.

¿Por qué los árboles de decisión son especialmente útiles para la predicción de la atrición del empleado

La predicción de la atrición es un problema de clasificación, pero viene con características únicas que favorecen los árboles de decisión sobre muchos otros modelos:

  • Interpretabilidad: A diferencia de las redes neuronales o de las máquinas vectoriales, los árboles de decisión producen un conjunto de reglas explícitas. Puede rastrear cada predicción de nuevo a las condiciones exactas que lo llevaron. Esto es crítico para los equipos de RRH que necesitan justificar intervenciones para el liderazgo o cumplir con las regulaciones de empleo justo.
  • ]Manejo de datos reducidos: Los conjuntos de datos de RRHH contienen características numéricas (salarios, años en compañía, edad) y características categóricas (departamento, nivel educativo, género). Los árboles de decisión pueden manejar ambos sin requerir una codificación de una sola pieza.
  • ] La tolerancia a los datos: Los datos de RRHH en el mundo real son a menudo incompletos: los empleados saltan preguntas de encuesta, los campos quedan en blanco. Los árboles de decisión pueden trabajar con valores perdidos utilizando divisiones surrogadas o estrategias integradas en bibliotecas como la scikit-learn.
  • ] Importancia de la naturaleza: El algoritmo clasifica automáticamente el poder predictivo de cada variable. Esto ayuda a que los RRHH identifiquen los principales motores de la atrición, ya sea la distancia de conmutación, la frecuencia de horas extraordinarias o la falta de oportunidades de promoción.
  • No es necesario escalar características: La base de los árboles de decisión se divide en umbrales, no distancias, por lo que no necesita normalizar o estandarizar las características de entrada. Esto reduce el preprocesamiento de sobrecabeza.

Paso a paso: Construyendo un modelo de árbol de decisiones para la atracción

1. Recopilar y preparar los datos adecuados

La calidad de cualquier modelo de predicción depende de los datos que se entrenan. Para la predicción de la attrición, recopila registros históricos de empleados que incluyen tanto a los que se fueron como a los que se quedaron. Objetivo por lo menos seis a doce meses de datos históricos para capturar patrones significativos.

  • Demographics: age, gender, marital status, distance from home to work
  • Factores relacionados con la labor: departamento, función de trabajo, salario, bandera de horas extraordinarias, número de años en el papel actual, número de años con el administrador
  • Performance and engagement: performance rating, number of training hours last year, engagement survey scores (if available)
  • Señales conductuales: días ausentes, agravios presentados, número de proyectos, fecha de última promoción
  • Saldo de la vida laboral: porcentaje de viaje, tipo de horario de trabajo, horas extraordinarias

Tenga en cuenta los atributos protegidos (raza, género, edad) que pueden inadvertidamente sesgos predicción. Mientras que pueden incluirlos mejorar la precisión legalmente, debe probar para un impacto dispar y considerar las implicaciones de la equidad — un tema que regresamos más tarde.

2. Preprocesar el Dataset

Aunque los árboles de decisión son menos sensibles a la preparación de datos que otros algoritmos, algunos pasos siguen siendo esenciales:

  • ]Mantener valores perdidos: Para los modelos basados en árboles, puede o dejar filas con datos perdidos, imputar el medio/modo, o utilizar divisiones surrogadas. En la práctica, la imputación con el medio para características numéricas y el modo para características categóricas funciona bien.
  • ] codificar variables categóricas: La mayoría de las implementaciones de los árboles de decisión (por ejemplo, scikit-learn ) requieren entrada numérica. Usar la codificación de etiquetas para las categorías ordinal (por ejemplo, nivel educativo: escuela secundaria=0, licenciatura=1, master=2) y número de decisión de un día para las categorías de beneficio nominal.
  • Remove duplicados y aparadores: Los registros duplicados inflan artificialmente ciertos patrones. Los aficionados con valores extremos (por ejemplo, un empleado con 50 años de tenencia en una empresa de 30 años) pueden distorsionar las divisiones, así que considera la captura o eliminación de ellas.
  • Desequilibrio de clase: En la mayoría de las organizaciones, la atrición es rara, a menudo 5–15% del conjunto de datos. Esto puede hacer que el árbol predije “estré a todos y aún así lograr una alta precisión.

3. Dividir los conjuntos de entrenamiento y prueba

Para datos cronológicos ordenados —un caso común en RRHH— divididos a tiempo: entrenar en datos antiguos, probar datos más recientes. Esto simula predicciones de futuro. La división activada asegura que ambos conjuntos mantengan la misma proporción de los levadores como el conjunto de datos original, que es crítico para problemas de desequilibrio.

4. Capacitar al Clasificador del Árbol de la Decisión

Usando una biblioteca como la de la hoja de cálculo, entrenar un árbol de referencia es sencillo:

from sklearn.tree import DecisionTreeClassifier
model = DecisionTreeClassifier(random_state=42)
model.fit(X_train, y_train)

Esto encaja en un árbol con hiperparametros predeterminados, pero esos defectos rara vez son óptimos para un conjunto de datos de RRHH del mundo real. El árbol puede crecer profundo y sobrepase, realizando bien en los datos de entrenamiento pero mal en empleados no vistos.

5. Hiperparametros de los Tune para Prevenir el Excedimiento

Los hiperparametros más importantes para ajustarse en un árbol de decisión son:

  • max fund: Limita cuántas divisiones consecutivas puede hacer el árbol. Una profundidad de 5-10 es a menudo suficiente para conjuntos de datos de attrición con números moderados. La profundidad inferior reduce el sobreajuste.
  • min samples split: El número mínimo de muestras necesarias para dividir un nodo interno. El aumento de este valor (por ejemplo, a 20–50) obliga al árbol a considerar sólo las divisiones que ocurren en un subconjunto suficientemente grande, reduciendo el ruido.
  • min samples leaf: El número mínimo de muestras que deben permanecer en un nodo de hoja. Un valor de 10–30 asegura que las predicciones de hojas se basen en una muestra estadísticamente significativa.
  • criterion: “gini” o “entropía”. Ambos a menudo producen resultados similares; prueba ambos en la validación cruzada.
  • ]class weight: Se establece para "balanceado" para ajustar automáticamente pesos inversamente proporcionales a frecuencias de clase. Esta es una poderosa herramienta para manejar el desequilibrio de clase.

Use la búsqueda de cuadrícula o búsqueda aleatoria con 5 veces de validación cruzada para identificar la combinación que produce la mejor memoria (o cualquier métrica alinea con su objetivo de negocio).

6. Evaluar el modelo con la métrica apropiada

La precisión es engañosa para los datos de atrición desequilibrados. Un modelo que siempre predice “estancia” puede lograr una precisión de 90% si sólo el 10% de los empleados se van.

  • Precisión: De todos los empleados predijeron salir, ¿qué fracción realmente dejó? La alta precisión significa menos falsas alarmas.
  • Recall (Sensitivity): ¿Qué fracción de los actuales levadores hizo la captura modelo? Recordar alto significa que usted pierde menos a menos personas, que a menudo es la prioridad en la retención — es mejor intervenir innecesariamente que perder un empleado clave.
  • F1-score: La forma armónica de precisión y recuerdo. Una buena F1 en la clase minoritaria indica un modelo equilibrado.
  • AUC-ROC: Mide la capacidad del modelo para discriminar entre clases a través de umbrales. Los valores superiores a 0.8 se consideran buenos para la predicción de la atrición.
  • Matrimonio de la confusión: Descomponer los verdaderos positivos, los verdaderos negativos, los falsos positivos, los falsos negativos. Esto da un sentido concreto de cuántos “misos” ocurren.

Para el conjunto de pruebas, espere un árbol de decisión sintonizado para lograr un ROC-AUC entre 0.75 y 0.90 dependiendo de la calidad de los datos.

Interpretación del Árbol de Decisión: De las Reglas a la Acción

Una de las mayores fortalezas de un árbol de decisión es su transparencia. Una vez que el modelo está entrenado, puede visualizar el árbol usando o exportarlo como un gráfico. El árbol revelará las divisiones más influyentes. Por ejemplo, el nodo superior puede dividirse en "satisfacción de trabajo < 3.” If yes, the next split may be on “overtime > 10 horas por semana".

También puede extraer importanciaes de las características. Estos números suman a 1.0 y muestran cuánto cada característica contribuyó a reducir la impureza. En un conjunto de datos típico de la atrición, las características principales son a menudo:

  • Satisfacción de trabajo / puntuación de compromiso
  • Años desde la última promoción
  • Indicador de horas extraordinarias
  • Ingresos mensuales
  • Número de empresas trabajadas en

Estas ideas permiten a RRH diseñar intervenciones específicas: por ejemplo, una prima de retención para los altos rendimientos que no han sido promovidos en tres años, o una opción de trabajo-desde casa para los empleados con largas comunicaciones.

Desafíos y cómo superarlos

Superficie

El obstáculo más común con los árboles de decisión es que pueden llegar a ser demasiado complejos, memorizando el ruido en los datos de entrenamiento. Un árbol sin límite de profundidad puede crecer a profundidades extremas, esencialmente aprendiendo el entrenamiento establecido por el corazón. Los signos de sobreajuste incluyen una precisión de entrenamiento muy alta (90%+ con perfecto recuerdo) pero mucha menor precisión de prueba.

Clase de equilibrio

Con tasas de atrición a menudo inferiores al 15%, el árbol favorecerá naturalmente a la clase mayoritaria. Para contrarrestar esto, utilice en la aprensión de cikit, que asigna costos de misclasificación más altos a la clase minoritaria. Alternativamente, muestre los datos de entrenamiento a través de SMOTE (Tecnique de Superación de la minoría sintética) para crear ejemplos sintéticos de levaduras.

Instalabilidad

Los árboles de decisión son sensibles a pequeños cambios en los datos de entrenamiento. Una división diferente de pruebas de tren o una ligera variación de los valores de características pueden producir una estructura de árboles muy diferente. Esta inestabilidad puede erosionar la confianza en las reglas del modelo. Un remedio es utilizar un conjunto de árboles (Random Forest o Gradient Boosting), que promedios a través de muchos árboles y produce predicciones estables y a menudo más precisas, aunque a costa de alguna interpretabilidad.

Bias y equidad

Si los datos de formación contienen prejuicios históricos, por ejemplo, patrones de atrición anteriores que se correlacionan con raza o género, el árbol puede aprender esos patrones y producir recomendaciones discriminatorias. Siempre auditar el modelo para un impacto dispar: comprobar si las tasas de predicción difieren significativamente en los grupos protegidos. Si es así, considerar eliminar características sensibles o usar algoritmos de conciencia de equidad.

Más allá de un árbol único: Conjunto de métodos para la precisión superior

Para muchos conjuntos de datos de RRHH, un único árbol de decisión con afinación hiperparamétrica es una base sólida, pero rara vez alcanza el máximo rendimiento posible. Ahí es donde entran los métodos de conjunto.

  • Random Forest] construye muchos árboles de decisión sobre subconjuntos de los datos y promedio sus predicciones. La reducción de la varianza suele producir una mejor generalización que un solo árbol. La importancia de la alimentación todavía puede extraerse a través del bosque, manteniendo cierta interpretabilidad. Random Forest es generalmente el primer paso hacia arriba de un solo árbol.
  • ]Aprendizaje de gradientes (por ejemplo, XGBoost, LightGBM) construye árboles secuencialmente, con cada nuevo árbol corrigiendo los errores del anterior. Estos modelos a menudo logran una precisión de vanguardia pero son menos interpretables y requieren un ajuste más cuidadoso para evitar sobrecaídos. Para RRHH, los árboles elevados son útiles cuando se hace un ejemplo predictivo.
  • Explicable Boosting Machines (EBM)] son un compromiso: son modelos aditivos que pueden captar interacciones y son plenamente interpretables. Pueden ser una mejor opción para los RRH cuando se requiere una estricta transparencia.

Un flujo de trabajo común es comenzar con un único árbol de decisión para la interpretación y la entrada de los interesados, luego se gradúa a un Bosque Aleatorio para el despliegue de la producción. Siempre se puede explicar las predicciones del conjunto utilizando los valores SHAP (ExPlanaciones Aditivas de SHAP) que muestran cómo cada característica contribuyó a la puntuación de riesgo de un empleado específico.

Implementar un sistema de predicción de la atrición en su Organización

Implementar un modelo de árbol de decisión en un entorno de RRHH implica más que construir el clasificador en un cuaderno de Jupyter. Aquí están pasos prácticos para pasar del prototipo a la producción:

  1. ]Integrar con su HRIS: Retirar datos regularmente (semana o mensual) de su Sistema de Información sobre Recursos Humanos. Automatizar el oleoducto de extracción y preprocesamiento para que el modelo reciba datos frescos sin intervención manual.
  2. Definir un umbral de riesgo: Decidir un corte de probabilidad para los empleados que marcan. Establecer un umbral alto (por ejemplo, 0.7) reduce falsos positivos pero puede perderse empleados en riesgo; un umbral inferior (por ejemplo, 0.3) captura más personas pero requiere más atención de gerente. Trabajar con socios comerciales de HR para encontrar un intercambio aceptable.
  3. Construir un tablero de instrumentos: Visualizar los puntajes de riesgo predichos junto con las características clave. Mostrar qué departamentos tienen la mayor concentración de empleados de alto riesgo. Usar colores de la luz del tráfico (verde, amarillo, rojo) para hacerlo factible.
  4. ]Crear un bucle de retroalimentación: Después de una intervención (por ejemplo, una entrevista de estancia, una promoción, un ajuste salarial), registra el resultado. ¿Se ha alojado el empleado por lo menos otros seis meses? Use estos nuevos datos para reentrenar el modelo periódicamente, cada trimestre es común. El modelo de monitoreo deriva (cuando las relaciones entre características y la atrición cambianamiento con el tiempo) es esencial.
  5. Garantizar el cumplimiento y la ética: Documentar las características, reglas de decisión y desempeño de tu modelo. Ejecutar las auditorías de equidad en cada reentrenamiento. Involucrar equipos jurídicos y de diversidad en la implementación para abordar cualquier consecuencia no deseada.

Conclusión: Árboles de decisión como una Fundación para la Retención más inteligente

Los árboles de decisiones ofrecen un punto de partida práctico e interpretable para los equipos de RRH que buscan predecir qué empleados pueden abandonar. Sus reglas claras ayudan a superar la brecha entre la ciencia de datos y la acción empresarial, permitiendo a los profesionales de RRH diseñar intervenciones específicas en lugar de depender de adivinanzas. Mientras que un único árbol de decisiones no puede alcanzar la máxima precisión en conjuntos de datos complejos, sirve como una base valiosa que puede ampliarse con métodos conjuntos de conjuntos a medida en que aumenta la madurez analítica de la organización.

El valor real de los modelos de atrición de árboles de decisión no está en el algoritmo en sí, sino en las acciones que inspiran. Cuando se puede determinar que los empleados con puntajes de compromiso bajos y registros de promoción deficientes son 4× más propensos a salir, se pueden implementar programas de retención enfocados: planes de desarrollo de carreras para ese segmento, entrenamiento de gerentes o ajustes de compensación.

Para más información, vea la documentación de la hoja de cálculo , un tutorial de la lucha , y esto Resumen de la historia de la analítica de RRHH . Para una mayor inmersión en los modelos de la clase de recursos, la decisión [SHLT7]