civil-and-structural-engineering
Como melhorar a precisão da árvore de decisão com métodos de montagem
Table of Contents
Compreender as Limitações da Árvore de Decisão
Árvores de decisão são uma pedra angular da aprendizagem de máquina devido à sua estrutura intuitiva e facilidade de interpretação. Uma única árvore divide os dados recursivamente com base em limiares de funcionalidades, criando uma série de regras de if- thien que podem ser visualizadas e compreendidas por não especialistas. Contudo, esta simplicidade vem com desvantagens significativas. Uma árvore de decisão solitária é altamente sensível a pequenas variações nos dados de treino; uma divisão diferente perto da raiz pode produzir uma árvore completamente diferente. Esta instabilidade leva a uma alta variância, resultando frequentemente em sobreposição onde a árvore memoriza ruído em vez de aprender padrões verdadeiros. Por outro lado, uma árvore que é agressivamente podada ou limitada em profundidade pode ser inferior, faltando relações importantes nos dados. O resultado é um modelo que, embora interpretável, frequentemente proporciona precisão preditiva subótima em dados invisíveis. Os métodos de montagem abordam diretamente estas questões construindo várias árvores e agregando os seus resultados, aliviando erros individuais e produzindo previsões muito mais robustas.
O que são os métodos do conjunto?
Os métodos de montagem combinam vários modelos de base - neste caso, árvores de decisão - num único sistema preditivo. O princípio principal é que um grupo de alunos fracos (modelos que desempenham apenas um pouco melhor do que o acaso aleatório) pode ser combinado para formar um aprendiz forte. Esta abordagem explora a sabedoria da multidão: modelos individuais podem cometer erros, mas se esses erros não forem correlacionados, a média ou a votação entre muitos modelos os anula. As duas famílias dominantes de técnicas de conjuntos são embacking (agregação de arranques) e ] embootar[. Uma terceira categoria, ] empatar[[[FLT: 5]], usa um meta- learner para combinar previsões de modelos de base múltiplos. Cada metodologia tem forças e trocas únicas, e compreendê- los é essencial para maximizar a precisão de árvore de decisão.
Engarrafamento e Floresta Aleatória: Redução da Variância
Mecânica de Ensacar
A marcação funciona através do treino de árvores de decisão múltiplas em diferentes subconjuntos aleatórios dos dados de treino. Estes subconjuntos são criados através do arranque inicial — a amostragem com substituição — de modo que cada árvore veja uma fatia ligeiramente diferente do conjunto de dados original. Dado que as árvores são profundas (muitas vezes cultivadas sem poda), cada árvore individual tem uma variância elevada e um viés muito baixo. Quando as suas previsões são médias (para regressão) ou votadas (para classificação), a variância cai substancialmente sem um aumento significativo de viés. O resultado é um modelo que generaliza muito melhor do que qualquer árvore única. A marcação é particularmente eficaz quando os alunos de base são instáveis; as árvores de decisão são, sem dúvida, a família de modelos mais instável, tornando- os candidatos perfeitos.
Floresta aleatória: Engarrafamento com amostragem de recursos
A Floresta Aleatória estende o ensacamento introduzindo uma camada adicional de aleatoriedade. No ensacamento padrão, cada árvore considera todas as funcionalidades disponíveis ao fazer uma divisão. A Floresta Aleatória, por outro lado, limita cada uma das parcelas a um subconjunto aleatório de funcionalidades. Isto obriga as árvores a serem ainda mais diversas — elas não podem sempre confiar no preditor mais forte, de modo que aprendem padrões alternativos. A diversidade aumentada entre as árvores conduz a uma redução de variância e, tipicamente, a um desempenho mais elevado do que as árvores simples ensacadas. Os hiperparâmetros das teclas a sintonizar na Floresta Aleatória incluem o número de árvores (n estimadores), a profundidade máxima das árvores (max profundidade), as amostras mínimas por folha (min amostras folha) e o tamanho do subconjunto de funcionalidades (max características). Como regra do polegar, mais árvores quase sempre melhoram o desempenho até um ponto, mas diminuindo retorna a partir de algumas centenas.
Recurso externo: Documentação do classificador aleatório de aprendizagem do Scikit fornece detalhes de execução autorizados.
Aumentar: Reduzindo Seqüencialmente as Bias
Como Funciona o Impulsionamento
Ao contrário do bagging, que treina árvores em paralelo, aumentando a construção de árvores sequencialmente. A primeira árvore é treinada sobre o conjunto de dados completo. Após o treinamento, o algoritmo identifica instâncias mal classificadas (ou grandes resíduos em regressão) e aumenta o seu peso. A árvore seguinte é então treinada com um foco naqueles casos difíceis de prever, aprendendo efetivamente com os erros do seu antecessor. Este processo se repete para um número predefinido de iterações. Cada nova árvore tenta corrigir os erros coletivos de todas as árvores anteriores, reduzindo gradualmente o viés. A natureza sequencial significa que o aumento pode atingir um viés muito baixo, mesmo com árvores rasas (aprendedores fracos). No entanto, porque o algoritmo é ganancioso e pode sobreajustar- se se se permitido correr muito tempo, a regularização e a parada precoce são críticos.
AdaBoost (Ajudativa)
O AdaBoost foi um dos primeiros algoritmos práticos de reforço. Ele atribui pesos a cada instância de treinamento, atualizando- os após cada árvore. A previsão final é um voto maioritário ponderado (ou média ponderada) onde árvores com taxas de erro mais baixas recebem maior influência. O AdaBoost é sensível a dados barulhentos e outliers porque coloca ênfase extrema em pontos classificados de forma incorreta. No entanto, ele continua sendo um método rápido e eficaz para muitos problemas de classificação, especialmente quando combinado com cotos de decisão rasos (árvores com apenas uma divisão).
Aumentar o Gradiente
O aumento de gradientes generaliza o aumento para funções de perda arbitrárias e diferenciáveis. Em vez de ajustar os pesos de instância como o AdaBoost faz, o aumento de gradientes se adapta a cada nova árvore ao gradiente negativo da função de perda em relação à previsão atual. Para a perda de erro ao quadrado, isto equivale a ajustar resíduos. O algoritmo oferece uma enorme flexibilidade – você pode otimizar para regressão, classificação, classificação e até mesmo objetivos personalizados. As implementações mais bem sucedidas – XGBoost, LightGBM e CatBoost – adicional regularização crítica, estratégias de extração de árvores e otimizações computacionais que fazem o gradiente aumentar o método de ir- to para dados estruturados e tabulares.
XGBoost
XGBoost (Extremo Gradient Boosting) introduziu a regularização (L1 e L2) diretamente na função objetiva, juntamente com subamostragem de coluna e um algoritmo de pesquisa de divisão com conhecimento de esparsura que lida com valores em falta. Seus padrões de acesso com conhecimento de cache e computação extra-core tornam-no extremamente rápido. XGBoost tem dominado as competições Kaggle por anos devido à sua combinação de precisão, velocidade e flexibilidade. Os hiperparametros principais incluem taxa de aprendizagem (eta), profundidade máxima, relação de subamostra, colisma bytree e gama (redução mínima de perda necessária para uma divisão).
Recurso externo: A documentação de parâmetros XGBoost oferece um guia de sintonia abrangente.
LightGBM
A LightGBM utiliza uma técnica de divisão baseada em histogramas que permite que as características contínuas sejam colocadas em caixas discretas, acelerando drasticamente o treino mantendo a precisão. Apresenta a amostragem de um lado baseada em gradientes (GOSS) para focar em instâncias com grandes gradientes e o pacote de características exclusivas (EFB) para reduzir a dimensionalidade. A LightGBM é projetada para dados de grande escala e produz frequentemente crescimento de árvores em sentido foliar, que pode ser sobre-suficiente se a contagem de folhas não for regularizada. É particularmente adequada para características categóricas de alta frequência e grandes conjuntos de dados.
CatBoost
CatBoost (Categorial Boosting) lida com características categóricas nativamente usando codificação de destino ordenada, o que evita vazamento de alvo. Ele constrói árvores simétricas (crescimento equilibrado em sentido foliar) e usa uma estratégia orientada para permutação para reduzir o viés de gradiente. CatBoost muitas vezes atinge um desempenho forte fora da caixa com ajuste mínimo, especialmente em conjuntos de dados com muitas variáveis categóricas. Também inclui configurações padrão robustas para lidar com overfitting.
Aumentar vs. Engarrafamento: Quando usar cada
Métodos de engarrafamento como o Random Forest são robustos para o ruído e os outliers porque eles são médios de árvores profundas e overfit; eles raramente excedem os dados de treinamento para além do limite de desempenho. Métodos de reforço, especialmente o aumento de gradientes, podem atingir menor viés e muitas vezes maior precisão, mas requerem uma regularização cuidadosa e parada precoce para evitar o excesso de ajuste. Para conjuntos de dados com muitas características irrelevantes ou ruído forte, pode ser preferível ensacar. Para dados limpos e bem preparados onde o máximo de poder preditivo é necessário, aumentando tipicamente ganha. Muitos praticantes começam com o Random Forest como base e então mudam para um gradiente sintonizado impulsionando a implementação para o impulso final em precisão.
Empilhamento e Mistura: Combinando diferentes modelos
O empilhamento (generalização empilhada) vai além dos conjuntos somente de árvores, combinando previsões de diferentes tipos de modelos. Uma configuração típica de empilhamento usa um conjunto de modelos de base (por exemplo, uma Floresta Aleatória, um XGBoost, uma regressão logística e uma rede neural) treinada sobre os dados de treino completos. As suas previsões, muitas vezes fora de série para evitar fuga de dados, são então alimentadas como características num meta- colector (muitas vezes um modelo linear simples ou outra árvore). O meta- colector aprende a misturar as previsões de base de forma óptima. A mistura é uma variante mais simples onde os modelos de base são treinados num subconjunto dos dados de treino e avaliados num conjunto de espera para gerar meta- características. A empilhamento pode espremer o desempenho extra quando os modelos de base captam diferentes aspectos dos dados, mas adiciona complexidade e risco de sobre- ajuste se o meta- colector for demasiado poderoso. Para a maioria dos problemas práticos, um modelo de gradiente bem ajustado irá corresponder ou exceder o desempenho de empilhamento sem a sobrecarga de modelos de gestão de múltiplos.
Dicas práticas para melhorar o desempenho do conjunto
Assegurar a diversidade entre as árvores
Os métodos de agrupamento são tão fortes quanto a diversidade dos seus componentes. Se todas as árvores fizerem previsões idênticas, não há benefício em combiná- las. A diversidade surge do uso de diferentes subconjuntos de dados (amostras de bootstrap), subconjuntos de características diferentes e profundidades de árvores diferentes. Na Floresta Aleatória, reduzir o tamanho do subconjunto de características (max features) aumenta a diversidade, mas também pode aumentar o viés – uma troca que você deve ajustar. Ao aumentar, a diversidade vem do processo de correção de erros sequencial, mas se a taxa de aprendizagem for muito alta ou as árvores muito profundas, o conjunto pode convergir muito rapidamente e perder a diversidade.
Sintonização do hiperparametro
Cada método de conjunto tem o seu próprio conjunto de hiperparâmetros críticos. Para a Floresta Aleatória, o número de árvores é menos importante do que a profundidade e a fração de características. Para aumentar, a taxa de aprendizagem (encolher) e o número de árvores estão intimamente ligados: uma taxa de aprendizagem menor muitas vezes requer mais árvores, mas reduz o risco de sobreposição. Use a pesquisa em grade ou a otimização Bayesiana com validação cruzada para encontrar parâmetros ideais. Preste atenção especial aos parâmetros de regularização—lambda (L2), alfa (L1) e min child pessure em XGBoost; min data in leaf e lambda l1/lambda l2 em LightGBM; e l2 leaf reg em CatBoost.
Avaliação e avaliação cruzadas
Nunca avalie um conjunto nos mesmos dados usados para treiná-lo. Use a validação cruzada k-fold (k=5 ou 10) para estimar o desempenho fora da amostra. Ao aumentar, incorpore a parada precoce monitorando uma métrica de validação durante o treinamento – pare de adicionar árvores quando a métrica não melhorar para um número conjunto de rodadas. Para conjuntos empilhados, as previsões fora da dobra devem ser usadas para evitar vazamento de alvo no meta-learner.
Engenharia de Recursos e Seleção
Os métodos de montagem são robustos para características irrelevantes, mas a remoção de colunas de alto ruído ainda pode melhorar o desempenho e reduzir o tempo de treino. Use as pontuações de importância de recursos de um modelo preliminar de aumento de floresta aleatória ou gradiente para filtrar características. Considere criar características de interação, características embebidas ou transformações específicas de domínio que as árvores podem perder. A escala de recursos geralmente não é necessária para conjuntos baseados em árvores de decisão porque as divisões são baseadas em limiares em vez de distâncias.
Regularização e Parar cedo
O aumento é propenso a sobre-ajustar-se com muitas iterações ou árvores excessivamente complexas. Use o encolhimento (taxa de aprendizagem < 0,1), a profundidade da árvore limite (3-6 para a maioria dos problemas) e defina um número mínimo de amostras por folha. O parâmetro gama do XGBoost requer uma redução mínima de perda para qualquer divisão, agindo como regularizador. A parada precoce usando um conjunto de validação de hold-out é a única ferramenta mais eficaz para evitar o excesso de ajuste em aumento de gradiente.
Considere o custo computacional
O impulso é inerentemente sequencial, mas implementações como LightGBM e XGBoost oferecem distribuição e treinamento acelerado para mitigar isso. Se o tempo de treinamento for crítico, comece com o algoritmo baseado em histograma mais rápido da LightGBM. Se a interpretabilidade for mais importante, e você precisar de um modelo totalmente branco, uma única árvore de decisão pode ser preferível, mas um conjunto de algumas árvores rasas (por exemplo, 10-20 árvores em uma Floresta Aleatória) ainda pode fornecer uma interpretação razoável através de parcelas de importância de recursos.
Considerações e trocas comerciais do mundo real
Os métodos de montagem aumentam drasticamente a precisão, mas têm o custo de interpretar. Uma única árvore de decisão pode ser visualizada e explicada aos interessados; uma Floresta Aleatória de centenas de árvores não pode. Para indústrias regulamentadas onde a explanabilidade do modelo é obrigatória (por exemplo, pontuação de crédito, cuidados de saúde), você pode precisar usar modelos substitutos ou tamanho de conjunto limite. Além disso, note que, enquanto conjuntos reduzem a variância, eles não eliminam o viés. Se os alunos da base são todos tendenciosos na mesma direção (por exemplo, incapazes de modelar interações não- lineares), o conjunto herdará esse viés. Nesses casos, considere adicionar um tipo de modelo de base diversificado através de empilhamento, ou aplicar engenharia de recursos para capturar os padrões em falta.
Por fim, os conjuntos são mais intensivos e mais lentos para servir na produção, porque cada árvore deve avaliar a entrada. Técnicas como poda de modelo (remoção de árvores de baixa importância), usando árvores menores, ou converter um conjunto para uma única árvore de decisão através da destilação podem ajudar. Para inferência online com requisitos de latência rigorosos, um único modelo de aumento de gradiente bem ajustado com um número moderado de árvores (100–500) muitas vezes atinge o melhor equilíbrio entre precisão e velocidade.
Recurso externo: Encontro Aprendizagem na Wikipedia fornece uma ampla visão geral da teoria.
Recurso externo: Um Guia Prático para Reúna Métodos em Rumo à Ciência dos Dados oferece uma perspectiva clara e aplicada.
Conclusão
Os métodos de montagem são a maneira mais eficaz de melhorar a precisão e robustez dos modelos de árvores de decisão. Ao combinar várias árvores através de ensacamento, reforço ou empilhamento, você pode reduzir drasticamente os erros causados por sobreposição ou subconfiguração. A Random Forest fornece uma linha de base forte e fácil de usar que é resistente ao ruído. O aumento gradual – especialmente na forma de XGBoost, LightGBM ou CatBoost – empurra a precisão ainda mais ao custo de uma regularização cuidadosa. A melhor abordagem depende dos seus dados, recursos computacionais e da necessidade de interpretabilidade. Independentemente do método escolhido, ajuste adequado de hiperparametros, validação cruzada e engenharia de recursos, permanece essencial. Quando aplicado corretamente, o aprendizado de conjuntos transforma a árvore de decisão humilde em uma das ferramentas preditivas mais poderosas disponíveis no aprendizado de máquinas.