Visão geral
- Como você divide uma árvore de decisão? Quais são os diferentes critérios de divisão ao trabalhar com árvores de decisão?
- Saiba tudo sobre os métodos de divisão de árvore de decisão aqui e domine um algoritmo de aprendizado de máquina popular
Introdução
As árvores de decisão são simples de implementar e igualmente fáceis de interpretar. Costumo confiar em árvores de decisão, como meu algoritmo de aprendizado de máquina, se você está iniciando um novo projeto ou competindo em um hackathon.
E as árvores de decisão também são uma ideia para os iniciantes no aprendizado de máquina!! Mas as perguntas a fazer (e saber a resposta) filho:
- Como você divide uma árvore de decisão?
- Quais são os diferentes critérios de divisão?
- Qual é a diferença entre Gini e Ganho de Informação?
Se você não tem certeza, mesmo uma dessas questões, Você veio ao lugar certo! A árvore de decisão é um algoritmo de aprendizado de máquina poderoso que também serve como base para outros algoritmos de aprendizado de máquina complexos e amplamente usados, como Floresta aleatória, XGBoost, e LightGBM. Você pode imaginar por que é importante aprender sobre esse assunto!!

As bibliotecas de programação de hoje tornaram mais fácil usar qualquer algoritmo de aprendizado de máquina, mas isso vem com o custo de uma implementação oculta, o que é fundamental para compreender totalmente um algoritmo. Outra razão para essa luta sem fim é a disponibilidade de várias maneiras de dividir os nós da árvore de decisão, o que aumenta a confusão.
Você já se deparou com essa luta? Não foi possível encontrar uma solução? Neste artigo, eu vou explicar 4 métodos simples para dividir un nóO Nodo é uma plataforma digital que facilita a conexão entre profissionais e empresas em busca de talentos. Através de um sistema intuitivo, permite que os usuários criem perfis, Compartilhar experiências e acessar oportunidades de trabalho. Seu foco em colaboração e networking torna o Nodo uma ferramenta valiosa para quem deseja expandir sua rede profissional e encontrar projetos que se alinhem com suas habilidades e objetivos.... en un árbol de decisión.
Presumo familiaridade com os conceitos básicos de regressão e árvores de decisão. Aqui estão dois cursos gratuitos populares para aprender rapidamente ou aprimorar conceitos-chave:
Terminologias básicas de árvore de decisão
Vamos revisar rapidamente as terminologias principais relacionadas às árvores de decisão que usarei ao longo do artigo..

- Nó pai-filho: Um nó dividido em subnós é conhecido como nó principal, e esses subnós são conhecidos como nós filhos. Uma vez que um nó pode ser dividido em vários subnós, um nó pode atuar como o nó pai de muitos nós filhos
- Nó raiz: O nó mais alto em uma árvore de decisão. Não tem nó pai. Representa toda a população ou amostra
- Nós de folha / terminal: Os nós que não têm nenhum nó filho são conhecidos como nós terminais / Folha
O que é divisão de nó em uma árvore de decisão e por que isso é feito??
Antes de aprender qualquer assunto, Acho que é essencial entender por que você está aprendendo. Isso ajuda a entender o objetivo de aprender um conceito. Então, Vamos entender por que aprender sobre a divisão de nós em árvores de decisão.
Uma vez que todos sabem quão amplamente as árvores de decisão são usadas, não há como negar o fato de que aprender sobre árvores de decisão é uma obrigação. Uma árvore de decisão toma decisões dividindo os nós em subnós. Este processo é feito várias vezes durante o processo de treinamento até que apenas os nós homogêneos permaneçam.. E é a única razão pela qual uma árvore de decisão pode funcionar tão bem. Portanto, divisão de nós é um conceito-chave que todos devem saber.
A divisão de nós, ou apenas a divisão, é o processo de dividir um nó em vários subnós para criar nós relativamente puros. Existem várias maneiras de fazer isso, que pode ser dividido em duas categorias com base no tipo de variável de destino:
- Variável de alvo contínua
- Variável objetiva categórica
- Impureza de Gini
- Ganho de informação
- Chi ao quadrado
Nas próximas seções, veremos cada método de divisão em detalhes. Vamos começar com o método da primeira divisão: redução da variância.
Método de divisão da árvore de decisão n. ° 1: redução da variância
A redução da variância é um método de divisão do nó que é usado quando a variável de destino é contínua, quer dizer, problemas de regressão. É assim chamado porque usa a variância como uma medida para decidir a característica em que o nó é dividido em nós filhos.

A variância é usada para calcular a homogeneidade de um nó. Se um nó for completamente homogêneo, então a variância é zero.
Aqui estão as etapas para dividir uma árvore de decisão, reduzindo a variância:
- Para cada divisão, calcular individualmente a variância de cada nó filho
- Calcule a variância de cada divisão como a variância média ponderada dos nós filhos
- Selecione a divisão com a menor variação
- Execute as etapas em 1 al 3 até que nós completamente homogêneos sejam alcançados.
O vídeo a seguir explica de forma excelente a redução da variância usando um exemplo:
Método de divisão da árvore de decisão n. ° 2: ganho de informação
Agora, ¿qué pasa si tenemos una variávelEm estatística e matemática, uma "variável" é um símbolo que representa um valor que pode mudar ou variar. Existem diferentes tipos de variáveis, e qualitativo, que descrevem características não numéricas, e quantitativo, representando quantidades numéricas. Variáveis são fundamentais em experimentos e estudos, uma vez que permitem a análise de relações e padrões entre diferentes elementos, facilitando a compreensão de fenômenos complexos.... objetivo categórica? Reduzir a variância não será suficiente.
Nós vamos, a resposta é ganho de informação. O ganho de informação é usado para dividir os nós quando a variável de destino é categórica. Ele trabalha com o conceito de entropia e é dado por:
![]()
A entropia é usada para calcular a pureza de um nó. Quanto menor o valor de entropia, quanto maior a pureza do nó. A entropia de um nó homogêneo é zero. Como subtraímos a entropia de 1, o ganho de informação é maior para os nós mais puros com um valor máximo de 1. Agora, Vamos dar uma olhada na fórmula para calcular a entropia:

Passos para dividir uma árvore de decisão usando ganho de informação:
- Para cada divisão, calcular individualmente a entropia de cada nó filho
- Calcule a entropia de cada divisão como a entropia média ponderada dos nós secundários
- Selecione a divisão com a entropia mais baixa ou o maior ganho de informação
- Até você atingir nós homogêneos, repita os passos 1-3
Aqui está um vídeo sobre como usar o ganho de informação para dividir uma árvore de decisão:
Método de divisão da árvore de decisão # 3: Impureza de Gini
Impureza de Gini é um método para dividir nós quando a variável de destino é categórica. É a maneira mais popular e simples de dividir uma árvore de decisão. O valor da impureza de Gini é:
![]()
Esperando, O que é gini?
Gini é a probabilidade de rotular corretamente um item escolhido aleatoriamente se ele foi rotulado aleatoriamente de acordo com a distribuição do rótulo no nó. A fórmula de Gini é:

E a Impureza Gini é:

Quanto menor a impureza de Gini, quanto maior a homogeneidade do nó. A impureza Gini de um nó puro é zero. Agora, você pode estar pensando que já sabemos sobre o ganho de informação, então, Por que precisamos da Impureza Gini?
A impureza Gini é preferível ao ganho de informação porque não contém logaritmos que são intensivos em computação.
Aqui estão as etapas para dividir uma árvore de decisão usando Gini Impurity:
- Semelhante ao que fizemos para obter informações. Para cada divisão, calcular individualmente a impureza Gini de cada nó filho
- CCalcule a impureza Gini de cada divisão como a impureza Gini média ponderada dos nós filhos.
- Selecione a divisão com o menor valor de Impureza Gini
- Até você atingir nós homogêneos, repita os passos 1-3
E aqui está a Impureza de Gini em forma de vídeo:
Método de divisão da árvore de decisão # 4: Chi ao quadrado
Qui-quadrado é outro método de divisão de nós em uma árvore de decisão para conjuntos de dados que possuem valores de destino categóricos.. Pode fazer duas ou mais de duas divisões. Trabalha na significância estatística das diferenças entre o nó pai e os nós secundários.
O valor do qui-quadrado é:

Aqui o Esperado é o valor esperado para uma classe em um nó filho com base na distribuição de classes no nó pai, e Real é o valor real de uma classe em um nó filho.
A fórmula acima nos dá o valor Qui-quadrado para uma classe. Pegue a soma dos valores de Qui-quadrado para todas as classes em um nó para calcular o Qui-quadrado para esse nó. Quanto maior o valor, maiores serão as diferenças entre os nós pai e filho, quer dizer, quanto maior a homogeneidade.
Estas são as etapas para dividir uma árvore de decisão usando o qui-quadrado:
- Para cada divisão, Calcule individualmente o valor do qui-quadrado de cada nó filho, tomando a soma dos valores do qui-quadrado para cada classe em um nó.
- Calcule o valor do qui-quadrado de cada divisão como a soma dos valores do qui-quadrado para todos os nós filhos
- Selecione a divisão com o maior valor qui-quadrado
- Até você atingir nós homogêneos, repita os passos 1-3
Claro, há um vídeo explicando Chi-Cuadrado no contexto de uma árvore de decisão:
Notas finais
Agora, conheça os diferentes métodos de divisão de uma árvore de decisão. Nas próximas etapas, você pode ver nosso playlist completa em árvores de decisão no youtube. Ou você pode pegar nosso de graça curso de árvores de decisão aqui.
Também reuni uma lista de ótimos artigos sobre árvores de decisão abaixo.:
Se você achou este artigo informativo, Compartilhe com seus amigos e comente abaixo com suas perguntas ou ideias.



