5 Questions de modélisation d'assemblage facile que tout le monde devrait connaître

Contenu

introduction

Si vous avez déjà participé à des concours de science des données, vous devez être conscient du rôle essentiel que joue la modélisation d'ensemble. En réalité, On dit que la modélisation d'ensemble offre l'un des moyens les plus convaincants de créer des modèles prédictifs très précis. La disponibilité de ensachage et renfort Les algorithmes embellissent davantage cette méthode pour produire un niveau de précision étonnant.

Pour cela, la prochaine fois que vous créez un modèle prédictif, envisager d'utiliser cet algorithme. Je me féliciterais certainement de cette suggestion.. Oui, si vous maîtrisez déjà cette méthode, génial. J'aimerais entendre votre expertise sur la modélisation d'ensemble dans la section des commentaires ci-dessous..

Autrement, Je partage certaines des questions les plus fréquemment posées sur la modélisation d'ensemble. Si à tout moment vous souhaitez examiner les connaissances de quelqu'un sur l'ensemble, vous pouvez oser poser ces questions et vérifier vos connaissances. En même temps, ce sont quelques-unes des questions les plus faciles, donc tu ne peux pas oser te tromper.

5 question 2

Quelles sont les questions courantes (associés aux modèles d'ensemble)?

Après avoir analysé plusieurs forums de science des données, j'ai identifié le 5 Questions courantes associées à la modélisation d'ensemble. Ces questions sont très pertinentes pour les data scientists novices en modélisation d'ensemble.. Voici les questions:

  1. Qu'est-ce qu'un modèle d'ensemble?
  2. Qu'est-ce que l'ensachage, renforcement et empilage?
  3. Peut-on assembler plusieurs modèles du même algorithme ML?
  4. Comment pouvons-nous identifier les poids des différents modèles?
  5. Quels sont les avantages du modèle d'ensemble?

Analysons chaque question en détail.

1. Qu'est-ce qu'un modèle d'ensemble?

Essayons de le comprendre en résolvant un défi de qualification.

Problème: définir des règles pour trier les e-mails de spam

images

Solution: Nous pouvons générer plusieurs règles pour la classification des e-mails de spam, voyons certains d'entre eux:

  • E-mails indésirables
    • Avoir une extension totale inférieure à 20 mots.
    • Avoir seulement l'image (images promotionnelles)
    • Avoir des mots-clés spécifiques comme « gagner de l'argent et grandir » Oui « réduire votre graisse »
    • Plus de mots épelés dans l'e-mail
  • Pas de spam
    • Adresse e-mail du domaine DataPeaker
    • E-mail des membres de la famille ou de toute personne figurant dans le carnet d'adresses e-mail

Dessus, J'ai énuméré quelques règles communes pour filtrer les e-mails de spam. Pensez-vous que toutes ces règles individuellement peuvent prédire la bonne classe?

La plupart d'entre nous diraient non, Et c'est vrai! La combinaison de ces règles fournira une prédiction solide par rapport à la prévision faite par les règles individuelles.. C'est le principe de la modélisation d'ensemble. Le modèle d'ensemble combine plusieurs modèles ‘individuels’ (plusieurs) ensemble et offre une puissance prédictive supérieure.

Si vous voulez faire le lien avec la vraie vie, un groupe de personnes est susceptible de prendre de meilleures décisions par rapport aux individus, surtout lorsque les membres du groupe viennent de plusieurs horizons. Idem pour l'apprentissage automatique. Simplement, un ensemble est une technique de enseignement supervisé pour combiner plusieurs étudiants / modèles faibles produire un apprenti fort. Le modèle d'assemblage fonctionne mieux lorsque nous assemblons des modèles avec une faible corrélation.

Un bon exemple de la façon dont les méthodes d'ensemble sont couramment utilisées pour résoudre des problèmes de science des données est le forêt aléatoire algorithme (qui a plusieurs modèles CART). Cela fonctionne mieux par rapport au modèle CART individuel lors de la catégorisation d'un nouvel objet où chaque arbre donne « voix » pour cette classe et la forêt choisit la classification qui a le plus de votes (sur tous les arbres de la forêt). En cas de régression, prend la moyenne des sorties de différents arbres.

Vous pouvez également suivre ce post « Définir les bases de l'apprentissage expliquées en anglais simple » pour en savoir plus sur la modélisation d'ensemble.

2. Qu'est-ce que l'ensachage, renforcement et empilage?

Examinons chacun d'eux individuellement et essayons de comprendre les différences entre ces termes.:

Harpillera (Agrégation Bootstrap) est une méthode définie. Premier, nous créons des échantillons aléatoires de l'ensemble de données de entraînement (sous-ensembles de l'ensemble de données d'apprentissage). Après, nous construisons un classificateur pour chaque échantillon. En résumé, les résultats de ces classificateurs multiples sont combinés par vote moyen ou majoritaire. L'ensachage permet de réduire l'erreur de variance.

harpillera

Impulsion fournit un apprentissage séquentiel des prédicteurs. Le premier prédicteur est appris sur l'ensemble de l'ensemble de données, tandis que ce qui suit est appris dans l'ensemble d'entraînement basé sur les performances du précédent.. Ce commencer par classer l'ensemble de données d'origine et donner le même poids à chaque observation. Si les classes sont mal prédites en utilisant le premier élève, alors l'observation classée manquante reçoit un poids plus important. Être une procédure itérative, continue d'ajouter des apprenants classificateurs jusqu'à ce qu'une limite sur le nombre de modèles ou la précision soit atteinte. Impulse a montré une meilleure précision prédictive que l'ensachage, mais il a également tendance à suradapter les données d'entraînement. booster

L'exemple le plus courant de booster est AdaBoost et Gradient Boosting. Vous pouvez également consulter ces articles pour plus d'informations sur la façon d'améliorer les algorithmes.

Empilés fonctionne en deux phases. Premier, nous utilisons plusieurs classificateurs de base pour prédire la classe. En second lieu, un nouvel étudiant est utilisé pour combiner leurs prédictions afin de réduire l'erreur de généralisation. empilage-297x300

3. Pouvons-nous assembler plusieurs modèles du même algorithme ML?

Oui, nous pouvons combiner plusieurs modèles des mêmes algorithmes ML, mais combiner régulièrement plusieurs prédictions générées par différents algorithmes vous donnerait de meilleures prédictions. Elle est due à la diversification ou à la nature indépendante les unes par rapport aux autres. Par exemple, les prédictions d'une forêt aléatoire, un KNN et un Naive Bayes peuvent être combinés pour créer un ensemble final de prédictions plus robuste par rapport à la combinaison de trois modèles de forêts aléatoires. La clé pour créer un ensemble puissant est la diversité des modèles. Un ensemble avec deux techniques qui sont de nature très équivalente sera moins performant qu'un ensemble plus diversifié de modèles..

Exemple: Disons que nous avons trois modèles (UNE, Par C). UNE, B et C ont une précision de prédiction de la 85%, 80% Oui 55% respectivement. Mais A et B sont fortement corrélés lorsque C est faiblement corrélé avec A et B. Doit-on combiner A et B? Non, nous ne devrions pas, car ces modèles sont fortement corrélés. Pour cela, nous ne combinerons pas ces deux, puisque cet ensemble n'aidera pas à réduire les erreurs de généralisation. Je préfère combiner A et C ou B et C.

4. Comment pouvons-nous identifier les poids des différents modèles pour l'ensemble?

L'un des défis les plus courants avec la modélisation d'ensemble est de trouver des poids optimaux pour les modèles d'ensemble de base. En général, nous supposons le même poids pour tous les modèles et prenons la moyenne des prédictions. Mais, Est-ce la meilleure façon de relever ce défi?

Il existe plusieurs méthodes pour trouver le poids optimal pour combiner tous les élèves de base. Ces méthodes permettent de bien comprendre comment trouver le poids correct. Ensuite, Je liste quelques méthodes:

  • Trouver la colinéarité entre les élèves de base et en se basant sur ce tableau, puis identifier les modèles de base à assembler. Après cela, regardez le score de validation croisée (rapport de pointage) des modèles de base identifiés pour trouver le poids.
  • Trouver l'algorithme pour retourner le poids optimal pour les étudiants de base. Vous pouvez consulter l'article Comment trouver les poids optimaux pour les apprenants d'ensemble en utilisant un neuronal rouge pour voir la méthode afin de trouver le poids optimal.
  • Nous pouvons également résoudre le même problème en utilisant des méthodes telles que:

Vous pouvez également voir la réponse gagnante des concours de science des données / Kaggle pour comprendre d'autres méthodes pour relever ce défi.

5. Quels sont les avantages du modèle d'ensemble?

Les modèles Ensemble présentent deux avantages principaux:

  • Meilleure prédiction
  • Modèle plus stable

L'opinion agrégée des différents modèles est moins bruyante que celle des autres modèles. En finance, appel « Diversification »: un portefeuille diversifié de nombreuses actions sera beaucoup moins variable risqué qu'une seule des actions. C'est aussi pourquoi vos modèles seront meilleurs avec des ensembles de modèles plutôt qu'avec des modèles individuels.. L'une des précautions avec les modèles d'ensemble est qu'ils sont trop serrés., même si l'ensachage s'en occupe en grande partie.

Note finale

Dans ce billet, nous avons analysé le 5 Foire aux questions sur les modèles Ensemble. En répondant à ces questions, nous avons discuté des "Modèles d'Ensemble", « Méthodes d'ensemble », "Pourquoi devrions-nous assembler plusieurs modèles?", "Méthodes pour identifier le poids optimal pour l'ensemble" et pour finir "Avantages". Je vous suggère de regarder le 5 meilleures solutions de quiz sur la science des données et voir leurs approches communes pour une meilleure compréhension et beaucoup de pratique. Cela vous aidera à comprendre ce qui fonctionne et ce qui ne fonctionne pas.

Ce message vous a-t-il été utile? Avez-vous essayé autre chose pour trouver les poids optimaux ou identifier l'élève de base approprié ?? Je serai heureux de vous entendre dans la section des commentaires ci-dessous..

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données