Introduction à l'apprentissage automatique

Contenu

introduction

L'apprentissage automatique n'est rien d'autre que de construire un ‘machine’ Quoi ‘apprendre’ de votre expérience. Et ça s'améliore avec l'expérience, tout comme les humains. Nous apprenons aussi de nos expériences. Droite ? Des entreprises comme Google, Facebook, Microsoft utilise des techniques d'apprentissage automatique à plus grande échelle.

Cependant, une erreur courante que les gens commettent est qu'ils doivent apprendre à coder pour démarrer l'apprentissage automatique. Alors que le codage devient nécessaire pour toute personne sérieuse au sujet de l'apprentissage automatique, mais pas pour le démarrer. Vous pouvez consulter un outil basé sur l'interface graphique comme Weka ou même Excel pour démarrer avec l'apprentissage automatique.

Ici, Je vais vous présenter un moyen plus simple de démarrer avec l'apprentissage automatique.

xlminer-5588285

Avez-vous du mal à comprendre l'encodage?

L'apprentissage automatique nécessite de puissantes compétences en codage / algorithmes. Et c'est pourquoi il est relativement plus facile pour les personnes ayant un diplôme en informatique de réussir à maîtriser l'apprentissage automatique..

Mais le paysage a changé. Cependant, ne peut pas échapper complètement au cryptage, vous pouvez toujours commencer avec l'apprentissage automatique. Une fois que vous commencez, vous pouvez améliorer vos compétences en codage.

La bonne nouvelle est que maintenant vous pouvez commencer apprentissage automatique à l'aide de Microsoft Excel. Oui! tu as bien entendu.

Frontline Solvers a introduit ‘EXPLOITATION DE DONNÉES XLMINER‘complément pour MS Excel. C'est un outil facile à utiliser, fait pour les professionnels, pour la visualisation des données, prévision et data mining. Il est facile à utiliser si:

  1. Vous avez travaillé dans MS Excel dans le passé
  2. A une expérience de travail avec SPSS

Lire aussi: Astuces simples mais puissantes pour analyser des données dans Excel

Quelles sont les tâches que XLMiner peut effectuer?

je savais que ça viendrait. ¡Bien! XLMiner peut faire beaucoup de choses que vous faites dans R, Python ou Julia. Ça aussi, sans écrire un extrait de code. Offre beaucoup sur les tâches d'apprentissage automatique et d'exploration de données. XLMiner est compatible avec Excel 2007, Exceller 2010 et exceller 2013 (32 Oui 64 morceaux). Voici la liste des tâches qui peuvent être effectuées avec XLMiner:

  1. Exploration et visualisation des données
  2. Ingénierie fonctionnelle
  3. Extraction de texte
  4. Analyse des séries chronologiques
  5. Apprentissage automatique
    • Régression
    • Classification
    • Regroupement
    • Modélisation d'ensemble
    • Les réseaux de neurones

Noter: non disponible gratuitement. Vous pouvez le télécharger dans une période d'essai de 15 jours, puis achetez une licence de deux ans pour $ 2495.

Dans cet article, Je vais démontrer les étapes pour effectuer la régression, classification et regroupement dans excel. Je vous recommande de travailler sur de petits ensembles de données dans Excel, car il pourrait échouer. Il est bon de l'utiliser sur des ensembles de données comme Titanesque.

Pour tirer le meilleur parti de cet article, doit avoir / acquérir des connaissances de base sur ces algorithmes. Si vous avez besoin d'un rappel rapide sur l'apprentissage automatique, Je vous recommande de consulter ces tutoriels: Bases de l'algorithme d'apprentissage automatique

J'ai installé XLMiner. Après l'installation, vous remarquerez que XLMINER apparaît sur les onglets principaux (image ci-dessous). Vous pouvez également voir ceci vue d'ensemble de la plateforme XLMiner.

212-6543271

Commençons !

Didacticiel: la régression linéaire multiple

La régression n'est pas grave. Vous pouvez également le faire en utilisant le plugin ‘boîte à outils d'analyse de données‘disponible dans Excel. C'est bon pour l'analyse statistique. Pour l'apprentissage automatique, aurait besoin de XLMiner. Ici, j'ai démontré la régression multiple en utilisant XLMiner. Pour la régression linéaire, toutes les étapes restent les mêmes, sauf que vous sélectionnez un variable indépendant pour la modélisation. Voici les étapes:

1. J'ai utilisé l'ensemble de données sur le logement de Boston. Ces données représentent les prix des logements à Boston en fonction de divers facteurs qui influencent. Vous pouvez charger l'ensemble de données en utilisant: Aider -> Exemples -> Logement Boston.

221-9934959

2. Voici le jeu de données.

231-4617074

3. Il n'y a pas de valeurs manquantes dans cet ensemble de données. Cependant, ce plugin fournit une option pratique pour traiter les valeurs manquantes. Vous pouvez accéder à cette option à partir d'ici.

25-6126147

241-1751806

Simplement, sélectionnez les variables où vous trouvez les valeurs manquantes. Si les valeurs manquantes sont représentées par ‘nul’, ‘N / UNE’ ou de toute autre manière, le mentionner. Finalement, vous pouvez choisir la méthode de traitement et le tour est joué.

4. Nous allons maintenant faire la sélection des fonctions. MEDV est la variable de réponse. MEDV représente la valeur médiane des logements occupés par leur propriétaire dans $ 1000.

26-4231319

27-8445821

5. Utiliser Maj + cliquez pour sélectionner toutes les variables indépendantes à la fois. Envoyer MEDV à la variable de sortie. Cliquez sur Suivant.

28-8049501

6. Sélectionner des filtres de corrélation. j'ai sélectionné les trois. Cliquez sur Suivant

29-4822733

7. Sélectionnez maintenant les fonctions. Découvrons le 5 principales variables prédictives importantes. Cliquez sur Terminer.

30-9582532

8. Voici le tableau d'importance des variables. Nous voyons, LSTAT est la variable la plus importante, suivi de RM, S'ENTRAÎNER, TAXE INDUS e.

311-2423352

9. Fermer ce graphique. Navigateur de sortie Verá. Cela vous aide à naviguer entre plusieurs feuilles de sortie. Jetez un œil aux ‘prédicteurs sélectionnés’.

32-9536611

10. Voici les prédicteurs sélectionnés. Procédons à la construction d'un modèle de régression en utilisant ces variables.

33-5064115

11. avant le modelage, diviser (partitionnons) ces données en cours et validation.

34-3518612

12. Basé sur la sélection des caractéristiques, sélectionner les variables à inclure dans la partition. Laissez le reste par défaut et cliquez sur OK.

35-8874289

13. Et voici l'ensemble de données de entraînement prêt pour la modélisation.

36-5032795

14. Cliquez sur n'importe quelle cellule sous Variables sélectionnées et procédez à la création du modèle de régression multiple. Cliquez sur Régression linéaire multiple

37-7770437

15. Sélectionnez l'ensemble de variables prédictives et de réponse. Cliquez sur Suivant

38-4327921

16. Sélectionnez vos métriques requises. Cliquez sur Terminer

39-4612899

17. Votre modèle de régression linéaire multiple est prêt. Utilisez le navigateur de sortie pour accéder à différentes métriques et à la précision du modèle.

40-1491580

Didacticiel: Régression logistique

La régression logistique est un exemple classique d'algorithme de classification. Similaire à la régression linéaire multiple, Voici les étapes pour construire un modèle de régression logistique. Si vous souhaitez mettre à jour rapidement vos concepts de régression logistique, tu peux consulter ce tuto: Guide de régression logistique simple

1. Chargez l'ensemble de données ‘Charles_bookclub’. Un ruban XLMiner, cliquez sur Aide -> Exemple. Sélectionnez cet ensemble de données. Cet ensemble de données représente des informations associées aux personnes qui sont membres d'un club de lecture. Nous allons construire un modèle pour prédire si une personne achètera un livre sur la ville de Florence en fonction des achats précédents.

41-9517141

2. À présent, nous allons diviser l'ensemble de données dans la formation (70%) et validation (30%). Cette fois, vous devez spécifier des pourcentages pour la partition. Cliquez sur OK

42-7852508

3. Vous verrez une feuille de partition de données. Cliquez sur n'importe quelle cellule du tableau de ‘variables sélectionnées’ et cliquez sur la régression logistique comme indiqué.

421-3843527

4. Ici, sélectionnez les variables d'entrée et de sortie. Florence est la variable de sortie où vous obtenez 1 lorsqu'un client a acheté un livre sur la ville de Florence et 0 autrement. Ici 1 est le succès. 0 c'est une erreur comme indiqué dans l'option suivante. Laisser le reste par défaut. Cliquez sur Suivant

43-3398472

5. Sélectionnez l'intervalle de confiance comme 95%. Si vous cochez ‘Forcer le terme constant à zéro’, sautera le terme constant dans la régression. Donc, ne le sélectionne pas. Cliquez sur avancé et cochez ‘effectuer les diagnostics de colinéarité’. Affiche des informations utiles lorsqu'il s'agit de variables corrélées qui ont de grandes erreurs standard. Cliquez sur OK. À présent, cliquez sur Sélection de variables.

44-2795040

6. La sélection des variables nous aide à traiter un grand nombre de variables prédictives et à trouver la meilleure d'entre elles.. ‘Taille maximale du meilleur sous-ensemble’ prend une valeur de 1 un, où N est le nombre de variables d'entrée. Nous ne changerons pas cette valeur. Dans la procédure de sélection, vous pouvez choisir selon vos préférences. J'ai choisi ‘Meilleurs sous-ensembles’ car il recherche toutes les combinaisons de variables et sélectionne uniquement celles qui correspondent le mieux. Cliquez sur OK. Cliquez sur Suivant.

45-6292874

7. Nous allons maintenant sélectionner les coefficients de calcul nécessaires pour évaluer le modèle. Sélectionnez la matrice de covariance des coefficients et des résidus. Les résidus produiront un tableau des valeurs ajustées et de leurs résidus dans la sortie. Cliquez sur Terminer.

46-8885277

8. Voici votre modèle de régression logistique. Si vous faites défiler cette feuille, vous trouverez plusieurs métriques utiles pour évaluer les performances de ce modèle. Une métrique couramment utilisée pour vérifier l'exactitude du modèle est la matrice de confusion. Comme il défile vers le bas, tu trouveras ça.

47-8471717

48-9960180

Didacticiel: k – Regroupement de moyens

Si vous débutez dans le clustering, ceci est un rappel rapide sur l'analyse de cluster. En mots simples, le clustering est une technique de regroupement de variables avec des attributs similaires. Cette technique est généralement utilisée pour profiler les clients et créer des produits en fonction de leurs besoins..

Regardons les étapes pour effectuer le clustering k-means dans XLMiner.

1. Charger le jeu de données Wine. Aller au ruban XLMiner, cliquez sur Aide -> Exemples. Sélectionnez le vin. Dans cet ensemble de données, chaque ligne représente un échantillon de vin qui appartient à 3 cours (UNE, Par C). Sur la base de ces données, nous allons créer un modèle de regroupement pour déterminer la classe de vin. Voici le jeu de données.

49-9868520

2. Cliquez sur n'importe quelle cellule de l'ensemble de données. Alors, click k-means clustering.

50-3319202

3. Le type est la variable de sortie. Donc, nous sélectionnerons toutes les variables sauf Type pour les utiliser dans le regroupement. Cliquez sur Suivant.

51-3665587

4. Prenons le nombre de clusters comme 8. Parce que, avec un grand nombre de clusters, la somme de l'erreur au carré (ESS) toujours petit. SSE est défini comme la somme de la distance au carré entre chaque membre du groupe et son centroïde. Vous pouvez définir n'importe quelle valeur de k et évaluer la sortie de chacun pour vérifier quelle est la meilleure. Définir une valeur aléatoire pour dire 5, permettra à cet algorithme de construire le modèle à partir de n'importe quel point aléatoire. Avec ça, XLMiner générera 5 ensembles de clusters et générera le résultat du meilleur grappe. Laissez les valeurs par défaut et cliquez sur Suivant.

52-6775950

5. Laisser les valeurs par défaut. Cliquez sur Terminer

53-4226540

6. Voici votre modèle de regroupement. Consultez nos différentes métriques d'évaluation pour déterminer la précision de ce modèle.

Résumé des démarrages aléatoires: Ce tableau détermine le meilleur départ avec la plus petite distance somme des carrés. Dans ce cas (# 1) est le meilleur départ. Une fois le meilleur départ déterminé, la sortie restante du modèle est générée en utilisant le meilleur départ comme point de départ.

Centres de cluster: Vous trouverez ici deux boîtes. La case inférieure montre la distance entre le centre de gravité des clusters. Plus la distance est grande, différente sera la nature des groupes. Par exemple, la différence entre le groupe 4 et le groupe 8 il est 1176,59. Cela suggère que ces groupes sont très différents. Le tableau du haut montre les valeurs des variables au centre des clusters.

Résumé des données: Représente la distance moyenne des observations par rapport au centre d'un groupe. On peut en déduire que le cluster 2 a la distance moyenne la plus faible de son centre de gravité et de l'amas 6 a le plus haut.

54-2675833

7. Cliquez sur la feuille KMC_Clusters. Vous trouverez ici les groupes prévus. Vérifiez l'ID d'enregistrement 1. S'est qualifié dans le groupe 6. Parce que la distance de cette observation est minime au groupe 6. de la même manière, toutes les autres observations ont été classées en fonction de leur groupe le plus proche.

55-7827680

Remarques finales

J'ai écrit ce tutoriel juste pour commencer avec l'apprentissage automatique dans Excel. Une fois que vous avez compris ces algorithmes, vous pouvez facilement les utiliser dans R, Python ou tout autre langage de programmation. Étant donné que beaucoup d'entre nous ont travaillé dans Excel à un moment donné, il ne serait pas difficile de comprendre ces concepts dans Excel. Si vous êtes coincé, vous pouvez vérifier l'option d'aide dans XLMiner Ribbon. La documentation est utile et facile à comprendre.

Maintenant que vous connaissez les étapes, Je vous suggère de prendre le temps d'interpréter le modèle et de le répéter pour obtenir le meilleur ajustement. Excel peut ralentir avec de grands ensembles de données, vous devriez donc travailler avec de petits ensembles de données pour gagner du temps sur l'apprentissage.

Avez-vous trouvé cet article utile? Avez-vous déjà travaillé sur XLMiner? J'aimerais entendre vos expériences et suggestions dans la section des commentaires ci-dessous..

Si vous aimez ce que vous venez de lire et souhaitez continuer à apprendre sur l'analyse, abonnez-vous à nos e-mails, Suivez-nous sur Twitter ou comme le nôtre page le Facebook.

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données