introduction
L'apprentissage automatique n'est rien d'autre que de construire un ‘machine’ Quoi ‘apprendre’ de votre expérience. Et ça s'améliore avec l'expérience, tout comme les humains. Nous apprenons aussi de nos expériences. Droite ? Des entreprises comme Google, Facebook, Microsoft utilise des techniques d'apprentissage automatique à plus grande échelle.
Cependant, une erreur courante que les gens commettent est qu'ils doivent apprendre à coder pour démarrer l'apprentissage automatique. Alors que le codage devient nécessaire pour toute personne sérieuse au sujet de l'apprentissage automatique, mais pas pour le démarrer. Vous pouvez consulter un outil basé sur l'interface graphique comme Weka ou même Excel pour démarrer avec l'apprentissage automatique.
Ici, Je vais vous présenter un moyen plus simple de démarrer avec l'apprentissage automatique.

Avez-vous du mal à comprendre l'encodage?
L'apprentissage automatique nécessite de puissantes compétences en codage / algorithmes. Et c'est pourquoi il est relativement plus facile pour les personnes ayant un diplôme en informatique de réussir à maîtriser l'apprentissage automatique..
Mais le paysage a changé. Cependant, ne peut pas échapper complètement au cryptage, vous pouvez toujours commencer avec l'apprentissage automatique. Une fois que vous commencez, vous pouvez améliorer vos compétences en codage.
La bonne nouvelle est que maintenant vous pouvez commencer apprentissage automatique à l'aide de Microsoft Excel. Oui! tu as bien entendu.
Frontline Solvers a introduit ‘EXPLOITATION DE DONNÉES XLMINER‘complément pour MS Excel. C'est un outil facile à utiliser, fait pour les professionnels, pour la visualisation des données, prévision et data mining. Il est facile à utiliser si:
- Vous avez travaillé dans MS Excel dans le passé
- A une expérience de travail avec SPSS
Lire aussi: Astuces simples mais puissantes pour analyser des données dans Excel
Quelles sont les tâches que XLMiner peut effectuer?
je savais que ça viendrait. ¡Bien! XLMiner peut faire beaucoup de choses que vous faites dans R, Python ou Julia. Ça aussi, sans écrire un extrait de code. Offre beaucoup sur les tâches d'apprentissage automatique et d'exploration de données. XLMiner est compatible avec Excel 2007, Exceller 2010 et exceller 2013 (32 Oui 64 morceaux). Voici la liste des tâches qui peuvent être effectuées avec XLMiner:
- Exploration et visualisation des données
- Ingénierie fonctionnelle
- Extraction de texte
- Analyse des séries chronologiques
- Apprentissage automatique
- Régression
- Classification
- Regroupement
- Modélisation d'ensemble
- Les réseaux de neurones
Noter: non disponible gratuitement. Vous pouvez le télécharger dans une période d'essai de 15 jours, puis achetez une licence de deux ans pour $ 2495.
Dans cet article, Je vais démontrer les étapes pour effectuer la régression, classification et regroupementLe "regroupement" Il s’agit d’un concept qui fait référence à l’organisation d’éléments ou d’individus en groupes ayant des caractéristiques ou des objectifs communs. Ce procédé est utilisé dans diverses disciplines, y compris la psychologie, Éducation et biologie, faciliter l’analyse et la compréhension de comportements ou de phénomènes. Dans le domaine de l’éducation, par exemple, Le regroupement peut améliorer l’interaction et l’apprentissage entre les élèves en encourageant le travail.. dans excel. Je vous recommande de travailler sur de petits ensembles de données dans Excel, car il pourrait échouer. Il est bon de l'utiliser sur des ensembles de données comme Titanesque.
Pour tirer le meilleur parti de cet article, doit avoir / acquérir des connaissances de base sur ces algorithmes. Si vous avez besoin d'un rappel rapide sur l'apprentissage automatique, Je vous recommande de consulter ces tutoriels: Bases de l'algorithme d'apprentissage automatique
J'ai installé XLMiner. Après l'installation, vous remarquerez que XLMINER apparaît sur les onglets principaux (image ci-dessous). Vous pouvez également voir ceci vue d'ensemble de la plateforme XLMiner.

Commençons !
Didacticiel: la régression linéaire multiple
La régression n'est pas grave. Vous pouvez également le faire en utilisant le plugin ‘boîte à outils d'analyse de données‘disponible dans Excel. C'est bon pour l'analyse statistique. Pour l'apprentissage automatique, aurait besoin de XLMiner. Ici, j'ai démontré la régression multiple en utilisant XLMiner. Pour la régression linéaire, toutes les étapes restent les mêmes, sauf que vous sélectionnez un variableEn statistique et en mathématiques, ongle "variable" est un symbole qui représente une valeur qui peut changer ou varier. Il existe différents types de variables, et qualitatif, qui décrivent des caractéristiques non numériques, et quantitatif, représentation de grandeurs numériques. Les variables sont fondamentales dans les expériences et les études, puisqu’ils permettent l’analyse des relations et des modèles entre différents éléments, faciliter la compréhension de phénomènes complexes.... indépendant pour la modélisation. Voici les étapes:
1. J'ai utilisé l'ensemble de données sur le logement de Boston. Ces données représentent les prix des logements à Boston en fonction de divers facteurs qui influencent. Vous pouvez charger l'ensemble de données en utilisant: Aider -> Exemples -> Logement Boston.

2. Voici le jeu de données.

3. Il n'y a pas de valeurs manquantes dans cet ensemble de données. Cependant, ce plugin fournit une option pratique pour traiter les valeurs manquantes. Vous pouvez accéder à cette option à partir d'ici.


Simplement, sélectionnez les variables où vous trouvez les valeurs manquantes. Si les valeurs manquantes sont représentées par ‘nul’, ‘N / UNE’ ou de toute autre manière, le mentionner. Finalement, vous pouvez choisir la méthode de traitement et le tour est joué.
4. Nous allons maintenant faire la sélection des fonctions. MEDV est la variable de réponse. MEDV représente la valeur médiane des logements occupés par leur propriétaire dans $ 1000.


5. Utiliser Maj + cliquez pour sélectionner toutes les variables indépendantes à la fois. Envoyer MEDV à la variable de sortie. Cliquez sur Suivant.

6. Sélectionner des filtres de corrélation. j'ai sélectionné les trois. Cliquez sur Suivant

7. Sélectionnez maintenant les fonctions. Découvrons le 5 principales variables prédictives importantes. Cliquez sur Terminer.

8. Voici le tableau d'importance des variables. Nous voyons, LSTAT est la variable la plus importante, suivi de RM, S'ENTRAÎNER, TAXE INDUS e.

9. Fermer ce graphique. Navigateur de sortie Verá. Cela vous aide à naviguer entre plusieurs feuilles de sortie. Jetez un œil aux ‘prédicteurs sélectionnés’.

10. Voici les prédicteurs sélectionnés. Procédons à la construction d'un modèle de régression en utilisant ces variables.

11. avant le modelage, diviser (partitionnons) ces données en cours et validation.

12. Basé sur la sélection des caractéristiques, sélectionner les variables à inclure dans la partition. Laissez le reste par défaut et cliquez sur OK.

13. Et voici l'ensemble de données de entraînementLa formation est un processus systématique conçu pour améliorer les compétences, connaissances ou aptitudes physiques. Il est appliqué dans divers domaines, Comme le sport, Éducation et développement professionnel. Un programme d’entraînement efficace comprend la planification des objectifs, Pratique régulière et évaluation des progrès. L’adaptation aux besoins individuels et la motivation sont des facteurs clés pour obtenir des résultats réussis et durables dans toutes les disciplines.... prêt pour la modélisation.

14. Cliquez sur n'importe quelle cellule sous Variables sélectionnées et procédez à la création du modèle de régression multiple. Cliquez sur Régression linéaire multiple

15. Sélectionnez l'ensemble de variables prédictives et de réponse. Cliquez sur Suivant

16. Sélectionnez vos métriques requises. Cliquez sur Terminer

17. Votre modèle de régression linéaire multiple est prêt. Utilisez le navigateur de sortie pour accéder à différentes métriques et à la précision du modèle.

Didacticiel: Régression logistique
La régression logistique est un exemple classique d'algorithme de classification. Similaire à la régression linéaire multiple, Voici les étapes pour construire un modèle de régression logistique. Si vous souhaitez mettre à jour rapidement vos concepts de régression logistique, tu peux consulter ce tuto: Guide de régression logistique simple
1. Chargez l'ensemble de données ‘Charles_bookclub’. Un ruban XLMiner, cliquez sur Aide -> Exemple. Sélectionnez cet ensemble de données. Cet ensemble de données représente des informations associées aux personnes qui sont membres d'un club de lecture. Nous allons construire un modèle pour prédire si une personne achètera un livre sur la ville de Florence en fonction des achats précédents.

2. À présent, nous allons diviser l'ensemble de données dans la formation (70%) et validation (30%). Cette fois, vous devez spécifier des pourcentages pour la partition. Cliquez sur OK

3. Vous verrez une feuille de partition de données. Cliquez sur n'importe quelle cellule du tableau de ‘variables sélectionnées’ et cliquez sur la régression logistique comme indiqué.

4. Ici, sélectionnez les variables d'entrée et de sortie. Florence est la variable de sortie où vous obtenez 1 lorsqu'un client a acheté un livre sur la ville de Florence et 0 autrement. Ici 1 est le succès. 0 c'est une erreur comme indiqué dans l'option suivante. Laisser le reste par défaut. Cliquez sur Suivant

5. Sélectionnez l'intervalle de confiance comme 95%. Si vous cochez ‘Forcer le terme constant à zéro’, sautera le terme constant dans la régression. Donc, ne le sélectionne pas. Cliquez sur avancé et cochez ‘effectuer les diagnostics de colinéarité’. Affiche des informations utiles lorsqu'il s'agit de variables corrélées qui ont de grandes erreurs standard. Cliquez sur OK. À présent, cliquez sur Sélection de variables.

6. La sélection des variables nous aide à traiter un grand nombre de variables prédictives et à trouver la meilleure d'entre elles.. ‘Taille maximale du meilleur sous-ensemble’ prend une valeur de 1 un, où N est le nombre de variables d'entrée. Nous ne changerons pas cette valeur. Dans la procédure de sélection, vous pouvez choisir selon vos préférences. J'ai choisi ‘Meilleurs sous-ensembles’ car il recherche toutes les combinaisons de variables et sélectionne uniquement celles qui correspondent le mieux. Cliquez sur OK. Cliquez sur Suivant.

7. Nous allons maintenant sélectionner les coefficients de calcul nécessaires pour évaluer le modèle. Sélectionnez la matrice de covariance des coefficients et des résidus. Les résidus produiront un tableau des valeurs ajustées et de leurs résidus dans la sortie. Cliquez sur Terminer.

8. Voici votre modèle de régression logistique. Si vous faites défiler cette feuille, vous trouverez plusieurs métriques utiles pour évaluer les performances de ce modèle. Une métrique couramment utilisée pour vérifier l'exactitude du modèle est la matrice de confusion. Comme il défile vers le bas, tu trouveras ça.


Didacticiel: k – Regroupement de moyens
Si vous débutez dans le clustering, ceci est un rappel rapide sur l'analyse de cluster. En mots simples, le clustering est une technique de regroupement de variables avec des attributs similaires. Cette technique est généralement utilisée pour profiler les clients et créer des produits en fonction de leurs besoins..
Regardons les étapes pour effectuer le clustering k-means dans XLMiner.
1. Charger le jeu de données Wine. Aller au ruban XLMiner, cliquez sur Aide -> Exemples. Sélectionnez le vin. Dans cet ensemble de données, chaque ligne représente un échantillon de vin qui appartient à 3 cours (UNE, Par C). Sur la base de ces données, nous allons créer un modèle de regroupement pour déterminer la classe de vin. Voici le jeu de données.

2. Cliquez sur n'importe quelle cellule de l'ensemble de données. Alors, click k-means clustering.

3. Le type est la variable de sortie. Donc, nous sélectionnerons toutes les variables sauf Type pour les utiliser dans le regroupement. Cliquez sur Suivant.

4. Prenons le nombre de clusters comme 8. Parce que, avec un grand nombre de clusters, la somme de l'erreur au carré (ESS) toujours petit. SSE est défini comme la somme de la distance au carré entre chaque membre du groupe et son centroïde. Vous pouvez définir n'importe quelle valeur de k et évaluer la sortie de chacun pour vérifier quelle est la meilleure. Définir une valeur aléatoire pour dire 5, permettra à cet algorithme de construire le modèle à partir de n'importe quel point aléatoire. Avec ça, XLMiner générera 5 ensembles de clusters et générera le résultat du meilleur grappeUn cluster est un ensemble d’entreprises et d’organisations interconnectées qui opèrent dans le même secteur ou la même zone géographique, et qui collaborent pour améliorer leur compétitivité. Ces regroupements permettent le partage des ressources, Connaissances et technologies, favoriser l’innovation et la croissance économique. Les grappes peuvent couvrir une variété d’industries, De la technologie à l’agriculture, et sont fondamentaux pour le développement régional et la création d’emplois..... Laissez les valeurs par défaut et cliquez sur Suivant.

5. Laisser les valeurs par défaut. Cliquez sur Terminer

6. Voici votre modèle de regroupement. Consultez nos différentes métriques d'évaluation pour déterminer la précision de ce modèle.
Résumé des démarrages aléatoires: Ce tableau détermine le meilleur départ avec la plus petite distance somme des carrés. Dans ce cas (# 1) est le meilleur départ. Une fois le meilleur départ déterminé, la sortie restante du modèle est générée en utilisant le meilleur départ comme point de départ.
Centres de cluster: Vous trouverez ici deux boîtes. La case inférieure montre la distance entre le centre de gravité des clusters. Plus la distance est grande, différente sera la nature des groupes. Par exemple, la différence entre le groupe 4 et le groupe 8 il est 1176,59. Cela suggère que ces groupes sont très différents. Le tableau du haut montre les valeurs des variables au centre des clusters.
Résumé des données: Représente la distance moyenne des observations par rapport au centre d'un groupe. On peut en déduire que le cluster 2 a la distance moyenne la plus faible de son centre de gravité et de l'amas 6 a le plus haut.

7. Cliquez sur la feuille KMC_Clusters. Vous trouverez ici les groupes prévus. Vérifiez l'ID d'enregistrement 1. S'est qualifié dans le groupe 6. Parce que la distance de cette observation est minime au groupe 6. de la même manière, toutes les autres observations ont été classées en fonction de leur groupe le plus proche.

Remarques finales
J'ai écrit ce tutoriel juste pour commencer avec l'apprentissage automatique dans Excel. Une fois que vous avez compris ces algorithmes, vous pouvez facilement les utiliser dans R, Python ou tout autre langage de programmation. Étant donné que beaucoup d'entre nous ont travaillé dans Excel à un moment donné, il ne serait pas difficile de comprendre ces concepts dans Excel. Si vous êtes coincé, vous pouvez vérifier l'option d'aide dans XLMiner Ribbon. La documentation est utile et facile à comprendre.
Maintenant que vous connaissez les étapes, Je vous suggère de prendre le temps d'interpréter le modèle et de le répéter pour obtenir le meilleur ajustement. Excel peut ralentir avec de grands ensembles de données, vous devriez donc travailler avec de petits ensembles de données pour gagner du temps sur l'apprentissage.
Avez-vous trouvé cet article utile? Avez-vous déjà travaillé sur XLMiner? J'aimerais entendre vos expériences et suggestions dans la section des commentaires ci-dessous..



