introduction
Avec le besoin croissant d'administrateurs en science des données, nous avons besoin d'outils qui simplifient la science des données et la rendent amusante. Tout le monde n'est pas prêt à apprendre à coder, bien que j'aimerais apprendre / appliquer la science des données. C'est là que les outils basés sur l'interface graphique peuvent être utiles..
Aujourd'hui, Je vais vous présenter un autre outil basé sur l'interface graphique: Orange. Cet outil est idéal pour les débutants qui souhaitent visualiser des modèles et comprendre leurs données sans vraiment savoir coder.
Dans mon article précédent, Je vous ai présenté un autre outil KNIME basé sur l'interface graphique. Si vous ne voulez pas apprendre à coder mais continuer à appliquer la science des données, vous pouvez essayer n'importe lequel de ces outils.
A la fin de ce tutoriel, vous pourrez prédire quelle personne d'un certain groupe de personnes est éligible à un prêt avec Orange.
Table des matières:
- Pourquoi Orange?
- Configuration de votre système:
- Création de votre premier workflow
- Familiarisez-vous avec les bases
- Approche du probléme
- Importation des fichiers de données
- Comprendre les données
- Comment nettoyez-vous vos données?
- Former votre premier modèle
1. Pourquoi Orange?
Orange est une plate-forme conçue pour l'exploration et l'analyse dans un workflow basé sur une interface graphique. Cela signifie que vous n'avez pas besoin de savoir coder pour pouvoir travailler avec Orange et extraire des données., traiter les numéros et obtenir des informations.
Peut effectuer des tâches allant des visuels de base aux manipulations de données, transformations et data mining. Consolidez toutes les fonctions de l'ensemble du processus en un seul flux de travail.
La meilleure partie et le différenciateur d'Orange est qu'il a de magnifiques images. Vous pouvez essayer des silhouettes, cartes thermiques, cartes géographiques et toutes sortes de visualisations disponibles.
2. Configuration de votre système
Orange est intégré à l'outil Anaconda si vous l'avez déjà installé. Au contraire, suivez ces étapes pour télécharger Orange.
Paso 1: et un https://orange.biolab.si et cliquez sur Télécharger.

Paso 2: Installez la plateforme et configurez le répertoire de travail d'Orange pour stocker vos fichiers.

Voici à quoi ressemble la page d'accueil d'Orange. Possède des options qui vous permettent de créer de nouveaux projets, ouvrez des projets récents ou consultez des exemples et lancez-vous.
Avant d'approfondir le fonctionnement d'Orange, définissons quelques termes clés pour nous aider à comprendre:
- Un widget est le point de traitement de base de toute manipulation de données. Vous pouvez effectuer un certain nombre d'actions en fonction de ce que vous choisissez dans le sélecteur de widget à gauche de l'écran.
- Un flux de travail est la séquence d'étapes ou d'actions que vous effectuez sur votre plate-forme pour accomplir une tâche particulière.
Vous pouvez également vous rendre sur « Exemples de flux de travail » sur l'écran d'accueil pour voir plus de workflows une fois que vous avez créé le premier.
Pour l'instant, cliquez sur « Nouveau » et commençons à créer votre premier workflow.
3. Créez votre premier workflow
C'est la première étape vers la construction d'une solution à tout problème.. Nous devons d'abord comprendre quelles mesures nous devons prendre pour atteindre notre objectif ultime. Après avoir cliqué « Nouveau » à l'étape précédente, c'est ce que j'aurais dû créer.

Ceci est votre flux de travail vierge dans Orange. À présent, vous êtes prêt à explorer et à résoudre n'importe quel problème en faisant glisser n'importe quel widget du menu des widgets vers votre flux de travail.
4. Familiarisez-vous avec les bases
Orange est une plateforme qui peut nous aider à résoudre la plupart des problèmes de data science d'aujourd'hui. Des sujets allant des visualisations les plus basiques aux entraînementLa formation est un processus systématique conçu pour améliorer les compétences, connaissances ou aptitudes physiques. Il est appliqué dans divers domaines, Comme le sport, Éducation et développement professionnel. Un programme d’entraînement efficace comprend la planification des objectifs, Pratique régulière et évaluation des progrès. L’adaptation aux besoins individuels et la motivation sont des facteurs clés pour obtenir des résultats réussis et durables dans toutes les disciplines..... Vous pouvez même évaluer et effectuer un Apprentissage non superviséL’apprentissage non supervisé est une technique d’apprentissage automatique qui permet aux modèles d’identifier des modèles et des structures dans des données sans étiquettes prédéfinies. Grâce à des algorithmes tels que les k-moyennes et l’analyse en composantes principales, Cette approche est utilisée dans une variété d’applications, comme la segmentation de la clientèle, Détection d’anomalies et compression de données. Sa capacité à révéler des informations cachées en fait un outil précieux dans le... dans les jeux de données:
4.1 Problème
Le problème que nous essayons de résoudre dans ce tutoriel est le problème de la pratique. Prédiction de prêt auquel on peut accéder via ce lien sur Datahack.
4.2 Importation de fichiers de données
Nous commençons par la première étape nécessaire pour comprendre nos données et faire des prédictions: importer nos données

Paso 1: Cliquez sur l'onglet « Données » dans le menu du sélecteur de widget et faites glisser le widget « Archiver » à notre flux de travail vierge.
Paso 2: Double-cliquez sur le widget « Archiver » et sélectionnez le fichier que vous souhaitez télécharger dans le workflow. Dans cet article, car nous apprendrons à résoudre le problème de la pratique de prédiction de prêt, je vais importer l'ensemble de données d'entraînement à partir de celui-ci.

Paso 3: Une fois que vous pouvez voir la structure de votre ensemble de données à l'aide du widget, retour en fermant ce menu.
Paso 4: Maintenant que nous avons les détails bruts du .csv, nous devons les convertir dans un format que nous pouvons utiliser dans notre exploitation minière. Cliquez sur la ligne pointillée autour du widget « Archiver » et faites glisser, puis cliquez n'importe où dans l'espace vide.

Paso 5: Comment nous avons besoin d'un tableau de données pour mieux visualiser nos résultats, on clique sur le widget « Tableau de données ».
Paso 6: Maintenant, double-cliquez sur le widget pour afficher son tableau.

Propre! Ce n'est pas comme ça?
Visualisons maintenant quelques colonnes pour trouver des modèles intéressants dans nos données..
4.3 Comprendre nos données
4.3.1 Nuage de pointsUn nuage de points est une représentation visuelle qui montre la relation entre deux variables numériques à l’aide de points sur un plan cartésien. Chaque axe représente une variable, et l’emplacement de chaque point indique sa valeur par rapport aux deux. Ce type de graphique est utile pour identifier des modèles, Corrélations et tendances dans les données, faciliter l’analyse et l’interprétation des relations quantitatives....
Cliquez sur le demi-cercle devant le widget « Archiver » et faites-le glisser vers un espace vide dans le workflow et sélectionnez le widget « Diagramme de dispersion ».

Une fois que vous avez créé un widget graphique en nuage de points, double-cliquez dessus et explorez vos données comme ceci. Vous pouvez sélectionner les axes X et Y, couleurs, formes, tailles et bien d'autres manipulations.

L'intrigue que j'ai explorée est une intrigue de genre par revenu, avec les couleurs établies dans les niveaux d'éducation. Comme on peut le voir chez les hommes, Le groupe de revenu le plus élevé appartient naturellement aux diplômés!
Bien que chez les femmes, nous voyons que beaucoup de femmes diplômées gagnent peu ou rien. Toute raison particulière? Découvrons-le en utilisant le Diagramme de dispersionLe nuage de points est un outil graphique utilisé en statistiques pour visualiser la relation entre deux variables. Il se compose d’un ensemble de points dans un plan cartésien, où chaque point représente une paire de valeurs correspondant aux variables analysées. Ce type de graphique vous permet d’identifier des modèles, Tendances et corrélations possibles, faciliter l’interprétation des données et la prise de décision sur la base des informations visuelles présentées.....

Une raison possible que j'ai trouvée était le mariage. Un grand nombre de diplômés mariés appartenaient à des groupes à faible revenu; cela peut être dû à des responsabilités familiales ou à des efforts supplémentaires. C'est parfaitement logique, vérité?
4.3.2 Distribution
Une autre façon de visualiser nos distributions serait le widget « Répartition ». Cliquez à nouveau sur le demi-cercle et faites glisser pour trouver le widget « Répartition ».

Maintenant, double-cliquez dessus et regardez!

Ce que nous voyons est une distribution très intéressante. Nous avons plus d'hommes mariés que de femmes dans notre ensemble de données.
4.3.3 Diagramme de tamis
Comment le revenu est-il lié au niveau d'éducation? Les diplômés sont-ils payés plus que les étudiants de premier cycle?
Visualisons à l'aide d'un diagramme de tamis.
Cliquez et faites glisser depuis le widget « Archiver » et chercher « Diagramme de tamis ».

Une fois que tu l'as mis, double-cliquez dessus et sélectionnez vos axes.

Ce tableau divise les sections de distribution en 4 conteneurs. Les sections peuvent être étudiées en les survolant.
Par exemple, les diplômés et les étudiants de premier cycle sont divisés 78% pour 22%. Alors, subdivisions de la 25% chacun divisant le revenu du demandeur en 4 groupes égaux. Voici la tâche pour vous, générer des informations à partir de ces graphiques et les partager dans la section des commentaires.
Voyons maintenant comment nettoyer nos données pour commencer à construire notre modèle.
5. Comment nettoyez-vous vos données?
Ici, à des fins de nettoyage, nous imputerons les valeurs manquantes. L'imputation est une étape très importante pour comprendre et utiliser au mieux nos données.
Cliquez sur le widget « Archiver » et faites glisser pour trouver le widget « Imputer ».

Lorsque vous double-cliquez sur le widget après l'avoir placé, Vous verrez qu'il existe une variété de méthodes d'imputation que vous pouvez utiliser. Vous pouvez également utiliser des méthodes par défaut ou choisir des méthodes individuelles pour chaque classe séparément.

Ici, J'ai sélectionné la méthode par défaut pour être Moyenne pour les valeurs numériques et La plus fréquente pour les valeurs basées sur du texte (catégorique).
Vous pouvez choisir parmi une variété d'imputations telles que:
- Valeur différente
- Valeurs aléatoires
- Supprimer les lignes avec des valeurs manquantes
- Basé sur des modèles
Les autres éléments que vous pouvez inclure dans votre approche de la formation de votre modèle sont l'extraction et la génération de caractéristiques.. Pour une meilleure compréhension, suivez cet article sur l'exploration des données et l'ingénierie des fonctionnalités (https://www.analyticsvidhya.com/blog/2016/01/guide-data-scan /)
6. Former son premier modèle
Commencer par les bases, nous allons d'abord former un modèle linéaire englobant toutes les fonctionnalités juste pour comprendre comment sélectionner et construire des modèles.
Paso 1: Premier, Nous devons établir un variableEn statistique et en mathématiques, ongle "variable" est un symbole qui représente une valeur qui peut changer ou varier. Il existe différents types de variables, et qualitatif, qui décrivent des caractéristiques non numériques, et quantitatif, représentation de grandeurs numériques. Les variables sont fondamentales dans les expériences et les études, puisqu’ils permettent l’analyse des relations et des modèles entre différents éléments, faciliter la compréhension de phénomènes complexes.... pour lui appliquer une régression logistique.
Paso 2: Aller au widget « Archiver » et double cliquez dessus.
Paso 3: À présent, double-cliquez sur le Loan_Status colonne et sélectionnez-la comme variable cible. Cliquez sur Appliquer.

Paso 4: Une fois que nous avons défini notre variable cible, trouver les données de widget propres « Imputer » comme suit et placez le widget « Régression logistique ».

Paso 5: Double-cliquez sur le widget et sélectionnez l’icône régularisationLa régularisation est un processus administratif qui vise à formaliser la situation de personnes ou d’entités qui opèrent en dehors du cadre légal. Cette procédure est essentielle pour garantir les droits et les devoirs, ainsi que pour promouvoir l’inclusion sociale et économique. Dans de nombreux pays, La régularisation est appliquée dans les contextes migratoires, Droit du travail et fiscalité, permettre aux personnes en situation irrégulière d’accéder à des prestations et de se protéger d’éventuelles sanctions.... Ce que vous voulez faire.
- Régression de crête:
- Effectuer la régularisation L2, c'est-à-dire, ajoute une pénalité égale à carré de grandeur coefficients
- Cible de minimisation = LS Obj + une * (somme du carré des coefficients)
- Régression de boucle:
- Effectuer la régularisation L1, c'est-à-dire, ajoute une pénalité égale à valeur absolue de la grandeur coefficients
- Cible de minimisation = LS Obj + une * (somme de la valeur absolue des coefficients)
Pour une meilleure compréhension de ces, visitez le lien sur les régressions Ridge et Lasso https://www.analyticsvidhya.com/blog/2016/01/complete-tutorial-ridge-lasso-regression-python/
J'ai choisi Ridge pour mon analyse, tu peux choisir entre les deux.
Paso 6: Ensuite, cliquez sur le widget « Imputer » O « Régression logistique » et trouver le widget « Testez et notez ». Assurez-vous de connecter les deux données et modèle pour tester le widget.
Paso 7: À présent, cliquez sur le widget « Testez et notez » pour voir si votre modèle se porte bien.

Paso 8: Pour mieux visualiser les résultats, glisser-déposer depuis le widget « Testez et notez » trouver « Matrice de confusion ».

Paso 9: Une fois que vous l'avez placé, cliquez dessus pour voir vos découvertes.

De cette manière, vous pouvez essayer différents modèles et voir avec quelle précision ils fonctionnent.
Essayons d'évaluer, Comment fonctionnerait une forêt aléatoire? Changez la méthode de modélisation en Forêt aléatoire et regardez la matrice de confusion.

A l'air décent, mais la régression logistique a mieux fonctionné.
On peut réessayer avec une machine à vecteurs de support.

Mieux que la forêt aléatoire, mais toujours pas aussi bon que le modèle de régression logistique.
Parfois, les méthodes les plus simples sont les meilleures, ce n'est pas comme ça?
Voici à quoi ressemblerait votre flux de travail final une fois que vous avez terminé avec l'ensemble du processus.

Pour les personnes souhaitant travailler en groupe, ils peuvent également exporter vos flux de travail et les envoyer à des amis qui peuvent travailler à vos côtés.

Le fichier résultant a l'extension (.ux) et peut être ouvert dans n'importe quelle autre configuration Orange.
Remarques finales
Orange est une plateforme qui peut être utilisée pour presque tout type d'analyse, mais le plus important, pour des images belles et faciles. Dans cet article, nous explorons comment visualiser un ensemble de données. Un modèle prédictif a également été réalisé, en utilisant un prédicteur de régression logistique, SVM et un prédicteur de forêt aléatoire pour trouver les statuts de prêt pour chaque personne en conséquence.
J'espère que ce tutoriel vous a aidé à découvrir des aspects du problème que vous n'avez peut-être pas compris ou que vous n'avez pas compris avant. Il est très important de comprendre le pipeline de la science des données et les étapes que nous prenons pour former un modèle, Et cela devrait sûrement vous aider à construire de meilleurs modèles prédictifs bientôt !!




