L'analyse exploratoire des données | Guide du débutant à l'analyse de données explicatives

Contenu

introduction

908751t8d6pcrhaz3gzn31y-u0pa-9973427

Comme nous le savons tous, il existe certains processus pour analyser les données. Premier, on définit le problème, puis nous extrayons les données et les préparons pour l'analyse. Avant l'ingénierie future et la construction de modèles, il y a une étape importante.

336660wunzpjh43habilcy-3656588

L'analyse exploratoire des données fait référence au processus critique consistant à mener une recherche initiale sur les données pour découvrir des modèles, détecter les anomalies et vérifier les hypothèses à l'aide de statistiques récapitulatives et de représentations graphiques. L'analyse exploratoire des données est une étape importante avant de commencer à analyser ou modéliser vos données.. Fournit le contexte nécessaire pour développer un modèle approprié et interpréter correctement les résultats.

Regardons un exemple d'implémentation de R.

1. Découverte de données

Dans cette partie, on découvre les types de variables et leurs statistiques récapitulatives dans les données. Premier, nous chargeons le jeu de données USArrests dans R. Ensuite, nous imprimons l'ensemble de données en utilisant la fonction « têteQueue » qui imprime l'ensemble de données du premier 4 enfin 4 lignes par défaut.

37971ekran20resmi202021-04-212013-22-17-2966598

Ensuite, nous recherchons des types de variables et des statistiques récapitulatives des variables.

Les fonctions « aperçu » Oui « str » Ils nous donnent des types de variables.

44948ekran20resmi202021-04-212013-26-20-2006313

La fonction « num_profilage » dans la bibliothèque funModeling nous donne des statistiques détaillées comme la moyenne, l'écart type, asymétrie, aplatissement, l'intervalle interquartile, etc.

41825ekran20resmi202021-04-212013-28-24-3489380

Interprétons quelques résultats à titre d'exemple:

  • En moyenne, le meurtre dans chaque ville est 7.788.
  • L'écart type du tour est 83,34. Est élevé. Un écart type élevé indique que les points de données sont répartis sur une large plage de valeurs.

La asimetría es no ser simétrica de una variable.

20998asymétrie-formule-7011098
  • Si asymétrie> 0 -> répartition asymétrique vers la droite
  • Si l'asymétrie la distribution est asymétrique vers la gauche
  • Si biais = 0 -> distribution symétrique.

Donc, alors que la population urbaine est biaisée vers la gauche, Le viol est biaisé vers la droite.

Le kurtosis montre si la distribution est nette ou aplatie.

15816kurtosis-formule-3940283
  • Si l'aplatissement> 3 -> la distribution est nette
  • Si le kurtosis la distribution s'aplatit
  • Si l'aplatissement = 3 -> la distribution est normale normale

A) Oui, alors que la population urbaine est fortement répartie, l'assaut est distribué écrasé.

2. Détecter les valeurs manquantes

73260ekran20resmi202021-04-212013-52-00-3669889
  • Como se ve en la chiffre, il n'y a pas de valeurs manquantes dans les données.

3. Détection de valeurs atypiques

Une combinaison de valeurs inhabituelles dans au moins deux variables est une valeur aberrante multivariée. L'effet des études statistiques peut être affecté par toutes sortes de valeurs aberrantes. Ils peuvent fausser les analyses statistiques et violer vos hypothèses.

Prouvons à la fois les valeurs aberrantes multivariées et individuelles.

La fonction « plot_outlier » c'est une fonction très utile dans la bibliothèque « dlooker ». Spectacles boîtes à moustaches e histogrammes de todas las variables numéricas con valores atípicos y sin valores atípicos. La raison pour laquelle les Boxplots montrent qu'ils sont des outils très utiles pour visualiser les valeurs aberrantes.

21982ekran20resmi202021-04-212013-59-38-7625782
51775ekran20resmi202021-04-212013-59-47-6163278
91703ekran20resmi202021-04-212013-59-56-1152529
78480ekran20resmi202021-04-212014-00-03-7373866

Comme on le voit dans les graphiques, seules les variables de violation ont des valeurs aberrantes. En outre, quand on regarde l'histogramme sans valeurs aberrantes, sa forme est plus symétrique.

Jetons un coup d'œil aux valeurs aberrantes multivariées. (est très utile en analyse multivariée, juste un exemple laissez-nous vous montrer)

80834ekran20resmi202021-04-212014-06-35-3228285

Comme on le voit, il y a 7 valeurs aberrantes dans les données.

4. Vérification des hypothèses

Pour continuer avec les méthodes statistiques, il est important d'évaluer la normalité. Cette hypothèse nous permet de construire des intervalles de confiance et d'effectuer des tests d'hypothèses.. Pour vérifier la normalité, il n'y a pas de meilleure méthode qui soit correcte dans toutes les conditions. Il est très pratique d'utiliser des approches graphiques pour décider de la normalité multivariée, en plus des résultats numériques. Il peut être utile de les combiner pour offrir des options plus précises.

15701ekran20resmi202021-04-212014-10-40-6488305
26028ekran20resmi202021-04-212014-10-46-1014085
40118ekran20resmi202021-04-212014-10-53-2188309
12054ekran20resmi202021-04-212014-10-59-7145667
  • Aucune des variables ne semble normale en regardant l'histogramme et le graphique QQ, et les histogrammes ne semblent pas normaux après la transformation des racines carrées et logarithmiques.

4. Visualisations

Dans cette partie, nous pouvons observer différents graphiques de variables et la relation entre les variables visuellement. Écrivons quelques questions de recherche.

4.1. Dans quelle ville y a-t-il plus de meurtres?

Pour cette question, podemos usar mapa o graphique à barres.

54783ekran20resmi202021-04-212014-30-16-9216523

Le code R pour le graphique ci-dessous est:

39523ekran20resmi202021-04-212015-06-49-2639564

! une fonction () {« porter strict »; window.addEventListener (« message », (une fonction (une) {si (annuler 0! == a.données["datawrapper-height"]) à (var e en a.data["datawrapper-height"]) {var t = document.getElementById (« datawrapper-chart - » + e) ​​|| document.querySelector (« iframe[src*=”+e+”‘]"); T && (t.style.height = a.data["datawrapper-height"][e]+ "Px")}}))} ();

  • Comme tu peux le voir, la plupart des meurtres ont été commis en Géorgie.

4.2. Quelles sont les valeurs de toutes les variables dans chaque ville?

69707ekran20resmi202021-04-212021-08-25-2055521

4.3. Quelle est la relation entre l'agression et le meurtre?

Pour cette question, nous pouvons dessiner un tracé interactif comme celui montré ci-dessus pour voir les noms des états.

Les codes R du cadre interactif sont:

85910ekran20resmi202021-04-212015-45-01-1835458

! une fonction () {« porter strict »; window.addEventListener (« message », (une fonction (une) {si (annuler 0! == a.données["datawrapper-height"]) à (var e en a.data["datawrapper-height"]) {var t = document.getElementById (« datawrapper-chart - » + e) ​​|| document.querySelector (« iframe[src*=”+e+”‘]"); T && (t.style.height = a.data["datawrapper-height"][e]+ "Px")}}))} ();

Ou nous pouvons le tremper en utilisant ggplot.

93494ekran20resmi202021-04-212015-23-48-9681282

Comme on le voit, il existe une relation positive entre le meurtre et l'agression.

4.4. Quelle est la relation entre la population urbaine et le viol?

79208ekran20resmi202021-04-212015-29-11-9001486
70991ekran20resmi202021-04-212015-29-20-3103869
  • La ligne et la dispersion montrent la relation entre deux variables et dans les marges, nous voyons la boîte à moustaches de deux variables.
  • On peut dire qu'il y a une relation positive entre la population urbaine et le viol.

4.5. Quelles sont les relations des variables entre elles?

Voyons la corrélation entre les variables. Pour voir ça, nous pouvons dessiner des cartes de chapeau.

71125ekran20resmi202021-04-212015-36-03-7633276

Les corrélations positives sont indiquées en bleu et les corrélations négatives en rouge. L'intensité de la couleur est proportionnelle aux coefficients de corrélation. Quand on regarde la matrice de corrélation, On voit qu'entre certaines variables, il existe une forte relation positive comme les agressions et le viol., agression et meurtre.

conclusion

Compléter, Dans cet article, nous examinons l'analyse des données explicatives et les types de visualisation que nous pouvons utiliser pour l'analyse des données explicatives. Comme indiqué ci-dessus, c'est une étape très cruciale et doit être effectuée avant l'ingénierie future et la construction de modèles pour mieux comprendre les données. Vous pouvez accéder aux codes à partir du lien ci-dessous.

https://github.com/iremtanriverdi/R_codes

Les médias présentés dans cet article d'analyse de données exploratoire ne sont pas la propriété de DataPeaker et sont utilisés à la discrétion de l'auteur.

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données