introduction

Comme nous le savons tous, il existe certains processus pour analyser les données. Premier, on définit le problème, puis nous extrayons les données et les préparons pour l'analyse. Avant l'ingénierie future et la construction de modèles, il y a une étape importante.

L'analyse exploratoire des données fait référence au processus critique consistant à mener une recherche initiale sur les données pour découvrir des modèles, détecter les anomalies et vérifier les hypothèses à l'aide de statistiques récapitulatives et de représentations graphiques. L'analyse exploratoire des données est une étape importante avant de commencer à analyser ou modéliser vos données.. Fournit le contexte nécessaire pour développer un modèle approprié et interpréter correctement les résultats.
Regardons un exemple d'implémentation de R.
1. Découverte de données
Dans cette partie, on découvre les types de variables et leurs statistiques récapitulatives dans les données. Premier, nous chargeons le jeu de données USArrests dans R. Ensuite, nous imprimons l'ensemble de données en utilisant la fonction « têteQueue » qui imprime l'ensemble de données du premier 4 enfin 4 lignes par défaut.

Ensuite, nous recherchons des types de variables et des statistiques récapitulatives des variables.
Les fonctions « aperçu » Oui « str » Ils nous donnent des types de variables.

La fonction « num_profilage » dans la bibliothèque funModeling nous donne des statistiques détaillées comme la moyenne, l'écart type, asymétrie, aplatissement, l'intervalle interquartile, etc.

Interprétons quelques résultats à titre d'exemple:
- En moyenne, le meurtre dans chaque ville est 7.788.
- L'écart type du tour est 83,34. Est élevé. Un écart type élevé indique que les points de données sont répartis sur une large plage de valeurs.
La asimetría es no ser simétrica de una variableEn statistique et en mathématiques, ongle "variable" est un symbole qui représente une valeur qui peut changer ou varier. Il existe différents types de variables, et qualitatif, qui décrivent des caractéristiques non numériques, et quantitatif, représentation de grandeurs numériques. Les variables sont fondamentales dans les expériences et les études, puisqu’ils permettent l’analyse des relations et des modèles entre différents éléments, faciliter la compréhension de phénomènes complexes.....

- Si asymétrie> 0 -> répartition asymétrique vers la droite
- Si l'asymétrie la distribution est asymétrique vers la gauche
- Si biais = 0 -> distribution symétrique.
Donc, alors que la population urbaine est biaisée vers la gauche, Le viol est biaisé vers la droite.
Le kurtosis montre si la distribution est nette ou aplatie.

- Si l'aplatissement> 3 -> la distribution est nette
- Si le kurtosis la distribution s'aplatit
- Si l'aplatissement = 3 -> la distribution est normale normale
A) Oui, alors que la population urbaine est fortement répartie, l'assaut est distribué écrasé.
2. Détecter les valeurs manquantes

- Como se ve en la chiffre"Chiffre" est un terme utilisé dans divers contextes, De l’art à l’anatomie. Dans le domaine artistique, fait référence à la représentation de formes humaines ou animales dans des sculptures et des peintures. En anatomie, désigne la forme et la structure du corps. En outre, en mathématiques, "chiffre" Il est lié aux formes géométriques. Sa polyvalence en fait un concept fondamental dans de multiples disciplines...., il n'y a pas de valeurs manquantes dans les données.
3. Détection de valeurs atypiques
Une combinaison de valeurs inhabituelles dans au moins deux variables est une valeur aberrante multivariée. L'effet des études statistiques peut être affecté par toutes sortes de valeurs aberrantes. Ils peuvent fausser les analyses statistiques et violer vos hypothèses.
Prouvons à la fois les valeurs aberrantes multivariées et individuelles.
La fonction « plot_outlier » c'est une fonction très utile dans la bibliothèque « dlooker ». Spectacles boîtes à moustachesDiagrammes encadrés, Aussi connu sous le nom de diagrammes en boîte et à moustaches, sont des outils statistiques qui représentent la distribution d’un ensemble de données. Ces diagrammes montrent la médiane, quartiles et valeurs aberrantes, Permettre de visualiser la variabilité et la symétrie des données. Ils sont utiles pour la comparaison entre différents groupes et pour l’analyse exploratoire, faciliter l’identification des tendances et des modèles dans les données.... e histogrammesLes histogrammes sont des représentations graphiques qui montrent la distribution d’un ensemble de données. Ils sont construits en divisant la plage de valeurs en intervalles, O "Bacs", et compter la quantité de données tombées dans chaque intervalle. Cette visualisation vous permet d’identifier des modèles, Tendances et variabilité des données, faciliter l’analyse statistique et la prise de décision éclairée dans diverses disciplines.... de todas las variables numéricas con valores atípicos y sin valores atípicos. La raison pour laquelle les Boxplots montrent qu'ils sont des outils très utiles pour visualiser les valeurs aberrantes.




Comme on le voit dans les graphiques, seules les variables de violation ont des valeurs aberrantes. En outre, quand on regarde l'histogramme sans valeurs aberrantes, sa forme est plus symétrique.
Jetons un coup d'œil aux valeurs aberrantes multivariées. (est très utile en analyse multivariée, juste un exemple laissez-nous vous montrer)

Comme on le voit, il y a 7 valeurs aberrantes dans les données.
4. Vérification des hypothèses
Pour continuer avec les méthodes statistiques, il est important d'évaluer la normalité. Cette hypothèse nous permet de construire des intervalles de confiance et d'effectuer des tests d'hypothèses.. Pour vérifier la normalité, il n'y a pas de meilleure méthode qui soit correcte dans toutes les conditions. Il est très pratique d'utiliser des approches graphiques pour décider de la normalité multivariée, en plus des résultats numériques. Il peut être utile de les combiner pour offrir des options plus précises.




- Aucune des variables ne semble normale en regardant l'histogramme et le graphique QQ, et les histogrammes ne semblent pas normaux après la transformation des racines carrées et logarithmiques.
4. Visualisations
Dans cette partie, nous pouvons observer différents graphiques de variables et la relation entre les variables visuellement. Écrivons quelques questions de recherche.
4.1. Dans quelle ville y a-t-il plus de meurtres?
Pour cette question, podemos usar mapa o graphique à barresLe graphique à barres est une représentation visuelle des données qui utilise des barres rectangulaires pour montrer des comparaisons entre différentes catégories. Chaque barre représente une valeur et sa longueur est proportionnelle à celle-ci. Ce type de graphique est utile pour visualiser et analyser les tendances, faciliter l’interprétation des informations quantitatives. Il est largement utilisé dans diverses disciplines, tels que les statistiques, Marketing et recherche, En raison de sa simplicité et de son efficacité.....

Le code R pour le graphique ci-dessous est:

! une fonction () {« porter strict »; window.addEventListener (« message », (une fonction (une) {si (annuler 0! == a.données["datawrapper-height"]) à (var e en a.data["datawrapper-height"]) {var t = document.getElementById (« datawrapper-chart - » + e) || document.querySelector (« iframe[src*=’”+e+”‘]"); T && (t.style.height = a.data["datawrapper-height"][e]+ "Px")}}))} ();
- Comme tu peux le voir, la plupart des meurtres ont été commis en Géorgie.
4.2. Quelles sont les valeurs de toutes les variables dans chaque ville?

4.3. Quelle est la relation entre l'agression et le meurtre?
Pour cette question, nous pouvons dessiner un tracé interactif comme celui montré ci-dessus pour voir les noms des états.
Les codes R du cadre interactif sont:

! une fonction () {« porter strict »; window.addEventListener (« message », (une fonction (une) {si (annuler 0! == a.données["datawrapper-height"]) à (var e en a.data["datawrapper-height"]) {var t = document.getElementById (« datawrapper-chart - » + e) || document.querySelector (« iframe[src*=’”+e+”‘]"); T && (t.style.height = a.data["datawrapper-height"][e]+ "Px")}}))} ();
Ou nous pouvons le tremper en utilisant ggplot.

Comme on le voit, il existe une relation positive entre le meurtre et l'agression.
4.4. Quelle est la relation entre la population urbaine et le viol?


- La ligne et la dispersion montrent la relation entre deux variables et dans les marges, nous voyons la boîte à moustaches de deux variables.
- On peut dire qu'il y a une relation positive entre la population urbaine et le viol.
4.5. Quelles sont les relations des variables entre elles?
Voyons la corrélation entre les variables. Pour voir ça, nous pouvons dessiner des cartes de chapeau.

Les corrélations positives sont indiquées en bleu et les corrélations négatives en rouge. L'intensité de la couleur est proportionnelle aux coefficients de corrélation. Quand on regarde la matrice de corrélation, On voit qu'entre certaines variables, il existe une forte relation positive comme les agressions et le viol., agression et meurtre.
conclusion
Compléter, Dans cet article, nous examinons l'analyse des données explicatives et les types de visualisation que nous pouvons utiliser pour l'analyse des données explicatives. Comme indiqué ci-dessus, c'est une étape très cruciale et doit être effectuée avant l'ingénierie future et la construction de modèles pour mieux comprendre les données. Vous pouvez accéder aux codes à partir du lien ci-dessous.
https://github.com/iremtanriverdi/R_codes
Les médias présentés dans cet article d'analyse de données exploratoire ne sont pas la propriété de DataPeaker et sont utilisés à la discrétion de l'auteur.



