Qu'est-ce que la visualisation des données? Techniques de visualisation de données

Contenu

Cet article a été publié dans le cadre de la Blogathon sur la science des données

introduction

En statistiques appliquées et en apprentissage automatique, Visualisation de données est l'une des compétences les plus importantes.

La visualisation des données fournit un ensemble important d'outils pour identifier une compréhension qualitative. Cela peut être utile lorsque nous essayons d'explorer l'ensemble de données et d'extraire des informations pour connaître un ensemble de données et peut aider avec identification de modèle, données corrompues, Valeurs atypiques, beaucoup plus.

Si nous avons une petite connaissance du domaine, les visualisations de données peuvent être utilisées pour exprimer et identifier des relations clés dans des tableaux et des graphiques qui sont plus utiles pour vous et vos parties prenantes que les mesures d'association ou de pertinence.

Dans ce billet, nous discuterons de certains des graphiques de base O versements que vous pouvez utiliser pour mieux comprendre et visualiser vos données.

Table des matières

1. Qu'est-ce que la visualisation des données?

2. Avantages d'une bonne visualisation des données

3. Différents types d'analyse pour la visualisation des données

4. Techniques d'analyse univariée pour la visualisation des données

  • Diagramme de distribution
  • Parcelle à moustaches
  • Cadre de violon

5. Techniques d'analyse bivariée pour la visualisation des données

  • Graphique linéaire
  • Graphique à barres
  • Nuage de points

Qu'est-ce que la visualisation des données?

L'affichage des données est défini comme représentation graphique contenant le information et le Les données.

Utiliser des éléments visuels comme graphique, graphique, Oui Plans, les techniques de visualisation des données offrent un moyen réalisable de visualiser et comprendre les tendances, valeurs aberrantes et modèles dans les données.

Actuellement, nous avons beaucoup de données entre nos mains, En d'autres termes, dans le monde de Big Data, les outils et technologies de visualisation des données sont essentiels pour analyser des quantités massives d'informations et prendre des décisions éclairées par les données.

Il est utilisé dans de nombreux domaines tels que:

  • Modeler événements complexes.
  • Visualiser des phénomènes qui ne peuvent pas être observés directement, Quoi conditions météorologiques, les conditions médicales, O relations mathématiques.

Avantages d'une bonne visualisation des données

Puisque nos yeux peuvent capturer les couleurs et les motifs, pour cela, on peut rapidement identifier la partie rouge du bleu, le carré du cercle, notre culture est visuelle, qui comprend tout, de l'art et des publicités à la télévision et aux films.

Ensuite, La visualisation des données est une autre technique d'art visuel qui capte notre intérêt et maintient notre concentration sur le message capturé à l'aide des yeux..

Chaque fois que nous visualisons un graphique, nous identifions rapidement les tendances et les valeurs aberrantes présentes dans l'ensemble de données.

Les utilisations de base de la technique de visualisation des données sont les suivantes:

  • C'est une technique puissante pour explorer les données avec présentable Oui interprétable résultats.
  • Dans le procédure d'exploration de données, agit comme une étape principale dans la partie de prétraitement.
  • C'est compatible avec procédure de nettoyage des données trouver des données incorrectes et des valeurs manquantes ou corrompues.
  • Cela aide aussi construire et choisir des variables, ce qui signifie que nous devons déterminer quoi variable inclure et exclure dans l'analyse.
  • Dans la procédure de Baisse des données, il joue également un rôle crucial dans la combinaison des catégories.

Visualisation de données

Source de l'image: Google images

Différents types d'analyse pour la visualisation des données

Principalement, il existe trois types d'analyse différents pour la visualisation des données:

Analyse univariée: En analyse univariée, nous utiliserons une seule fonctionnalité pour analyser presque toutes ses propriétés.

Analyse bivariée: Lorsque nous comparons les données entre exactement 2 fonctionnalités, connue sous le nom d'analyse bivariée.

Analyse multivariable: En analyse multivariée, Volonté comparer plus que 2 variables.

REMARQUE:

Dans ce billet, notre objectif principal est de comprendre les concepts suivants:

  • Comment trouver des inférences à partir des techniques de visualisation de données?
  • Dans quel état, quelle technique est plus utile que d'autres?

Nous n'allons pas approfondir la partie codage / mise en œuvre de différentes techniques dans un ensemble de données particulier, mais nous essayons de trouver la solution aux questions précédentes et de comprendre uniquement le code de l'extrait à l'aide d'exemples de diagrammes pour chacune des techniques de visualisation de données. .

À présent, commençons par les différentes techniques de visualisation de données:

Techniques d'analyse univariée pour la visualisation des données

1. Diagramme de distribution

  • C'est l'un des meilleurs graphiques univariés pour connaître la distribution des données.
  • Quand on veut analyser l'impact sur la variable cible (Sortir) par rapport à une variable indépendante (entrée), nous utilisons beaucoup les graphiques de distribution.
  • Ce graphique nous donne une combinaison de fonctions de densité de probabilité (pdf) et histogramme sur un seul graphique.

Mise en œuvre:

  • Le graphe de répartition est présent dans le Seaborn emballer.

L'extrait de code est le suivant:

sns.FacetGrid(hb,teinte ="SurvStat",taille=5).carte(sns.distplot,'age').ajouter_légende()

techniques de visualisation de données |  parcelle de distribution

Quelques conclusions déduites du schéma de répartition ci-dessus:

À partir du graphique de distribution précédent, nous pouvons conclure les observations suivantes:

  • Nous avons observé que nous créons un diagramme de distribution sur la caractéristique ‘L'âge’(variable d'entrée) et nous utilisons différentes couleurs pour le État de survie(variable de sortie) puisque c'est la classe de prédire.
  • Il y a une grande zone de chevauchement entre les PDF pour différentes combinaisons.
  • Dans ce graphique, les structures pointues en forme de bloc sont appelées histogrammes et la courbe lissée est connue sous le nom de fonction de densité de probabilité (PDF).

REMARQUE:

La fonction de densité de probabilité (PDF) d'une courbe peut nous aider à saisir la distribution sous-jacente de cette caractéristique, qui est l'un des principaux points à retenir de la visualisation des données ou de l'analyse exploratoire des données (AED).

2. Parcelle à moustaches

  • Ce tableau peut être utilisé pour obtenir plus détails statistiques sur les données.
  • Les lignes au maximum et au minimum sont aussi appelées moustaches.
  • Les points en dehors des moustaches seront considérés comme une valeur aberrante.
  • La boîte à moustaches nous donne également une description de la quartile 25, 50, 75.
  • A l'aide d'un box plot, on peut aussi déterminer la Gamme interquartile (IQR) où le maximum de détails des données seront présents. Pour cela, en outre, cela peut nous donner une idée claire des valeurs aberrantes dans l'ensemble de données.

boîte à moustaches |  techniques de visualisation de données

Figure. Diagramme général pour une boîte à moustaches

Mise en œuvre:

  • Boxplot est activé sur Seaborn Une bibliothèque.
  • Ici x est considéré comme la variable dépendante et y est considéré comme la variable indépendante. Ces boîtes à moustaches viennent en dessous analyse univariée, ce qui signifie que nous explorons des données avec une seule variable.
  • Ici, nous essayons de vérifier l'impact d'une fonctionnalité appelée « Axil_nodes » dans la classe nommée « État de survie » et non entre deux caractéristiques indépendantes.

L'extrait de code est le suivant:

sns.boxplot(x='SurvStat',y='axil_nodes',données=hb)

box plot seaborn |  techniques de visualisation de données

Quelques conclusions déduites de la boîte à moustaches ci-dessus:

À partir du diagramme en boîte et en moustache ci-dessus, nous pouvons conclure les observations suivantes:

  • Combien de données sont présentes dans le premier quartile et combien de points sont des valeurs aberrantes, etc.
  • Pour la classe 1, nous pouvons voir qu'il y a très peu ou pas de données présentes entre le médian et le premier quartile.
  • Il y a plus de valeurs aberrantes pour la classe 1 dans la fonction nommée axil_nodes.

REMARQUE:

Nous pouvons obtenir des détails sur les valeurs aberrantes pour nous aider à bien préparer les données avant de les envoyer à un modèle, puisque les valeurs aberrantes influencent de nombreux modèles d'apprentissage automatique.

3. Cadre de violon

  • Les parcelles de violon peuvent être considérées comme une combinaison de boîtes à moustaches au milieu et de parcelles de distribution(Estimation de la densité des grains) des deux côtés des données.
  • Cela peut nous donner la description de la distribution de l'ensemble de données comme si la distribution était multimodal, Obliquitéetc.
  • Il nous fournit également des informations utiles telles que Intervalle de confiance de 95%.

complot de violon |  techniques de visualisation de données

Figure. Schéma général pour un cadre de violon

Mise en œuvre:

  • L'intrigue du violon est présente dans le Seaborn emballer.

L'extrait de code est le suivant:

sns.violinplot(x='SurvStat',y='op_yr',données=hb,taille=6)

complot de violon né dans la mer

Quelques conclusions déduites de l'intrigue du violon ci-dessus:

De l'intrigue de violon précédente, nous pouvons conclure les observations suivantes:

  • La médiane des deux classes est proche de 63.
  • Le nombre maximum de personnes avec classe 2 il a un op_yr valeur de 65 tandis que, pour les gens de la classe 1, la valeur maximale est d'environ 60.
  • En même temps, le troisième quartile de la médiane a moins de points de données que la médiane du premier quartile.

Techniques d'analyse bivariée pour la visualisation des données

1. Graphique linéaire

  • C'est le graphique que l'on peut voir dans les coins de tout type d'analyse entre 2 variables.
  • Les graphiques en courbes ne sont rien de plus que les valeurs d'une série de points de données à connecter avec des lignes droites.
  • L'intrigue peut sembler très simple mais elle a plus d'applications non seulement dans l'apprentissage automatique mais dans de nombreux autres domaines.

Mise en œuvre:

  • Le graphique linéaire est présent dans le Matplotlib emballer.

L'extrait de code est le suivant:

plt.plot(X,Oui)

graphique linéaire |  techniques de visualisation de données

Quelques conclusions déduites du schéma de ligne précédent:

Du graphique linéaire précédent nous pouvons tirer les observations suivantes:

  • Ceux-ci sont utilisés directement à partir de l'exécution de la comparaison de distribution à l'aide de versements QQ pour régler le CV en utilisant le méthode du coude.
  • Il est utilisé pour analyser les performances d'un modèle à l'aide de la courbe ROC- ASC.

2. Graphique à barres

  • C'est l'un des graphiques les plus utilisés, que nous aurions vu plusieurs fois non seulement dans l'analyse des données, mais nous utilisons également ce graphique chaque fois qu'il y a une analyse de tendance dans de nombreux domaines.
  • Même si cela semble simple, il est puissant pour analyser des données comme chiffres de ventes chaque semaine, revenu d'un produit, Nombre de visiteurs d'un site chaque jour de la semaineetc.

Mise en œuvre:

  • Le graphique à barres est présent dans le Matplotlib emballer.

L'extrait de code est le suivant:

plt.bar(X,Oui)

graphique à barres

Quelques conclusions inférées du graphique à barres précédent:

À partir du graphique à barres précédent, nous pouvons conclure les observations suivantes:

  • Nous pouvons visualiser les données dans un graphique sympa et nous pouvons transmettre les détails directement aux autres.
  • Ce graphique peut être simple et clair, mais pas très souvent utilisé dans les applications de science des données.

3. Diagramme de dispersion

  • C'est l'un des graphiques les plus utilisés pour visualiser des données simples en apprentissage automatique et en science des données..
  • Ce graphique nous décrit comme une représentation, où chaque point de l'ensemble de données complet est présent par rapport à 2 O 3 fonctionnalités (Colonnes).
  • Les diagrammes de dispersion sont disponibles en 2D et en 3D. Le nuage de points 2D est le plus courant, où nous essaierons principalement de trouver les motifs, groupes et séparabilité des données.

Mise en œuvre:

  • Le diagramme de dispersion est présent dans le Matplotlib emballer.

L'extrait de code est le suivant:

plt.scatter(X,Oui)

nuage de points

Quelques conclusions déduites du nuage de points ci-dessus:

Du diagramme de dispersion précédent, nous pouvons conclure les observations suivantes:

  • Les couleurs sont attribuées à différents points de données en fonction de leur présence dans l'ensemble de données. En d'autres termes, représentation de la colonne cible.
  • Nous pouvons colorer les points de données en fonction de leur étiquette de classe donnée dans l'ensemble de données.

Ceci termine la discussion d'aujourd'hui!!

Remarques finales

Merci pour la lecture!

J'espère que vous avez apprécié le post et augmenté vos connaissances des techniques de visualisation de données.

N'hésitez pas à me contacter sur Courrier électronique

Tout ce qui n'est pas mentionné ou voulez-vous partager vos pensées? N'hésitez pas à commenter ci-dessous et je vous répondrai.

Pour les postes restants, Demande à Relier.

A propos de l'auteur

Aashi Goyal

En ce moment, Je poursuis mon Bachelor of Technology (B.Tech) en génie électronique et des communications de Universidad Guru Jambheshwar (GJU), Hisar. Je suis très excité par les statistiques, l’apprentissage automatique et l'apprentissage en profondeur.

Vos suggestions et doutes sont les bienvenus ici dans la section commentaires. Merci d'avoir lu mon post !!

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données