Explorative Datenanalyse mit Datenvisualisierungstechniken.

Inhalt

Dieser Beitrag wurde im Rahmen der . veröffentlicht Data Science Blogathon

Einführung

um Ihre Daten besser zu verstehen, was bei der weiteren Datenvorverarbeitung hilft. Und Datenvisualisierung ist der Schlüssel, da es das explorative Datenanalyseverfahren rationalisiert und die Daten einfach durch wunderbare Diagramme und Grafiken analysiert.

87001eda20with20visualization20feature20img-1734958

Inhaltsverzeichnis

  • Datenvisualisierung
  • Explorative Datenanalyse
  • Univariate Analyse
    • Kategoriale Daten
    • Numerische Daten
  • Bivariate Analyse / multivariat
    • Numerisch und numerisch
    • Numerisch und kategorial
    • Kategorisch und kategorisch
  • Abschließende Anmerkungen

Datenvisualisierung

Die Datenvisualisierung stellt Text oder numerische Daten in einem visuellen Format dar, was das Verständnis der durch die Daten ausgedrückten Informationen erleichtert. UNS, die Menschen, Wir erinnern uns leichter an Bilder als an lesbaren Text, Python stellt uns daher verschiedene Bibliotheken zur Datenvisualisierung wie Matplotlib zur Verfügung, Seegeboren, verschwörerisch, etc. In diesem Tutorial, Wir werden Matplotlib und Seaborn verwenden, um verschiedene Techniken zum Erkunden von Daten mit verschiedenen Diagrammen durchzuführen.

Explorative Datenanalyse

Hypothesen erstellen, Es ist sehr wichtig, verschiedene Geschäftsannahmen zu testen, während man sich mit jeder Problemstellung des maschinellen Lernens befasst, und dies ist es, was EDA hilft, dies zu erreichen. Es gibt verschiedene Tools und Techniken, um Ihre Daten zu verstehen, und die Grundvoraussetzung ist, dass Sie über Numpy-Kenntnisse für mathematische Operationen und Pandas für die Datenmanipulation verfügen.

Wir werden einen sehr beliebten Titanic-Datensatz verwenden, mit dem jeder vertraut ist und von dem heruntergeladen werden kann hier.

Beginnen wir nun mit der Untersuchung von Daten und dem Studium verschiedener Datenvisualisierungsdiagramme mit unterschiedlichen Datentypen.. Und um einige der Techniken zu demonstrieren, Wir werden auch einen integrierten Datensatz von seaborn als Trinkgelddaten verwenden, der die Trinkgelder erklärt, die jeder Kellner von verschiedenen Kunden erhält..

Beginnen wir mit dem Importieren von Bibliotheken und Laden von Daten

numpy als np importieren
Pandas pd importieren
import matplotlib.pyplot als plt
Seegeboren als sns importieren
aus seegeborenen Import load_dataset
#titanischer Datensatz
data = pd.read_csv("titanic_train.csv")
#Tipps-Datensatz
Tipps = load_dataset("Tipps")

Univariate Analyse

El análisis univariado es la forma más simple de análisis donde exploramos una sola Variable. Eine univariate Analyse wird durchgeführt, um die Daten besser zu beschreiben. Wir führen univariate Analysen von numerischen und kategorialen Variablen unterschiedlich durch, da der Plot unterschiedliche Graphen verwendet.

Kategoriale Daten

Eine Variable mit textbasierten Informationen wird als kategoriale Variablen bezeichnet. Schauen wir uns mehrere Diagramme an, mit denen wir kategoriale Daten visualisieren können.

1) CountPlot

Countplot es simplemente un gráfico de recuento de frecuencias en forma de Balkengrafik. Zeichnen Sie die Anzahl für jede Kategorie auf einem separaten Balken. Wenn wir die Zählfunktion von Pandas-Werten in einer beliebigen Spalte verwenden, ist die gleiche visuelle Form der Zählwertfunktion. In unserer Datenzielvariable überlebt es und ist kategorisch, Also lasst uns ein Tally-Diagramm davon zeichnen.

sns.countplot(data['Survived'])
plt.show()
90944countplot-9084540

2) Kuchendiagramm

Darüber hinaus ist das Kreisdiagramm das gleiche wie das Zähldiagramm., es gibt Ihnen nur zusätzliche Informationen über den Prozentsatz der Präsenz jeder Kategorie in den Daten, was bedeutet, welche Kategorie das Gewicht in den Daten erhält. Schauen wir uns die Spalte Sex an, Wie hoch ist der Prozentsatz der reisenden männlichen und weiblichen Mitglieder?.

data['Sex'].value_counts().plot(kind="pie", autopct="%.2f")
plt.show()
82708pie_chart-5279286

Numerische Daten

Numerische Datenanalyse ist unerlässlich, da das Verständnis der Verteilung von Variablen hilft, die Daten weiter zu verarbeiten. Meistens werden Sie bei den numerischen Daten eine Menge Inkonsistenzen feststellen, untersuchen Sie daher numerische Variablen.

1) Histogramm

Ein Histogramm ist ein Verteilungsdiagramm von numerischen Spaltenwerten. Es erstellt einfach Bins in verschiedenen Wertebereichen und stellt sie dar, wo wir visualisieren können, wie die Werte verteilt sind. Wir können sehen, wo mehr Werte zu finden sind, als positiv, negativ oder in der Mitte (Medien). Werfen wir einen Blick auf die Spalte Alter.

plt.hist(data['Age'], bins=5)
plt.show()
92476Histogramm-1909364

2) Distplot

Distplot wird auch als zweites Histogramm bezeichnet, da es sich um eine leicht erweiterte Version des Histogramms handelt.. Distplot gibt uns ein KDE (Schätzung der Kerneldichte) über Histogramm erklärendes PDF (Wahrscheinlichkeitsdichtefunktion), was bedeutet, mit welcher Wahrscheinlichkeit jeder Wert in dieser Spalte vorkommt. Wenn Sie schon einmal Statistik studiert haben, die PDF-Funktion solltest du unbedingt kennen.

sns.distplot(Daten['Alter']) 
plt.zeigen()
61808distplot-7525709

3) Box-Plot

Boxplot ist eine sehr interessante Handlung, die einfach eine Zusammenfassung von . darstellt 5 Zahlen. Für eine Zusammenfassung von 5 Zahlen, Wir müssen einige Begriffe beschreiben.

  • Median: Mittelwert in Serie nach Sortierung
  • Perzentil: gibt die Anzahl der Werte an, die vor diesem Perzentil vorhanden sind, als, als Beispiel, 50 unter Perzentil 25, so erklärt es die Summe von 50 Werte, die unter dem Perzentil liegen 25
  • Minimum und Maximum: das sind keine Minimal- und Maximalwerte, Sie beschreiben vielmehr die untere und obere Grenze der Standardabweichung, die anhand des Interquartilsabstands berechnet wird. (IQR).
IQR = Q3 - Q1
Untere_Grenze = Q1 - 1.5 * IQR
Upper_bounday = Q3 +  1.5 * IQR

Hier sind Q1 und Q3 das erste Quantil (Perzentil 25) und das dritte Quantil (Perzentil 75)

Bivariate Analyse / multivariat

Wir haben mehrere Diagramme untersucht, um einzigartige numerische und kategoriale Daten zu untersuchen. Die bivariate Analyse wird verwendet, wenn wir die Verbindung zwischen 2 verschiedene Variablen und wir müssen es tun, weil, schließlich, Unsere Hauptaufgabe besteht darin, die Verbindung zwischen den Variablen zu untersuchen, um ein leistungsstarkes Modell zu erstellen. Und wenn wir mehr analysieren als 2 Variablen zusammen, bekannt als multivariate Analyse. Wir werden an verschiedenen Graphen für die bivariate und multivariate Analyse arbeiten.

Numerisch und numerisch

Zuerst, Lassen Sie uns die Grafiken untersuchen, wenn beide Variablen numerisch sind.

1) Streudiagramm

Das Zeichnen der Verbindung zwischen zwei Streudiagrammen numerischer Variablen ist ein einfaches Diagramm. Veamos la vinculación entre la cuenta total y la propina proporcionada a través de un Ausbreitungsdiagramm.

sns.scatterplot(tips["total_bill"], tips["tip"])
55638num_num20scatter-7996878

Multivariate Analyse mit Streudiagramm

wir können auch Beziehungen von grafisch darstellen 3 Variablen oder 4 Variablen mit einem Streudiagramm. Angenommen, wir möchten das getrennte Verhältnis von Männern und Frauen mit der bereitgestellten Gesamtrechnung und dem bereitgestellten Trinkgeld ermitteln.

sns.scatterplot(tips["total_bill"], tips["tip"], hue=tips["sex"])
plt.show()
266103_var20scatter-9593368

Wir können auch die multivariate Analyse von sehen 4 Variablen mit Streudiagrammen mit Stilargumenten. Angenommen, jetzt, zusammen mit dem Geschlecht, Ich möchte auch wissen, ob der Kunde Raucher war oder nicht, damit wir dies tun können.

sns.scatterplot(tips["total_bill"], tips["tip"], hue=tips["sex"], style=tips['smoker'])
plt.show()
45007Scatter_plot_4_var-4638789

Numerisch und kategorial

Wenn eine Variable numerisch und die andere kategorial ist, Es gibt mehrere Grafiken, die wir für bivariate und multivariate Analysen verwenden können.

1) Balkengrafik

Das Balkendiagramm ist ein einfaches Diagramm, mit dem wir eine kategoriale Variable auf der x-Achse und eine numerische Variable auf der y-Achse darstellen und die Beziehung zwischen beiden Variablen untersuchen können.. Die schwarze Spitze am oberen Rand jedes Balkens zeigt das Konfidenzintervall. Entdecken wir die P-Klasse mit dem Alter.

sns.barplot(data['Pclass'], data['Age'])
plt.show()
29348bivar_barplot-7789600

Multivariate Analyse durch Balkendiagramm

Hues Argument ist sehr nützlich und hilft bei der Analyse von mehr als 2 Variablen. Jetzt, zusammen mit der obigen Verlinkung, wir wollen mit geschlecht zu tun haben.

sns.barplot(data['Pclass'], data['Fare'], hue = data["Sex"])
plt.show()
20542multivar_barplot-3233455

2) Box-Plot

Ya hemos estudiado sobre Boxplots en el análisis univariante anterior. wir können für beide Variablen einen separaten Boxplot zeichnen. Lassen Sie uns das Geschlecht mit dem Alter anhand eines Boxplots untersuchen.

sns.boxplot(data['Sex'], data["Age"])
48591boxplot_bivar-7705788

Multivariate Analyse mit Boxplot

Zusammen mit Alter und Geschlecht, mal sehen wer überlebt hat und wer nicht.

sns.boxplot(data['Sex'], data["Age"], data["Survived"])
plt.show()
42456multivar_boxplot-2607238

3) Distplot

Distplot erklärt PDF-Funktion durch Schätzung der Kerneldichte. Distplot hat keinen Tonhöhenparameter, aber wir können es schaffen. Angenommen, wir möchten die Wahrscheinlichkeit von Personen mit einer Altersspanne mit Überlebenswahrscheinlichkeit sehen und herausfinden, deren Überlebenswahrscheinlichkeit für die Altersspanne der Sterblichkeitsrate hoch ist.

sns.distplot(data[data['Survived'] == 0]['Age'], hist=False, color="blue") 
sns.distplot(data[data['Survived'] == 1]['Age'], hist=False, color="orange")
plt.show()
97225multivaar_distplot-6852561

Wie wir sehen können, die grafik ist wirklich sehr interessant. das Blau zeigt die Wahrscheinlichkeit des Sterbens und das orange Diagramm zeigt die Überlebenswahrscheinlichkeit. Wenn wir es beobachten, können wir sehen, dass die Überlebenswahrscheinlichkeit von Kindern größer ist als die des Todes und dass es bei älteren Menschen umgekehrt ist. Diese kleine Analyse sagt manchmal einige wichtige Dinge über die Daten aus und hilft bei der Vorbereitung von Datengeschichten.

Kategorisch und kategorisch

Jetzt werden wir an kategorialen und kategorialen Spalten arbeiten.

1) Heatmap

Wenn Sie jemals eine Pandas-Kreuztabellenfunktion verwendet haben, Heatmap ist nur eine äquivalente visuelle Darstellung davon. Einfach, zeigt an, wie viel Präsenz einer Kategorie in Verbindung mit einer anderen Kategorie im Datensatz vorhanden ist. lass es mich zuerst mit der Kreuztabelle und später mit der Heatmap zeigen.

pd.crosstab(data['Pclass'], data['Survived'])
91814Kreuztabelle-2168745

Jetzt, mit der Heatmap, Wir müssen herausfinden, wie viele Menschen überlebt und gestorben sind.

sns.heatmap(pd.crosstab(data['Pclass'], data['Survived']))
25852Heatmap-8896723

2) Clusterkarte

Wir können auch eine Cluster-Map verwenden, um die Verbindung zwischen zwei kategorialen Variablen zu verstehen. Eine Cluster-Map zeichnet einfach ein Dendrogramm, das die Kategorien äquivalenten Verhaltens zusammen zeigt..

sns.clustermap(pd.crosstab(data['Parch'], data['Survived']))
plt.show()
80148Clusterkarte-6359716

Wenn Sie Clustering-Algorithmen hauptsächlich auf DBSCAN kennen, dann solltest du das Dendrogramm kennen. Dann, Dies sind alles Diagramme, die hauptsächlich bei explorativen Analysen verwendet werden. Es gibt noch ein paar weitere Plots, die Sie als gewalttätigen Plot zeichnen können, Linienmuster, ein gemeinsamer Schuss, der nicht hauptsächlich verwendet wird.

Das komplette Notebook für mehr Übung in EDA und Datenvisualisierung ist in meinen Notebooks von kaggle aktiviert, greife darauf zu hier.

Abschließende Anmerkungen

EDA ist nur ein Schlüssel zum besseren Verständnis und zur besseren Darstellung Ihrer Daten, was, während, hilft Ihnen, ein leistungsfähigeres und allgemeineres Modell zu erstellen. Datenvisualisierung ist einfach durchzuführen EDA, damit andere unsere Analyse leichter verstehen.

Ich hoffe, es war einfach, alle Plots, die wir gezeichnet haben, nachzuholen. Wenn Sie Zweifel haben, Erwähnen Sie es im Kommentarbereich unten. Ich helfe dir gerne.

Über den Autor

Raghav Agrawal

Ich studiere Informatik. Ich mag Data Science und Big Data sehr. Ich liebe es, mit Daten zu arbeiten und neue Technologien zu lernen. Bitte, melde dich gerne bei mir Linkedin.

Die in diesem Beitrag gezeigten Medien sind nicht Eigentum von DataPeaker und werden nach Ermessen des Autors verwendet.

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher