Interaktive Datenvisualisierungsdiagramme mit Grafiken und Zwillingen

Inhalt

Dieser Artikel wurde im Rahmen der Data Science Blogathon

Einführung

Daten sind überall in der heutigen Datenwelt und wir können nur davon profitieren, wenn wir Informationen aus den Daten extrahieren können. Die Datenvisualisierung ist der visuell ansprechendste Aspekt der Datenanalyse, da wir mit den Daten interagieren können. Es ist diese magische Technik, um mit einem einzigen Blick Informationen an große Personengruppen zu übermitteln und aus Daten interessante Geschichten zu erstellen.. Pandas ist eines der beliebtesten und am weitesten verbreiteten Datenanalysetools in Python. Es hat auch eine integrierte Plotting-Funktion für Proben. Aber trotzdem, wenn es um interaktive Visualisierung geht, Python-Benutzer, die keine Front-End-Engineering-Kenntnisse haben, können einige Herausforderungen haben, wie viele Bibliotheken, als D3, chart.js, erfordert etwas JavaScript-Kenntnisse. Plotly und Twins sind an dieser Stelle hilfreich.

Wenn große Datenmengen vorhanden sind und Unternehmen Schwierigkeiten haben, kritische Informationen daraus zu extrahieren, Datenvisualisierung spielt eine wichtige Rolle bei wichtigen Geschäftsentscheidungen.

Plotly ist eine auf d3.js aufbauende Grafikbibliothek, die dank einer weiteren Bibliothek namens Cufflinks direkt mit Pandas-Datenrahmen verwendet werden kann.

In diesem kurzen Tutorial zeigen wir Ihnen, wie Sie interaktive Plotly-Diagramme mit Pandas-Datenrahmen verwenden.. Um die Dinge einfach zu halten, Wir werden Jupyter Notebook verwenden (installiert mit Anaconda Distribution mit Python) und der berühmte Titanic-Datensatz.

Datenvisualisierung in Python

Nach Abschluss der Datenbereinigung und -manipulation, Der nächste Schritt im Datenanalyseprozess besteht darin, aussagekräftige Erkenntnisse und Schlussfolgerungen aus den Daten zu ziehen, was kann man mit grafiken und tabellen erreichen. Python hat mehrere Bibliotheken, die für diesen Zweck verwendet werden können. Wie gewöhnlich, wir werden nur über die beiden Bibliotheken matplotlib und seaborn unterrichtet. Diese Bibliotheken enthalten Werkzeuge zum Erstellen von Liniendiagrammen, Kreisdiagramme, Balkendiagramme, Boxplots y una variedad de otros diagramas. Sie fragen sich wahrscheinlich, warum wir andere Bibliotheken für die Datenvisualisierung brauchen, wenn wir bereits matplotlib und seaborn haben. Als ich zum ersten Mal von der Handlung und den Zwillingen hörte, Ich hatte die gleiche Frage im Kopf.

Handlung

Die neueste Veröffentlichung von Plotly war 5.1.0, während der mit den Zwillingen war 0.17.5. Weil ältere Versionen von Manschettenknöpfen nicht mit neu veröffentlichten Plotting-Versionen kompatibel sind, Es ist wichtig, beide Pakete gleichzeitig zu aktualisieren oder kompatible Versionen zu finden. In Anaconda-Eingabeaufforderung, Führen Sie die folgenden Befehle aus, um Plotly zu installieren (o de Terminal selbst verwendet OS oder Ubuntu)

Plotly ist eine Open-Source- und Grafikbibliothek, die interaktives Plotten ermöglicht. Python, R, MATLAB, Arduino und REST, unter anderen, gehören zu den von der Bibliothek unterstützten Programmiersprachen.

Cufflink ist eine Python-Bibliothek, die Plotly und Pandas verbindet, Ermöglicht es uns, Grafiken direkt auf Datenrahmen zu zeichnen. Es ist im Wesentlichen ein Plugin.

Diagrammdiagramme sind interaktiv, wodurch wir über die Werte scrollen können, Vergrößern und verkleinern Sie Diagramme und identifizieren Sie Ausreißer im Datensatz. Die Matplotlib und Seaborn Letters, Zweitens, sie sind statisch; Wir können das Bild nicht vergrößern oder verkleinern, und alle Werte in der Tabelle sind nicht detailliert. Das wichtigste Feature von Plotly ist, dass wir dynamische Webgrafiken direkt aus Python erstellen können, was ist mit matplotlib nicht möglich. Wir können auch interaktive Grafiken und Animationen aus geografischen Daten erstellen, Wissenschaftler, Statistiken und Finanzen mit Plotly.

Auf PC installieren „Handlung „ Ja „Zwillinge eine Anaconda-Umgebung verwenden

conda install -c plotly plotly
conda install -c conda-forge manschettenknöpfe-py

o mit pip

pip install plotly --upgrade
pip install Manschettenknöpfe --upgrade

Laden von Bibliotheken

Pandas-Bibliotheken, Plotly und Manschettenknöpfe werden zuerst geladen. Denn plotly ist eine Online-Plattform, requiere una credencial de inicio de Sitzung para usarla en línea. Wir werden in diesem Artikel den Offline-Modus verwenden, das reicht für Jupyter Notebook.

#Pandas importieren
Pandas als pd importieren
#Importieren von Plotly und Manschettenknöpfen im Offline-Modus
Manschettenknöpfe als cf . importieren
plotly.offline importieren
cf.go_offline()
cf.set_config_file(offline=Falsch, world_readable=Wahr)

Datensatz laden

Wir haben erwähnt, dass wir den Titanic-Datensatz verwenden werden, was kannst du davon bekommen kaggle_link. Es wird nur die Datei train.csv verwendet.

df=pd.read_csv("zug.csv")
df.kopf()
744991-5903636

Histogramm

Das Histogramme se pueden utilizar para inspeccionar las distribuciones de una característica, als die Funktion „Alter“ in diesem Fall. Wir verwenden einfach die (Datenrahmen["Spaltenname"]) um eine Spalte auszuwählen und dann die iplot-Funktion hinzuzufügen. Als Beispiel, Wir können die Größe des Containers angeben, das Thema, der Titel und die Namen der Achsen. Mit dem Befehl „Hilfe (df.iplot)“, puede ver todos los Parameter del parámetro iplot.

df["Alter"].iplot(Art="Histogramm", Behälter=20, Thema="Weiß", Titel="Passenger's Ages",xTitel="Alter", yTitel ="Zählen")
592412-4290013

Sie können zwei verschiedene Verteilungen als zwei verschiedene Spalten darstellen, wenn Sie sie vergleichen möchten. Zum Beispiel, Wir werden das Alter der männlichen und weiblichen Passagiere auf derselben Parzelle aufzeichnen.

df["männlich_alter"]=df[df["Sex"]=="männlich"]["Alter"]
df["weibliches_alter"]=df[df["Sex"]=="weiblich"]["Alter"]df[["männlich_alter","weibliches_alter"]].iplot(Art="Histogramm", Behälter=20, Thema="Weiß", Titel="Passenger's Ages",
         xTitel="Alter", yTitel ="Zählen")
942873-2313005

Heatmap

Heatmaps können für eine Vielzahl von Zwecken verwendet werden, Wir werden sie jedoch verwenden, um die Korrelation zwischen Merkmalen in einem Datensatz als Beispiel zu überprüfen.

323664-1451145

Box-Plot

Boxplots sind äußerst nützlich, um Schiefe in Daten schnell zu interpretieren, Ausreißer und Quartilbereiche. Wir verwenden nun einen Boxplot, um die Verteilung von zu zeigen „Rate“ für jede Titanic-Klasse.

#Wir erhalten Hilfe von Pivot-Tabellen, um Tarifwerte in verschiedenen Spalten für jede Klasse zu erhalten.
df[['Pclass', 'Fare']].Drehpunkt(Spalten="PKlasse", Werte="Tarif").iplot(kind='box')
149315-8732195

Streudiagramm

Streudiagramme werden häufig verwendet, um die Beziehung zwischen zwei numerischen Variablen zu visualisieren. Für Variablen „Rate“ Ja „Alter“, Wir werden Streudiagramme verwenden. "Kategorien" ermöglicht es uns, die Variablen eines ausgewählten Merkmals in verschiedenen Farben anzuzeigen (Geschlecht der Passagiere in diesem Fall).

df.iplot(Art="streuen", Thema="Weiß",x="Alter",y ="Tarif",
            Kategorien="Sex")
858566-8021065

eine kurze Erinnerung: der Parameter „Kategorien“ muss ein String oder eine Spalte vom Typ float64 sein. Zum Beispiel, am Beispiel des Blasendiagramms, sollte Spalte konvertieren „Überlebt“ vom Typ integer in float64 oder string.

Blasendiagramm

Wir können Blasendiagramme verwenden, um mehrere Variablenbeziehungen gleichzeitig zu sehen. Mit den Parametern von „Kategorien“ Ja „Größe“ in der Grafik, Wir können die Unterkategorien für Farbe und Größe einfach anpassen. Mit dem Parameter „Text“, wir können auch die schwebende Textspalte angeben.

#Konvertieren der überlebenden Spalte in float64, um sie in Plotly verwenden zu können
df[['Survived']] = df[['Survived']].astyp('float64', kopieren=Falsch)df.iplot(kind='bubble', x="Tarif",y ="Alter",Kategorien="Überlebt", Größe="PKlasse", text="Name", xTitel="Tarif", yTitel ="Alter")
681587-5062110

Balkengrafik

Balkendiagramme eignen sich gut, um Daten aus verschiedenen Gruppen darzustellen, die miteinander verglichen werden. Was ist mehr, kann gestapelt verwendet werden, um verschiedene variable Effekte zu zeigen. Wir werden ein Balkendiagramm erstellen, um die Anzahl der überlebenden Passagiere nach Geschlecht anzuzeigen.

überlebt_sex = df[df['Survived']==1]['Sex'].value_counts()
dead_sex = df[df['Survived']==0]['Sex'].value_counts()
df1 = pd.DataFrame([überlebt_sex,toter_sex])
df1.index = ['Survived','Tot']
df1.iplot(kind='bar',barmode="Stapel", Titel="Überleben durch das Geschlecht")
560288-4447619

Ich habe versucht alles so einfach wie möglich zu erklären. Ich hoffe, es ist für Neulinge einfacher, die Handlung zu verstehen.

Plotly bietet auch wissenschaftliche Diagramme, 3D-Grafik, Karten und Animationen. Besuchen Sie die Dokumentation von plotly hier für mehr Details.

Werfen Sie einen Blick auf EDA – Explorative Datenanalyse mit Python Pandas und SQL ANKLICKEN ZUM LESEN

EndNote

Danke fürs Lesen!
Ich hoffe, Ihnen hat der Artikel gefallen und Sie haben Ihr Wissen erweitert.
Zögern Sie nicht, mich zu kontaktieren Über Email
Alles was nicht erwähnt wurde oder du deine Gedanken teilen möchtest? Fühlen Sie sich frei, unten einen Kommentar zu hinterlassen und ich melde mich bei Ihnen.

Über den Autor

Hardikkumar M. Dhaduk
Daten Analyst | Spezialist für digitale Datenanalyse | Student der Datenwissenschaften
Verbinde dich mit mir auf Linkedin
Verbinde dich mit mir auf Github

Die in diesem Artikel gezeigten Medien sind nicht Eigentum von DataPeaker und werden nach Ermessen des Autors verwendet.

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher