20 Must-have Panda-Funktionen für die explorative Datenanalyse

Inhalt

Einführung

ist ein wichtiger Bestandteil, sowie einer der am meisten unterschätzten Schritte in jedem Data-Science-Projekt. EDA ist für eine gut definierte und strukturierte Datenanalyse unerlässlich und sollte vor der Modellierungsphase des maschinellen Lernens durchgeführt werden.

Es geht darum, nach sorgfältiger Beobachtung Ideen aus den Daten zu finden und ihre Hauptmerkmale weiter zusammenzufassen.. Allgemein, die realen Daten, mit denen wir arbeiten, enthalten viel „Lärm“ Ja, Daher, Die manuelle Datenanalyse solcher Datensätze wird zu einem komplizierten und mühsamen Prozess.

1ybvocmjufnt2jbkn2khxnq-5649516

Einführung in Python-Tutorial: wissenschaftliche Berechnung mit Pandas | von Datenanalyse-Enthusiasten | Halb

Felshaken ist eine der am häufigsten verwendeten Sprachen für Datenwissenschaft insbesondere aufgrund des Vorhandenseins verschiedener Bibliotheken und Pakete, die die Datenanalyse erleichtern.

Bzw, Pandas ist eine der beliebtesten Python-Bibliotheken, die dabei hilft, Daten auf eine für die Analyse geeignete Weise darzustellen Serie Ja Datenrahmen Datenstrukturen. Bietet verschiedene Funktionen und Methoden zur Vereinfachung und Beschleunigung des Datenanalyseprozesses.

Hier verwenden wir den Datensatz "TITANIC", um die praktische Umsetzung aller Funktionen durchzuführen.

Zuerst, wir importieren die Numpy- und Pandas-Bibliothek und lesen dann den Datensatz.

Numpy und Pandas EDA importieren

Jetzt fangen wir an

1. df.kopf (): Standardmäßig, gibt die erste zurück 5 Datenrahmenzeilen. So ändern Sie den Standardwert, Sie können einen Wert in Klammern einfügen, um die Anzahl der zurückgegebenen Zeilen zu ändern.

Kopf Pandas eda

2. df.tail (): Standardmäßig, gibt das letzte zurück 5 Datenrahmenzeilen. Diese Funktion wird verwendet, um die letzten n Zeilen zu erhalten. Diese Funktion gibt die letzten n Zeilen des Objekts basierend auf Position zurück.

Schwanzpandas

3. df.info (): Hilft, sich einen schnellen Überblick über den Datensatz zu verschaffen. Diese Funktion wird verwendet, um eine kurze Zusammenfassung des Datenrahmens zu erhalten. Diese Methode druckt Informationen über einen DataFrame, einschließlich der Art der Index und Spaltentypen, Nicht-Null-Werte und Speichernutzung.

Informationen Pandas

4. df. Form: Zeigt die Anzahl der Dimensionen sowie die Größe in jeder Dimension an Abmessungen. Da die Datenrahmen zweidimensional sind, die zurückgegebene Form ist die Anzahl der Zeilen und Spalten.

Panda-Form

5. df. Größe: Gibt ein Int zurück, das die Anzahl der Elemente in diesem Objekt darstellt. Gibt die Anzahl der Zeilen zurück, wenn es sich um Series . handelt; Andernfalls, gibt die Anzahl der Zeilen multipliziert mit der Anzahl der Spalten zurück, wenn es sich um einen DataFrame handelt.

Größe Pandas

6. df.ndim: Gibt die Dimension des Rahmens zurück / Datenreihen. 1 für eine Dimension (Serie), 2 für zwei Dimensionen (Datenrahmen).

Pandas ndim

7. df.describe (): Gibt eine statistische Zusammenfassung der im Datensatz vorhandenen numerischen Spalten zurück. Diese Methode berechnet einige statistische Maße wie das Perzentil, der Mittelwert und die Standardabweichung der numerischen Werte der Serie oder des DataFrame.

beschreiben

8. df.probe (): Wird verwendet, um nach dem Zufallsprinzip in einer Reihe oder in einer Spalte zu proben. Ermöglicht die zufällige Auswahl von Werten aus einer Reihe oder einem DataFrame. Es ist nützlich, wenn wir eine Zufallsstichprobe aus einer Verteilung auswählen möchten.

Stichprobe

9. df.isnull () .Summe (): Gibt die Anzahl der fehlenden Werte in jeder Spalte zurück.

Es ist null

10. df.nunique (): Gibt die Anzahl der eindeutigen Elemente im Objekt zurück. Zählt die Anzahl der eindeutigen Einträge in Spalten oder Zeilen. Es ist sehr nützlich bei kategorialen Merkmalen, insbesondere in Fällen, in denen wir die Anzahl der Kategorien nicht im Voraus kennen.

nuniquam

11. df.index: Diese Funktion sucht nach einem bestimmten Element am Anfang der Liste und gibt den niedrigsten Index zurück, an dem das Element vorkommt.

Index

12. df-Spalten .: Gibt die Spaltenbeschriftungen des Datenrahmens zurück.

Säulen

13. df.memory_usage (): Gibt zurück, wie viel Speicher jede Spalte in Byte verwendet. Es ist besonders nützlich, wenn Sie mit großen Datenrahmen arbeiten.

Speichernutzung

14. df.dropna (): Diese Funktion wird verwendet, um eine Zeile oder Spalte aus einem Datenrahmen zu entfernen, in dem NaN oder Werte fehlen.

Tropfen

15. df.nlargest (): Gibt das erste zurück Norden Reihen geordnet nach Säulen in absteigender Reihenfolge.

größer

16. df.isna (): Diese Funktion gibt einen mit booleschen Werten gefüllten Datenrahmen zurück, wobei true fehlende Werte anzeigt.

isna

17. df.dupliziert (): Gibt einen booleschen String zurück, der doppelte Zeilen angibt.

Duplikat

18. value_counts (): Diese Funktion wird verwendet, um eine Reihe zu erhalten, die Zählungen von eindeutigen Werten enthält. Das resultierende Objekt wird in absteigender Reihenfolge angezeigt, sodass das erste Element das Element ist, das am häufigsten vorkommt. Fehlende Werte standardmäßig ausschließen. Diese Funktion ist nützlich, wenn wir das Problem des Klassenungleichgewichts auf eine Variable Kategorisch.

value_counts

19. df.korr (): Diese Funktion wird verwendet, um die paarweise Korrelation aller Spalten im Datenrahmen zu finden. Fehlende Werte werden automatisch ausgeschlossen. Für jede Spalte mit nicht numerischem Datentyp im Datenrahmen, es wird ignoriert. Diese Funktion ist bei der Merkmalsauswahl nützlich, indem man die Korrelation zwischen den Merkmalen und der Zielvariablen oder zwischen den Variablen betrachtet.

korr

20. Arten von df.d: Diese Funktion zeigt den Datentyp jeder Spalte an.

Abschließende Anmerkungen

Danke fürs Lesen!

Wenn dir das gefallen hat und du mehr wissen möchtest, Besuchen Sie meine anderen Artikel zu Data Science und Machine Learning, indem Sie auf den Link klicken

Kontaktieren Sie mich gerne unter Linkedin, Email.

Alles was nicht erwähnt wurde oder du deine Gedanken teilen möchtest? Fühlen Sie sich frei, unten einen Kommentar zu hinterlassen und ich melde mich bei Ihnen.

Bis dann, zu Hause bleiben, Bleiben Sie sicher, um die Ausbreitung von zu verhindern COVID-19, Und lerne weiter!

Über den Autor

Chirag Goyal

Heutzutage, Ich studiere meinen Bachelor of Technology (B.Tech) in Informatik und Ingenieurwissenschaften von Indisches Technologieinstitut Jodhpur (IITJ). Ich freue mich sehr über maschinelles Lernen, das tiefes Lernen und Künstliche Intelligenz.

Die in diesem Artikel gezeigten Medien sind nicht Eigentum von DataPeaker und werden nach Ermessen des Autors verwendet.

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher