Das 13 wichtigste Panda-Funktionen für Data Science

Inhalt

Dieser Beitrag wurde im Rahmen der Data Science Blogathon.

Einführung

Python ist leicht zu erlernen, hat eine große Online-Community von Studenten und Dozenten, und verfügt über einige wirklich leistungsstarke datenzentrierte Bibliotheken. Pandas ist eine der wichtigsten Python-Bibliotheken für Datenanalyse und Data Science.

Ändern Sie die Form von Pandas-Daten mit Melt |  Codementor

In diesem Beitrag, wir werden das sehen 13 Die wichtigsten Funktionen und Methoden von Pandas, die für alle Analysten und Data Scientists unerlässlich sind.

1. read_csv ()

Die read_csv-Funktion () hilft beim Lesen einer Datei mit durch Kommas getrennten Werten (csv) in einem Pandas DataFrame. Sie müssen nur den Pfad der Datei angeben, die Sie lesen möchten. Es kann auch Dateien lesen, die durch andere Trennzeichen als Kommas getrennt sind, Was | oder tab. Mehr Details hier.

data_1 = pd.read_csv(r'C:UsersABCDesktopblog_dataset.csv')

Die Daten wurden aus dem Datenquelle in Pandas DataFrame. Sie müssen den Pfad der Datei ändern, die Sie lesen möchten. Du kannst Laden Sie den Datensatz herunter im Blog verwendet.

Die to_csv-Funktion () funktioniert das genaue Gegenteil von read_csv (). Hilft, in Pandas DataFrame oder Series enthaltene Daten in eine CSV-Datei zu schreiben. Lesen Sie mehr über to_csv () hier. read_csv () y to_csv () Sie sind eine der am häufigsten verwendeten Funktionen in Pandas, da sie beim Lesen von Daten aus einer Datenquelle verwendet werden, und es ist sehr wichtig, sie zu kennen.

2. Kopf ()

Kopf (n) Wird verwendet, um die ersten n Zeilen eines Datensatzes zurückzugeben. Standardmäßig, df.kopf () werde das erste zurückgeben 5 Zeilen des DataFrame. Wenn du mehr willst / weniger Reihen, Sie können n als ganze Zahl angeben.

data_1.head(6)

Produktion:

Name Alter Stadt Zustand Geburtsdatum Geschlecht Stadttemperatur Gehalt
0 Natur 29 Indore Madhya Pradesh 20-11-1991 Männlich 35,5 50000
1 Rohit 23 Neu-Delhi Delhi 19-09-1997 Männlich 39,0 85000
2 Bimla 35 Rohtak Haryana 09-01-1985 Frau 39,7 20000
3 Rahul 25 Kalkutta West Bengal 19-09-1995 Männlich 36,5 40000
4 Chaman 32 Chennai Tamil Nadu 12-03-1988 Männlich 41,1 65000
5 Vivek 38 Gurugram Haryana 22-06-1982 Männlich 38,9 35000

Der Erste 6 Reihen (indiziert von 0 ein 5) werden erwartungsgemäß als Ausgabe zurückgegeben.

Schwanz () ist gleichbedeutend mit Kopf () und gibt die untersten n Zeilen eines Datensatzes zurück. Kopf () y Schwanz () helfen Ihnen, einen schnellen Blick auf Ihren Datensatz zu werfen und zu überprüfen, ob die Daten korrekt aus dem DataFrame gelesen wurden.

3. beschreiben ()

beschreiben () wird verwendet, um beschreibende Statistiken der Daten in einem DataFrame oder Pandas Series zu generieren. Fasst die zentrale Tendenz und Streuung des Datensatzes zusammen. beschreiben () hilft einen schnellen Überblick über den Datensatz zu bekommen. Weitere Details finden Sie auf Beschreibung () hier.

data_1.describe()

Produktion:

Alter Stadttemperatur Gehalt
erzählen 9.000000 8.000000 9.000000
meinen 32.000000 38.575000 44444.444444
std 5.894913 1.771803 21360.659582
Mindest 23.000000 35.500000 18000.000000
25% 29.000000 38.300000 35000.000000
50% 32.000000 38.950000 40000.000000
75% 38.000000 39.175000 52000.000000
max 39.000000 41.100000 85000.000000

beschreiben () listet verschiedene deskriptive statistische Maße für alle numerischen Spalten in unserem Datensatz auf. Indem Sie dem Inklusionsattribut den Wert ‚alle‘, Wir können die Beschreibung erhalten, um alle Spalten einzuschließen, einschließlich derer, die kategoriale Informationen enthalten.

4. memory_use ()

Speichernutzung () gibt einen Pandas-String zurück, der die Speichernutzung jeder Spalte enthält (und Bytes) in einem Pandas DataFrame. Durch Angabe des tiefen Attributs als True, wir können den realen Raum kennen, den jede Spalte einnimmt. Weitere Details zu memory_usage finden Sie () hier.

data_1.memory_usage(tief=wahr)

Produktion:

Index         80
Name         559
Alter           72
Stadt         578
Bundesland        584
Geburtsdatum          603
Geschlecht       553
Stadttemp     72
Gehalt        72
dtyp: int64

Der Speicherverbrauch jeder Spalte wurde in einer Pandas-Serie ausgegeben. Es ist wichtig, den Speicherverbrauch eines DataFrame zu kennen, damit es Fehler wie MemoryError in Python beheben kann.

5. astyp ()

astyp () wird verwendet, um ein Python-Objekt in einen bestimmten Datentyp zu konvertieren. Dies kann eine sehr nützliche Funktion sein, falls Ihre Daten nicht im richtigen Format gespeichert sind (Art der Daten). Als Beispiel, wenn Python Fließkommazahlen irgendwie als Strings falsch interpretiert hat, Sie können sie mit astype zurück in Gleitkommazahlen umwandeln (). Oder wenn Sie einen Objektdatentyp in eine Kategorie umwandeln möchten, Sie können astype verwenden ().

Daten_1['Geschlecht'] = data_1.Gender.astype('Kategorie')

Sie können die Änderung des Datentyps überprüfen, indem Sie sich die Datentypen aller Spalten im Datensatz mit dem dtypes-Attribut ansehen. So zeigen Sie die Astype-Dokumentation an (), klicke auf hier.

6. Platz[:]

Platz[:] hilft bei der Eingabe einer Gruppe von Zeilen und Spalten in einen Datensatz, ein Teil des Datensatzes, nach unserer anforderung. Als Beispiel, wenn wir nur das letzte wollen 2 Reihen und die erste 3 Spalten eines Datensatzes, wir können sie mit loc eingeben[:]. Wir können auch Zeilen und Spalten eingeben, die von Labels anstelle von Zeilen- und Spaltennummern unterstützt werden.

data_1.loc[0:4, ['Name', 'Alter', 'Bundesland']]

Produktion:

Name Alter Zustand
0 Natur 29 Madhya Pradesh
1 Rohit 23 Delhi
2 Bimla 35 Haryana
3 Rahul 25 West Bengal
4 Chaman 32 Tamil Nadu

Der obige Code gibt die Spalten zurück „Name“, „Alter“ Ja „Zustand“ für das erste 5 Kundendatensätze. Bitte beachten Sie, dass die Index beginnt ab 0 und Python, Na und[:] es ist inklusive in beiden genannten Werten. Dann 0: 4 bedeutet Indizes von 0 ein 4, beide enthalten.

Platz[:] ist eine der mächtigsten Funktionen von Pandas, und ist ein Muss für alle Datenanalysten und Data Scientists. Sie finden die Dokumentation für loc[:] hier.

iloc[:] funktioniert gleichwertig, nur das iloc[:] es ist nicht inklusive in beiden Werten. Bräune iloc[0:4] würde Zeilen mit Index zurückgeben 0, 1, 2 Ja 3, während loc[0:4] würde Zeilen mit Index zurückgeben 0, 1, 2, 3 Ja 4. Dokumentation für iloc[:] Es kann gefunden werden hier.

7. to_datetime ()

to_datetime () Konvertieren eines Python-Objekts in das Datetime-Format. Kann eine ganze Zahl annehmen, eine Gleitkommazahl, eine Liste, Pandas Series oder Pandas DataFrame als Argument. to_datetime () es ist sehr mächtig, wenn das Dataset Zeitreihen oder Datumswerte enthält.

Daten_1['Geburtsdatum'] = pd.to_datetime(Daten_1['Geburtsdatum'])

Die DOB-Spalte wurde jetzt in das Pandas-Datenzeitformat geändert. Alle Datums-Funktionen und die Zeit kann nun in dieser Spalte angewendet werden. Sie können mehr über to_datetime lesen () hier.

8. value_counts ()

value_counts () gibt einen Pandas-String zurück, der die Anzahl der eindeutigen Werte enthält. Betrachten Sie einen Datensatz, der Kundeninformationen über . enthält 5,000 Kunden eines Unternehmens. value_counts () hilft uns, die Anzahl der Vorkommen jedes eindeutigen Werts in einer Serie zu identifizieren. Kann auf Spalten angewendet werden, die Daten wie Status enthalten, Beschäftigungsbranche oder Alter der Kunden.

Daten_1['Bundesland'].value_counts()

Produktion:

Haryana           3
Delhi             2
West Bengal       1
Tamil Nadu        1
Bihar             1
Madhya Pradesh    1
Name: Bundesland, dtyp: int64

Die Anzahl der Vorkommen jedes Zustands in unserem Datensatz wurde in der Ausgabe zurückgegeben, wie erwartet. value_counts () es kann auch verwendet werden, um Balkendiagramme von kategorialen und ordinalen Daten zu zeichnen.

Daten_1['Bundesland'].value_counts(normalize=Wahr).Handlung(kind='bar', Titel="Bundesland")

Die Dokumentation für value_counts () kann gefunden werden hier.

9. drop_duplicates ()

drop_duplicates () gibt einen Pandas DataFrame mit entfernten doppelten Zeilen zurück. Auch unter Duplikaten, Es besteht die Möglichkeit, das erste Vorkommen beizubehalten (Anmeldung) des Duplikats oder des letzten. Sie können auch das Attribut inplace und ignore_index angeben.

data_1.drop_duplicates(inplace=Wahr)

inplace = True stellt sicher, dass Änderungen auf den ursprünglichen Datensatz angewendet werden. Sie können die Änderungen überprüfen, indem Sie sich die Form des ursprünglichen Datensatzes und des geänderten Datensatzes ansehen (nach dem Löschen von Duplikaten). Sie werden feststellen, dass die Anzahl der Zeilen von reduziert wurde 9 ein 8 (weil es entfernt wurde 1 Duplikat).

10. gruppiere nach ()

gruppiere nach () wird verwendet, um einen Pandas DataFrame zu gruppieren nach 1 oder mehr Spalten und führen Sie eine mathematische Operation darauf durch. gruppiere nach () kann verwendet werden, um Daten auf einfache Weise zusammenzufassen.

data_1.groupby(by='Bundesland').Gehalt.Mittelwert()

Produktion:

Bundesland
Bihar             18000
Delhi             68500
Haryana           27500
Madhya Pradesh    50000
Tamil Nadu        65000
West Bengal       40000
Name: Gehalt, dtyp: int64

Der obige Code gruppiert den Datensatz nach Spalte „Zustand“ und gibt das Durchschnittsalter in allen Bundesstaaten zurück. Kann klicken hier um mehr über groupby zu erfahren ().

11. Sicherung ()

verschmelzen () wird zum Zusammenführen verwendet 2 Pandas DataFrame-Objekte oder ein DataFrame und ein Series-Objekt in einer Spalte (Feld) gemeinsames. Wenn Sie mit dem Konzept der BEITRETEN und SQL, kombiniere eine dazu äquivalente Funktion. Gibt den kombinierten DataFrame zurück.

data_1.merge(Daten_2, on='Name', how='links')

Weitere Informationen zu Attributen wie on (inklusive left_on y right_on), wie und Suffixe, siehe die Dokumentation.

12. sort_values()

sort_values() wird verwendet, um die Spalte in einem Pandas-Datenrahmen zu sortieren (oder eine Serie Pandas) nach Werten in auf- oder absteigender Reihenfolge. Durch Angabe des Inplace-Attributs als True, Sie können direkt eine Änderung am ursprünglichen DataFrame vornehmen.

data_1.sort_values(by='Name', inplace=Wahr)

Produktion:

Name Alter Stadt Zustand Geburtsdatum Geschlecht Stadttemperatur Gehalt
0 Natur 29 Indore Madhya Pradesh 1991-11-20 Männlich 35,5 50000
2 Bimla 35 Rohtak Haryana 1985-09-01 Frau 39,7 20000
4 Chaman 32 Chennai Tamil Nadu 1988-12-03 Männlich 41,1 65000
6 Charu 29 Neu-Delhi Delhi 1992-03-18 Frau 39,0 52000
7 Ganesh 39 Patna Bihar 1981-07-12 Männlich Yaya 18000
3 Rahul 25 Kalkutta West Bengal 1995-09-19 Männlich 36,5 40000
1 Rohit 23 Neu-Delhi Delhi 1997-09-19 Männlich 39,0 85000
5 Vivek 38 Gurugram Haryana 1982-06-22 Männlich 38,9 35000

Sie können sehen, dass sich die Reihenfolge der Datensätze jetzt geändert hat. Datensätze werden jetzt in alphabetischer Reihenfolge der Namen aufgelistet. sort_values() hat viele andere Attribute, die angegeben werden können. Sie können darüber lesen hier.

Semejante a sort_values() es sort_index (). Wird verwendet, um den DataFrame nach Index anstelle eines Spaltenwerts zu sortieren.

13. Fillna ()

Wie gewöhnlich, in einem großen Datensatz, Sie finden mehrere Einträge mit der Bezeichnung NaN von Python. NaN bedeutet „es ist keine Zahl“ y steht für Einträge, die in der ursprünglichen Datenquelle nicht ausgefüllt wurden. Beim Ausfüllen der Werte im DataFrame, Pandas stellt sicher, dass der Benutzer diese Eingaben separat identifizieren kann.

Fillna () hilft, alle NaN-Werte in einem DataFrame oder einer Serie zu ersetzen, indem diese fehlenden Werte durch geeignetere Werte imputiert werden.

Daten_1['Stadttemperatur'].Fillna(38.5, inplace=Wahr)

Der obige Code ersetzt alle leeren Einträge in „Stadttemperatur“ mit 38.5. Fehlende Werte können mit dem Mittelwert unterstellt werden, das Median, Mode oder ein anderer Wert. Wir haben das Medium für unseren Fall gewählt.

EndNotes

In diesem Beitrag, wir schauen uns die an 13 Pandas wichtigste Funktionen und Methoden, die für Datenanalyse und Data Science wichtig sind. Dieser Beitrag wurde geschrieben von Vishesh Arora (LinkedIn).

Die in diesem Beitrag gezeigten Medien sind nicht Eigentum von DataPeaker und werden nach Ermessen des Autors verwendet.

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher