Il 13 le funzioni dei panda più importanti per la scienza dei dati

Contenuti

Questo post è stato reso pubblico come parte del Blogathon sulla scienza dei dati.

introduzione

Python è facile da imparare, ha una vasta comunità online di studenti e istruttori, e ha alcune librerie incentrate sui dati davvero potenti. panda è una delle librerie Python più importanti per l'analisi dei dati e la scienza dei dati.

Cambia la forma dei dati di Panda con Melt |  Codificatore

In questo post, vedremo il 13 Funzioni e metodi più importanti di Panda che sono essenziali per tutti gli analisti e gli scienziati dei dati da conoscere.

1. read_csv ()

La funzione read_csv () aiuta a leggere un file di valori separati da virgole (csv) in un DataFrame Panda. Tutto quello che devi fare è menzionare il percorso del file che vuoi che legga. Può anche leggere file separati da delimitatori diversi da virgole, Che cosa | o tab. Più dettagli qui.

data_1 = pd.read_csv(r'C:UsersABCDesktopblog_dataset.csv')

I dati sono stati letti dal Origine dati in Pandas DataFrame. Dovrai cambiare il percorso del file che vuoi leggere. Puoi scarica il set di dati usato nel blog.

La funzione to_csv () funziona esattamente l'opposto di read_csv (). Aiuta a scrivere i dati contenuti in Pandas DataFrame o Series in un file CSV. Puoi leggere di più su to_csv () qui. read_csv () y to_csv () sono una delle funzioni più utilizzate in Panda perché vengono utilizzate durante la lettura dei dati da un'origine dati, ed è molto importante conoscerli.

2. testa ()

testa (n) usato per restituire le prime n righe di un set di dati. Per impostazione predefinita, df.head () restituirà il primo 5 righe del DataFrame. Se vuoi di più / meno numero di righe, puoi specificare n come numero intero.

data_1.head(6)

Produzione:

Nome Età Cittadina Stato DOB Genere Temperatura della città Stipendio
0 Natura 29 Indore Madhya Pradesh 20-11-1991 Maschile 35,5 50000
1 Rohit 23 Nuova Delhi Delhi 19-09-1997 Maschile 39,0 85000
2 Bimla 35 Rohtak Haryana 09-01-1985 Donna 39,7 20000
3 Rahul 25 Calcutta Bengala occidentale 19-09-1995 Maschile 36,5 40000
4 Chaman 32 Chennai Tamil Nadu 12-03-1988 Maschile 41,1 65000
5 Vivek 38 Gurugram Haryana 22-06-1982 Maschile 38,9 35000

Il primo 6 righe (indicizzato da 0 un 5) vengono restituiti come output secondo le aspettative.

coda () è equivalente a testa () e restituisce le ultime n righe di un set di dati. testa () y coda () aiutarti a dare una rapida occhiata al tuo set di dati e verificare se i dati sono stati letti correttamente dal DataFrame.

3. descrivere ()

descrivere () viene utilizzato per generare statistiche descrittive dei dati in una serie DataFrame o Pandas. Riassumere la tendenza centrale e la dispersione del set di dati. descrivere () aiuta a ottenere una rapida panoramica del set di dati. Maggiori dettagli possono essere trovati su description () qui.

data_1.descrivi()

Produzione:

Età Temperatura della città Stipendio
raccontare 9.000000 8.000000 9.000000
significare 32.000000 38.575000 44444.444444
standard 5.894913 1.771803 21360.659582
min 23.000000 35.500000 18000.000000
25% 29.000000 38.300000 35000.000000
50% 32.000000 38.950000 40000.000000
75% 38.000000 39.175000 52000.000000
max 39.000000 41.100000 85000.000000

descrivere () elenca diverse misure statistiche descrittive per tutte le colonne numeriche nel nostro set di dati. Assegnando all'attributo di inclusione il valore 'all', possiamo ottenere la descrizione per includere tutte le colonne, compresi quelli contenenti informazioni categoriche.

4. memory_use ()

utilizzo della memoria () restituisce una stringa Pandas che ha l'utilizzo della memoria di ogni colonna (e byte) in un DataFrame Panda. Specificando l'attributo deep come True, possiamo conoscere lo spazio reale che occupa ogni colonna. Maggiori dettagli su memory_usage possono essere trovati () qui.

data_1.memory_usage(profondo=vero)

Produzione:

Indice         80
Nome         559
Età           72
Città         578
Stato        584
DOB          603
Genere       553
Temp. città     72
Stipendio        72
dtype: int64

L'utilizzo della memoria di ogni colonna è stato emesso in una serie Pandas. È essenziale conoscere l'utilizzo della memoria di un DataFrame, in modo che possa affrontare errori come MemoryError in Python.

5. come tipo ()

come tipo () è usato per convertire un oggetto Python in un particolare tipo di dati. Può essere una funzione molto utile nel caso in cui i tuoi dati non siano archiviati nel formato corretto (tipo di dati). Come esempio, se Python ha in qualche modo interpretato erroneamente i numeri in virgola mobile come stringhe, puoi riconvertirli in numeri in virgola mobile con astype (). O se vuoi convertire un tipo di dati oggetto in una categoria, puoi usare astype ().

dati_1['Genere'] = data_1.Gender.astype('category')

Puoi controllare la modifica del tipo di dati guardando i tipi di dati di tutte le colonne nel set di dati usando l'attributo dtypes. Per visualizzare la documentazione di astype (), clicca su qui.

6. luogo[:]

luogo[:] aiuta a inserire un gruppo di righe e colonne in un set di dati, una parte del set di dati, secondo il nostro requisito. Come esempio, se vogliamo solo l'ultimo 2 righe e la prima 3 colonne di un set di dati, possiamo inserirli con l'aiuto di loc[:]. Possiamo anche inserire righe e colonne supportate da etichette invece di righe e numeri di colonna.

data_1.loc[0:4, ['Name', 'Età', 'State']]

Produzione:

Nome Età Stato
0 Natura 29 Madhya Pradesh
1 Rohit 23 Delhi
2 Bimla 35 Haryana
3 Rahul 25 Bengala occidentale
4 Chaman 32 Tamil Nadu

Il codice sopra restituirà le colonne “Nome”, “Età” e “Stato” per la prima 5 record del cliente. Si prega di notare che il indice inizia da 0 e Python, e allora[:] è inclusivo in entrambi i valori citati. Quindi 0: 4 significherà indici di 0 un 4, entrambi inclusi.

luogo[:] è una delle funzioni più potenti di Pandas, ed è un must per tutti gli analisti di dati e gli scienziati dei dati. Puoi trovare la documentazione per loc[:] qui.

iloca[:] funziona in modo equivalente, solo che iloc[:] è non inclusivo in entrambi i valori. Tan iloc[0:4] restituirebbe righe con indice 0, 1, 2 e 3, mentre loc[0:4] restituirebbe righe con indice 0, 1, 2, 3 e 4. Documentazione per iloc[:] Si può trovare qui.

7. to_datetime ()

to_datetime () converti un oggetto Python in formato datetime. Può prendere un numero intero, un numero in virgola mobile, una lista, Pandas Series o Pandas DataFrame come argomento. to_datetime () è molto potente quando il set di dati ha serie temporali o valori di data.

dati_1['DOB'] = pd.to_datetime(dati_1['DOB'])

La colonna DOB è stata ora modificata nel formato dell'ora dei dati di Pandas. Tutto Funzioni di data e il tempo può ora essere applicato in questa colonna. Puoi leggere di più su to_datetime () qui.

8. value_counts ()

value_counts () restituisce una stringa Pandas contenente i conteggi di valori univoci. Considera un set di dati che contiene informazioni sui clienti su 5,000 clienti di un'azienda. value_counts () ci aiuterà a identificare il numero di occorrenze di ciascun valore univoco in una serie. Può essere applicato a colonne contenenti dati come Stato, Settore di occupazione o età dei clienti.

dati_1['State'].value_counts()

Produzione:

Haryana           3
Delhi             2
Bengala occidentale       1
Tamil Nadu        1
Bihar             1
Madhya Pradesh    1
Nome: Stato, dtype: int64

Il numero di occorrenze di ogni stato nel nostro set di dati è stato restituito nell'output, come previsto. value_counts () può anche essere usato per tracciare grafici a barre di dati categorici e ordinali.

dati_1['State'].value_counts(normalizzare=Vero).complotto(kind='bar', titolo="Stato")

La documentazione per value_counts () possono essere trovati qui.

9. drop_duplicates ()

drop_duplicates () restituisce un DataFrame Pandas con le righe duplicate rimosse. Anche tra i duplicati, c'è la possibilità di mantenere la prima occorrenza (Registrazione) del duplicato o dell'ultimo. Puoi anche specificare l'attributo inplace e ignore_index.

data_1.drop_duplicates(inplace=Vero)

inplace = True assicura che le modifiche vengano applicate al set di dati originale. Puoi verificare le modifiche osservando la forma del set di dati originale e il set di dati modificato (dopo aver eliminato i duplicati). Noterai che il numero di righe è stato ridotto da 9 un 8 (perché è stato rimosso 1 duplicare).

10. raggruppare per ()

raggruppare per () è usato per raggruppare un DataFrame Panda per 1 o più colonne ed eseguire alcune operazioni matematiche su di essa. raggruppare per () può essere utilizzato per riassumere i dati in modo semplice.

data_1.groupby(by='State').Salario.mean()

Produzione:

Stato
Bihar             18000
Delhi             68500
Haryana           27500
Madhya Pradesh    50000
Tamil Nadu        65000
Bengala occidentale       40000
Nome: Stipendio, dtype: int64

Il codice sopra raggrupperà il set di dati per colonna “Stato” e restituirà l'età media in tutti gli stati. Può fare clic qui per saperne di più su groupby ().

11. fusibile ()

unire () è usato per unire 2 Oggetti Pandas DataFrame o un oggetto DataFrame e un oggetto Series in una colonna (campagna) Comune. Se hai familiarità con il concetto di ADERIRE e SQL, combinare una funzione equivalente a quella. Restituisce il DataFrame combinato.

data_1.merge(dati_2, on='Name', how='left')

Per ulteriori informazioni su attributi come on (incluidos left_on y right_on), come e suffissi, vedere il documentazione.

12. sort_values ​​​​()

sort_values ​​​​() utilizzato per ordinare la colonna in un frame di dati Pandas (o una serie Panda) per valori in ordine crescente o decrescente. Specificando l'attributo inplace come True, puoi apportare una modifica direttamente al DataFrame originale.

data_1.sort_values(by='Name', inplace=Vero)

Produzione:

Nome Età Cittadina Stato DOB Genere Temperatura della città Stipendio
0 Natura 29 Indore Madhya Pradesh 1991-11-20 Maschile 35,5 50000
2 Bimla 35 Rohtak Haryana 1985-09-01 Donna 39,7 20000
4 Chaman 32 Chennai Tamil Nadu 1988-12-03 Maschile 41,1 65000
6 charu 29 Nuova Delhi Delhi 1992-03-18 Donna 39,0 52000
7 Ganesh 39 Patna Bihar 1981-07-12 Maschile Yaya 18000
3 Rahul 25 Calcutta Bengala occidentale 1995-09-19 Maschile 36,5 40000
1 Rohit 23 Nuova Delhi Delhi 1997-09-19 Maschile 39,0 85000
5 Vivek 38 Gurugram Haryana 1982-06-22 Maschile 38,9 35000

Puoi vedere che l'ordine dei record è cambiato ora. I record sono ora elencati in ordine alfabetico dei nomi. sort_values ​​​​() ha molti altri attributi che possono essere specificati. Puoi leggere su questo qui.

Semejante a sort_values ​​​​() es sort_index (). Utilizzato per ordinare il DataFrame per indice anziché per valore di colonna.

13. riempire ()

Generalmente, in un grande set di dati, troverai più voci etichettate NaN da Python. NaN significa “non è un numero” y rappresenta le voci che non sono state completate nell'origine dati originale. Quando si compilano i valori nel DataFrame, Pandas si assicura che l'utente possa identificare questi input separatamente.

riempire () aiuta a sostituire tutti i valori NaN in un DataFrame o in una serie imputando questi valori mancanti con valori più appropriati.

dati_1['City temp'].riempire(38.5, inplace=Vero)

Il codice precedente sostituirà tutte le voci vuote in “temperatura della città” insieme a 38.5. I valori mancanti possono essere imputati con la media, il mediano, moda o qualche altro valore. Abbiamo scelto il mezzo per il nostro caso.

Note finali

In questo post, diamo un'occhiata al 13 Panda funzioni e metodi più importanti che sono importanti per l'analisi dei dati e la scienza dei dati. Questo post è stato scritto da Vishesh Arora (LinkedIn).

Il supporto mostrato in questo post non è di proprietà di DataPeaker e viene utilizzato a discrezione dell'autore.

Iscriviti alla nostra Newsletter

Non ti invieremo posta SPAM. Lo odiamo quanto te.

Altoparlante dati