Questo post è stato reso pubblico come parte del Blogathon sulla scienza dei dati.
introduzione
Python è facile da imparare, ha una vasta comunità online di studenti e istruttori, e ha alcune librerie incentrate sui dati davvero potenti. panda è una delle librerie Python più importanti per l'analisi dei dati e la scienza dei dati.
In questo post, vedremo il 13 Funzioni e metodi più importanti di Panda che sono essenziali per tutti gli analisti e gli scienziati dei dati da conoscere.
1. read_csv ()
La funzione read_csv () aiuta a leggere un file di valori separati da virgole (csv) in un DataFrame Panda. Tutto quello che devi fare è menzionare il percorso del file che vuoi che legga. Può anche leggere file separati da delimitatori diversi da virgole, Che cosa | o tab. Più dettagli qui.
data_1 = pd.read_csv(r'C:UsersABCDesktopblog_dataset.csv')
I dati sono stati letti dal Origine datiUN "Origine dati" si riferisce a qualsiasi luogo o supporto in cui è possibile ottenere informazioni. Queste fonti possono essere sia primarie che, come sondaggi ed esperimenti, come secondario, come banche dati, articoli accademici o rapporti statistici. La scelta corretta di una fonte di dati è fondamentale per garantire la validità e l'affidabilità delle informazioni nella ricerca e nell'analisi.... in Pandas DataFrame. Dovrai cambiare il percorso del file che vuoi leggere. Puoi scarica il set di dati usato nel blog.
La funzione to_csv () funziona esattamente l'opposto di read_csv (). Aiuta a scrivere i dati contenuti in Pandas DataFrame o Series in un file CSV. Puoi leggere di più su to_csv () qui. read_csv () y to_csv () sono una delle funzioni più utilizzate in Panda perché vengono utilizzate durante la lettura dei dati da un'origine dati, ed è molto importante conoscerli.
2. testa ()
testa (n) usato per restituire le prime n righe di un set di dati. Per impostazione predefinita, df.head () restituirà il primo 5 righe del DataFrame. Se vuoi di più / meno numero di righe, puoi specificare n come numero intero.
data_1.head(6)
Produzione:
| Nome | Età | Cittadina | Stato | DOB | Genere | Temperatura della città | Stipendio | |
|---|---|---|---|---|---|---|---|---|
| 0 | Natura | 29 | Indore | Madhya Pradesh | 20-11-1991 | Maschile | 35,5 | 50000 |
| 1 | Rohit | 23 | Nuova Delhi | Delhi | 19-09-1997 | Maschile | 39,0 | 85000 |
| 2 | Bimla | 35 | Rohtak | Haryana | 09-01-1985 | Donna | 39,7 | 20000 |
| 3 | Rahul | 25 | Calcutta | Bengala occidentale | 19-09-1995 | Maschile | 36,5 | 40000 |
| 4 | Chaman | 32 | Chennai | Tamil Nadu | 12-03-1988 | Maschile | 41,1 | 65000 |
| 5 | Vivek | 38 | Gurugram | Haryana | 22-06-1982 | Maschile | 38,9 | 35000 |
Il primo 6 righe (indicizzato da 0 un 5) vengono restituiti come output secondo le aspettative.
coda () è equivalente a testa () e restituisce le ultime n righe di un set di dati. testa () y coda () aiutarti a dare una rapida occhiata al tuo set di dati e verificare se i dati sono stati letti correttamente dal DataFrame.
3. descrivere ()
descrivere () viene utilizzato per generare statistiche descrittive dei dati in una serie DataFrame o Pandas. Riassumere la tendenza centrale e la dispersione del set di dati. descrivere () aiuta a ottenere una rapida panoramica del set di dati. Maggiori dettagli possono essere trovati su description () qui.
data_1.descrivi()
Produzione:
| Età | Temperatura della città | Stipendio | |
|---|---|---|---|
| raccontare | 9.000000 | 8.000000 | 9.000000 |
| significare | 32.000000 | 38.575000 | 44444.444444 |
| standard | 5.894913 | 1.771803 | 21360.659582 |
| min | 23.000000 | 35.500000 | 18000.000000 |
| 25% | 29.000000 | 38.300000 | 35000.000000 |
| 50% | 32.000000 | 38.950000 | 40000.000000 |
| 75% | 38.000000 | 39.175000 | 52000.000000 |
| max | 39.000000 | 41.100000 | 85000.000000 |
descrivere () elenca diverse misure statistiche descrittive per tutte le colonne numeriche nel nostro set di dati. Assegnando all'attributo di inclusione il valore 'all', possiamo ottenere la descrizione per includere tutte le colonne, compresi quelli contenenti informazioni categoriche.
4. memory_use ()
utilizzo della memoria () restituisce una stringa Pandas che ha l'utilizzo della memoria di ogni colonna (e byte) in un DataFrame Panda. Specificando l'attributo deep come True, possiamo conoscere lo spazio reale che occupa ogni colonna. Maggiori dettagli su memory_usage possono essere trovati () qui.
data_1.memory_usage(profondo=vero)
Produzione:
Indice 80 Nome 559 Età 72 Città 578 Stato 584 DOB 603 Genere 553 Temp. città 72 Stipendio 72 dtype: int64
L'utilizzo della memoria di ogni colonna è stato emesso in una serie Pandas. È essenziale conoscere l'utilizzo della memoria di un DataFrame, in modo che possa affrontare errori come MemoryError in Python.
5. come tipo ()
come tipo () è usato per convertire un oggetto Python in un particolare tipo di dati. Può essere una funzione molto utile nel caso in cui i tuoi dati non siano archiviati nel formato corretto (tipo di dati). Come esempio, se Python ha in qualche modo interpretato erroneamente i numeri in virgola mobile come stringhe, puoi riconvertirli in numeri in virgola mobile con astype (). O se vuoi convertire un tipo di dati oggetto in una categoria, puoi usare astype ().
dati_1['Genere'] = data_1.Gender.astype('category')
Puoi controllare la modifica del tipo di dati guardando i tipi di dati di tutte le colonne nel set di dati usando l'attributo dtypes. Per visualizzare la documentazione di astype (), clicca su qui.
6. luogo[:]
luogo[:] aiuta a inserire un gruppo di righe e colonne in un set di dati, una parte del set di dati, secondo il nostro requisito. Come esempio, se vogliamo solo l'ultimo 2 righe e la prima 3 colonne di un set di dati, possiamo inserirli con l'aiuto di loc[:]. Possiamo anche inserire righe e colonne supportate da etichette invece di righe e numeri di colonna.
data_1.loc[0:4, ['Name', 'Età', 'State']]
Produzione:
| Nome | Età | Stato | |
|---|---|---|---|
| 0 | Natura | 29 | Madhya Pradesh |
| 1 | Rohit | 23 | Delhi |
| 2 | Bimla | 35 | Haryana |
| 3 | Rahul | 25 | Bengala occidentale |
| 4 | Chaman | 32 | Tamil Nadu |
Il codice sopra restituirà le colonne “Nome”, “Età” e “Stato” per la prima 5 record del cliente. Si prega di notare che il indiceIl "Indice" È uno strumento fondamentale nei libri e nei documenti, che consente di individuare rapidamente le informazioni desiderate. In genere, Viene presentato all'inizio di un'opera e organizza i contenuti in modo gerarchico, compresi capitoli e sezioni. La sua corretta preparazione facilita la navigazione e migliora la comprensione del materiale, rendendolo una risorsa essenziale sia per gli studenti che per i professionisti in vari settori.... inizia da 0 e Python, e allora[:] è inclusivo in entrambi i valori citati. Quindi 0: 4 significherà indici di 0 un 4, entrambi inclusi.
luogo[:] è una delle funzioni più potenti di Pandas, ed è un must per tutti gli analisti di dati e gli scienziati dei dati. Puoi trovare la documentazione per loc[:] qui.
iloca[:] funziona in modo equivalente, solo che iloc[:] è non inclusivo in entrambi i valori. Tan iloc[0:4] restituirebbe righe con indice 0, 1, 2 e 3, mentre loc[0:4] restituirebbe righe con indice 0, 1, 2, 3 e 4. Documentazione per iloc[:] Si può trovare qui.
7. to_datetime ()
to_datetime () converti un oggetto Python in formato datetime. Può prendere un numero intero, un numero in virgola mobile, una lista, Pandas Series o Pandas DataFrame come argomento. to_datetime () è molto potente quando il set di dati ha serie temporali o valori di data.
dati_1['DOB'] = pd.to_datetime(dati_1['DOB'])
La colonna DOB è stata ora modificata nel formato dell'ora dei dati di Pandas. Tutto Funzioni di dataLe funzioni di data sono strumenti essenziali nella programmazione e nell'analisi dei dati. Consente la manipolazione, Calcola e formatta le date in modo efficiente. Tra le sue applicazioni più comuni ci sono il calcolo della differenza tra le date, l'estrazione di componenti come l'anno o il mese, e conversione tra diversi formati. Queste funzioni sono fondamentali in aree come la gestione dei progetti, Reportistica finanziaria e analisi statistica.... e il tempo può ora essere applicato in questa colonna. Puoi leggere di più su to_datetime () qui.
8. value_counts ()
value_counts () restituisce una stringa Pandas contenente i conteggi di valori univoci. Considera un set di dati che contiene informazioni sui clienti su 5,000 clienti di un'azienda. value_counts () ci aiuterà a identificare il numero di occorrenze di ciascun valore univoco in una serie. Può essere applicato a colonne contenenti dati come Stato, Settore di occupazione o età dei clienti.
dati_1['State'].value_counts()
Produzione:
Haryana 3 Delhi 2 Bengala occidentale 1 Tamil Nadu 1 Bihar 1 Madhya Pradesh 1 Nome: Stato, dtype: int64
Il numero di occorrenze di ogni stato nel nostro set di dati è stato restituito nell'output, come previsto. value_counts () può anche essere usato per tracciare grafici a barre di dati categorici e ordinali.
dati_1['State'].value_counts(normalizzare=Vero).complotto(kind='bar', titolo="Stato")
La documentazione per value_counts () possono essere trovati qui.
9. drop_duplicates ()
drop_duplicates () restituisce un DataFrame Pandas con le righe duplicate rimosse. Anche tra i duplicati, c'è la possibilità di mantenere la prima occorrenza (Registrazione) del duplicato o dell'ultimo. Puoi anche specificare l'attributo inplace e ignore_index.
data_1.drop_duplicates(inplace=Vero)
inplace = True assicura che le modifiche vengano applicate al set di dati originale. Puoi verificare le modifiche osservando la forma del set di dati originale e il set di dati modificato (dopo aver eliminato i duplicati). Noterai che il numero di righe è stato ridotto da 9 un 8 (perché è stato rimosso 1 duplicare).
10. raggruppare per ()
raggruppare per () è usato per raggruppare un DataFrame Panda per 1 o più colonne ed eseguire alcune operazioni matematiche su di essa. raggruppare per () può essere utilizzato per riassumere i dati in modo semplice.
data_1.groupby(by='State').Salario.mean()
Produzione:
Stato Bihar 18000 Delhi 68500 Haryana 27500 Madhya Pradesh 50000 Tamil Nadu 65000 Bengala occidentale 40000 Nome: Stipendio, dtype: int64
Il codice sopra raggrupperà il set di dati per colonna “Stato” e restituirà l'età media in tutti gli stati. Può fare clic qui per saperne di più su groupby ().
11. fusibile ()
unire () è usato per unire 2 Oggetti Pandas DataFrame o un oggetto DataFrame e un oggetto Series in una colonna (campagna) Comune. Se hai familiarità con il concetto di ADERIRE"ADERIRE" è un'operazione fondamentale nei database che permette di combinare i record di due o più tabelle in base ad una relazione logica tra di esse. Esistono diversi tipi di JOIN, come INNER JOIN, LEFT JOIN e RIGHT JOIN, ognuno con le proprie caratteristiche e usi. Questa tecnica è essenziale per query complesse e informazioni più pertinenti e dettagliate provenienti da più fonti di dati.... e SQL, combinare una funzione equivalente a quella. Restituisce il DataFrame combinato.
data_1.merge(dati_2, on='Name', how='left')
Per ulteriori informazioni su attributi come on (incluidos left_on y right_on), come e suffissi, vedere il documentazione.
12. sort_values ()
sort_values () utilizzato per ordinare la colonna in un frame di dati Pandas (o una serie Panda) per valori in ordine crescente o decrescente. Specificando l'attributo inplace come True, puoi apportare una modifica direttamente al DataFrame originale.
data_1.sort_values(by='Name', inplace=Vero)
Produzione:
| Nome | Età | Cittadina | Stato | DOB | Genere | Temperatura della città | Stipendio | |
|---|---|---|---|---|---|---|---|---|
| 0 | Natura | 29 | Indore | Madhya Pradesh | 1991-11-20 | Maschile | 35,5 | 50000 |
| 2 | Bimla | 35 | Rohtak | Haryana | 1985-09-01 | Donna | 39,7 | 20000 |
| 4 | Chaman | 32 | Chennai | Tamil Nadu | 1988-12-03 | Maschile | 41,1 | 65000 |
| 6 | charu | 29 | Nuova Delhi | Delhi | 1992-03-18 | Donna | 39,0 | 52000 |
| 7 | Ganesh | 39 | Patna | Bihar | 1981-07-12 | Maschile | Yaya | 18000 |
| 3 | Rahul | 25 | Calcutta | Bengala occidentale | 1995-09-19 | Maschile | 36,5 | 40000 |
| 1 | Rohit | 23 | Nuova Delhi | Delhi | 1997-09-19 | Maschile | 39,0 | 85000 |
| 5 | Vivek | 38 | Gurugram | Haryana | 1982-06-22 | Maschile | 38,9 | 35000 |
Puoi vedere che l'ordine dei record è cambiato ora. I record sono ora elencati in ordine alfabetico dei nomi. sort_values () ha molti altri attributi che possono essere specificati. Puoi leggere su questo qui.
Semejante a sort_values () es sort_index (). Utilizzato per ordinare il DataFrame per indice anziché per valore di colonna.
13. riempire ()
Generalmente, in un grande set di dati, troverai più voci etichettate NaN da Python. NaN significa “non è un numero” y rappresenta le voci che non sono state completate nell'origine dati originale. Quando si compilano i valori nel DataFrame, Pandas si assicura che l'utente possa identificare questi input separatamente.
riempire () aiuta a sostituire tutti i valori NaN in un DataFrame o in una serie imputando questi valori mancanti con valori più appropriati.
dati_1['City temp'].riempire(38.5, inplace=Vero)
Il codice precedente sostituirà tutte le voci vuote in “temperatura della città” insieme a 38.5. I valori mancanti possono essere imputati con la media, il medianoLa mediana è una misura statistica che rappresenta il valore centrale di un insieme di dati ordinati. Per calcolarlo, I dati sono organizzati dal più basso al più alto e viene identificato il numero al centro. Se c'è un numero pari di osservazioni, I due valori fondamentali sono mediati. Questo indicatore è particolarmente utile nelle distribuzioni asimmetriche, poiché non è influenzato da valori estremi...., moda o qualche altro valore. Abbiamo scelto il mezzo per il nostro caso.
Note finali
In questo post, diamo un'occhiata al 13 Panda funzioni e metodi più importanti che sono importanti per l'analisi dei dati e la scienza dei dati. Questo post è stato scritto da Vishesh Arora (LinkedIn).
Il supporto mostrato in questo post non è di proprietà di DataPeaker e viene utilizzato a discrezione dell'autore.



