As 13 As funções do pandas são mais importantes para a ciência de dados

Conteúdo

Esta postagem foi tornada pública como parte do Data Science Blogathon.

Introdução

Python é fácil de aprender, tem uma grande comunidade online de alunos e instrutores, e tem algumas bibliotecas centradas em dados verdadeiramente poderosas. Pandas é uma das bibliotecas Python mais importantes para análise e ciência de dados.

Mude a forma dos dados do Pandas com o Melt |  Codementador

Neste post, nós veremos o 13 As funções e métodos mais importantes do Pandas que são essenciais para todos os analistas e cientistas de dados saberem.

1. read_csv ()

A função read_csv () ajuda a ler um arquivo de valores separados por vírgula (csv) em um Pandas DataFrame. Tudo o que você precisa fazer é mencionar o caminho do arquivo que deseja ler. Ele também pode ler arquivos separados por delimitadores diferentes de vírgulas, O que | ou guia. Mais detalhes aqui.

data_1 = pd.read_csv(r'C:UsersABCDesktopblog_dataset.csv')

Os dados foram lidos a partir do Fonte de dados em Pandas DataFrame. Você precisará alterar o caminho do arquivo que deseja ler. Você pode baixe o conjunto de dados usado no blog.

A função to_csv () funciona exatamente o oposto de read_csv (). Ajuda a gravar dados contidos no Pandas DataFrame ou Series para arquivo csv. Você pode ler mais sobre to_csv () aqui. read_csv () y to_csv () eles são uma das funções mais usadas no Pandas porque são usados ​​ao ler dados de uma fonte de dados, e é muito importante conhecê-los.

2. cabeça ()

cabeça (n) usado para retornar as primeiras n linhas de um conjunto de dados. Por padrão, df.head () retornará o primeiro 5 linhas do DataFrame. Se você quiser mais / menos número de linhas, você pode especificar n como um inteiro.

data_1.head(6)

Produção:

Nome Idade Cidade Estado DOB Gênero Temperatura da cidade Salário
0 Natureza 29 Indore Madhya Pradesh 20-11-1991 Masculino 35,5 50000
1 Rohit 23 Nova Deli Délhi 19-09-1997 Masculino 39,0 85000
2 Bimla 35 Rohtak Haryana 09-01-1985 Mulher 39,7 20000
3 Rahul 25 Calcutá bengala oeste 19-09-1995 Masculino 36,5 40000
4 Chaman 32 Chennai Tamil Nadu 12-03-1988 Masculino 41,1 65000
5 Vivek 38 Gurugram Haryana 22-06-1982 Masculino 38,9 35000

As primeiras 6 filas (indexado de 0 uma 5) são retornados como saída de acordo com as expectativas.

cauda () é equivalente a cabeça () e retorna as n linhas inferiores de um conjunto de dados. cabeça () cauda () ajudá-lo a dar uma olhada rápida em seu conjunto de dados e verificar se os dados foram lidos corretamente a partir do DataFrame.

3. descrever ()

descrever () é usado para gerar estatísticas descritivas dos dados em um DataFrame ou Série Pandas. Resuma a tendência central e a dispersão do conjunto de dados. descrever () ajuda a obter uma visão geral rápida do conjunto de dados. Mais detalhes podem ser encontrados em describe () aqui.

data_1.describe()

Produção:

Idade Temperatura da cidade Salário
contar 9.000000 8.000000 9.000000
significar 32.000000 38.575000 44444.444444
std 5.894913 1.771803 21360.659582
min 23.000000 35.500000 18000.000000
25% 29.000000 38.300000 35000.000000
50% 32.000000 38.950000 40000.000000
75% 38.000000 39.175000 52000.000000
max 39.000000 41.100000 85000.000000

descrever () lista diferentes medidas estatísticas descritivas para todas as colunas numéricas em nosso conjunto de dados. Ao atribuir ao atributo de inclusão o valor 'all', podemos obter a descrição para incluir todas as colunas, incluindo aqueles que contêm informações categóricas.

4. memory_use ()

uso de memória () retorna uma string Pandas que tem o uso de memória de cada coluna (e bytes) em um Pandas DataFrame. Especificando o atributo deep como True, podemos saber o espaço real que cada coluna ocupa. Mais detalhes sobre memory_usage podem ser encontrados () aqui.

data_1.memory_usage(deep = True)

Produção:

Índice         80
Nome         559
Era           72
Cidade         578
Estado        584
DOB          603
Gênero       553
Temperatura da cidade     72
Salário        72
tipo d: int64

O uso de memória de cada coluna foi gerado em uma série Pandas. É essencial saber o uso de memória de um DataFrame, para que possa resolver erros como MemoryError em Python.

5. astype ()

astype () é usado para converter um objeto Python em um tipo de dados específico. Pode ser um recurso muito útil caso seus dados não sejam armazenados no formato correto (tipo de dados). Como um exemplo, se python de alguma forma interpretou mal números de ponto flutuante como strings, você pode convertê-los de volta para números de ponto flutuante com astype (). Ou se você deseja converter um tipo de dados de objeto em uma categoria, você pode usar astype ().

data_1['Sexo'] = data_1.Gender.astype('category')

Você pode verificar a mudança do tipo de dados observando os tipos de dados de todas as colunas no conjunto de dados usando o atributo dtypes. Para ver a documentação do astype (), Clique em aqui.

6. Lugar, colocar[:]

Lugar, colocar[:] ajuda a inserir um grupo de linhas e colunas em um conjunto de dados, uma parte do conjunto de dados, de acordo com nossa exigência. Como um exemplo, se quisermos apenas o último 2 linhas e o primeiro 3 colunas de um conjunto de dados, podemos inseri-los com a ajuda de loc[:]. Também podemos inserir linhas e colunas suportadas por rótulos em vez de linhas e números de coluna.

data_1.loc[0:4, ['Nome', 'Age', 'State']]

Produção:

Nome Idade Estado
0 Natureza 29 Madhya Pradesh
1 Rohit 23 Délhi
2 Bimla 35 Haryana
3 Rahul 25 bengala oeste
4 Chaman 32 Tamil Nadu

O código acima irá retornar as colunas “Nome”, “Era” e “Estado” pela primeira vez 5 registros de clientes. Observe que o índice começa de 0 e Python, e daí[:] isto é inclusivo em ambos os valores mencionados. Então 0: 4 significará índices de 0 uma 4, ambos incluidos.

Lugar, colocar[:] é uma das funções mais poderosas do Pandas, e é essencial para todos os analistas e cientistas de dados. Você pode encontrar a documentação para loc[:] aqui.

iloc[:] funciona de forma equivalente, apenas aquele iloc[:] isto é não inclusivo em ambos os valores. Tan iloc[0:4] retornaria linhas com índice 0, 1, 2 e 3, enquanto loc[0:4] retornaria linhas com índice 0, 1, 2, 3 e 4. Documentação para iloc[:] Pode ser encontrado aqui.

7. to_datetime ()

to_datetime () converter um objeto Python para o formato datetime. Pode levar um inteiro, um número de ponto flutuante, uma lista, Pandas Series o Pandas DataFrame como argumento. to_datetime () é muito poderoso quando o conjunto de dados tem séries temporais ou valores de data.

data_1['DOB'] = pd.to_datetime(data_1['DOB'])

A coluna DOB agora foi alterada para o formato de data e hora do Pandas. Todo Funções de data e o tempo agora pode ser aplicado nesta coluna. Você pode ler mais sobre to_datetime () aqui.

8. valor_contas ()

valor_contas () retorna uma string Pandas contendo as contagens de valores únicos. Considere um conjunto de dados que contém informações do cliente sobre 5,000 clientes de uma empresa. valor_contas () nos ajudará a identificar o número de ocorrências de cada valor único em uma série. Pode ser aplicado a colunas contendo dados como Status, Indústria de emprego ou idade dos clientes.

data_1['State'].valor_contas()

Produção:

Haryana           3
Délhi             2
Bengala Ocidental       1
Tamil Nadu        1
Bihar             1
Madhya Pradesh    1
Nome: Estado, tipo d: int64

O número de ocorrências de cada estado em nosso conjunto de dados foi retornado na saída, como esperado. valor_contas () também pode ser usado para traçar gráficos de barras de dados categóricos e ordinais.

data_1['State'].valor_contas(normalize = True).enredo(kind='bar', título ="Estado")

A documentação para value_counts () pode ser encontrado aqui.

9. drop_duplicates ()

drop_duplicates () retorna um Pandas DataFrame com linhas duplicadas removidas. Mesmo entre duplicatas, existe a opção de manter a primeira ocorrência (Cadastro) da duplicata ou da última. Você também pode especificar os atributos inplace e ignore_index.

data_1.drop_duplicates(inplace = True)

inplace = True garante que as alterações sejam aplicadas ao conjunto de dados original. Você pode verificar as mudanças observando a forma do conjunto de dados original e o conjunto de dados modificado (depois de excluir duplicatas). Você notará que o número de linhas foi reduzido de 9 uma 8 (porque foi removido 1 duplicado).

10. groupby ()

groupby () é usado para agrupar um DataFrame Pandas por 1 ou mais colunas e realizar alguma operação matemática nelas. groupby () pode ser usado para resumir dados de uma maneira simples.

data_1.groupby(by='State').Salary.mean()

Produção:

Estado
Bihar             18000
Délhi             68500
Haryana           27500
Madhya Pradesh    50000
Tamil Nadu        65000
Bengala Ocidental       40000
Nome: Salário, tipo d: int64

O código acima irá agrupar o conjunto de dados por coluna “Estado” e ele retornará a idade média em todos os estados. Pode clicar aqui saber mais sobre groupby ().

11. fusível ()

fundir () é usado para fundir 2 Objetos Pandas DataFrame ou um DataFrame e um objeto Series em uma coluna (interior) comum. Se você está familiarizado com o conceito de JUNTE e SQL, combinar uma função equivalente àquela. Retorna o DataFrame combinado.

data_1.merge(data_2, on='Name', how='left')

Para obter mais informações sobre atributos como em (incluidos left_on y right_on), como e sufixos, Veja o documentação.

12. sort_values()

sort_values() usado para classificar a coluna em um quadro de dados do Pandas (ou uma série de Pandas) por valores em ordem crescente ou decrescente. Especificando o atributo inplace como True, você pode fazer uma alteração diretamente no DataFrame original.

data_1.sort_values(by='Name', inplace = True)

Produção:

Nome Idade Cidade Estado DOB Gênero Temperatura da cidade Salário
0 Natureza 29 Indore Madhya Pradesh 1991-11-20 Masculino 35,5 50000
2 Bimla 35 Rohtak Haryana 1985-09-01 Mulher 39,7 20000
4 Chaman 32 Chennai Tamil Nadu 1988-12-03 Masculino 41,1 65000
6 Charu 29 Nova Deli Délhi 1992-03-18 Mulher 39,0 52000
7 Ganesh 39 Patna Bihar 1981-07-12 Masculino Yaya 18000
3 Rahul 25 Calcutá bengala oeste 1995-09-19 Masculino 36,5 40000
1 Rohit 23 Nova Deli Délhi 1997-09-19 Masculino 39,0 85000
5 Vivek 38 Gurugram Haryana 1982-06-22 Masculino 38,9 35000

Você pode ver que a ordem dos registros mudou agora. Os registros agora estão listados em ordem alfabética de nomes. sort_values() tem muitos outros atributos que podem ser especificados. Você pode ler sobre isso aqui.

Semejante a sort_values() es sort_index (). Usado para classificar o DataFrame por índice em vez de um valor de coluna.

13. Fillna ()

Em geral, em um grande conjunto de dados, você encontrará várias entradas rotuladas NaN por Python. NaN significa “não é um número” y representa entradas que não foram concluídas na fonte de dados original. Ao preencher os valores no DataFrame, O Pandas garante que o usuário possa identificar essas entradas separadamente.

Fillna () ajuda a substituir todos os valores NaN em um DataFrame ou Series, imputando esses valores ausentes com valores mais apropriados.

data_1['City temp'].Fillna(38.5, inplace = True)

O código acima irá substituir todas as entradas em branco em “temperatura da cidade” com 38.5. Valores ausentes podem ser imputados com a média, a mediana, moda ou algum outro valor. Nós escolhemos o meio para o nosso caso.

Notas finais

Neste post, nós damos uma olhada no 13 Funções e métodos mais importantes do Pandas que são importantes para análise de dados e ciência de dados. Esta postagem foi escrita por Vishesh Arora (LinkedIn).

A mídia mostrada nesta postagem não é propriedade da DataPeaker e é usada a critério do autor.

Assine a nossa newsletter

Nós não enviaremos SPAM para você. Nós odiamos isso tanto quanto você.

Datapeaker