Esta postagem foi tornada pública como parte do Data Science Blogathon.
Introdução
Python é fácil de aprender, tem uma grande comunidade online de alunos e instrutores, e tem algumas bibliotecas centradas em dados verdadeiramente poderosas. Pandas é uma das bibliotecas Python mais importantes para análise e ciência de dados.
Neste post, nós veremos o 13 As funções e métodos mais importantes do Pandas que são essenciais para todos os analistas e cientistas de dados saberem.
1. read_csv ()
A função read_csv () ajuda a ler um arquivo de valores separados por vírgula (csv) em um Pandas DataFrame. Tudo o que você precisa fazer é mencionar o caminho do arquivo que deseja ler. Ele também pode ler arquivos separados por delimitadores diferentes de vírgulas, O que | ou guia. Mais detalhes aqui.
data_1 = pd.read_csv(r'C:UsersABCDesktopblog_dataset.csv')
Os dados foram lidos a partir do Fonte de dadosUMA "Fonte de dados" refere-se a qualquer lugar ou meio onde as informações podem ser obtidas. Essas fontes podem ser primárias e, como levantamentos e experimentos, como secundário, como bancos de dados, Artigos acadêmicos ou relatórios estatísticos. A escolha certa de uma fonte de dados é crucial para garantir a validade e confiabilidade das informações em pesquisa e análise.... em Pandas DataFrame. Você precisará alterar o caminho do arquivo que deseja ler. Você pode baixe o conjunto de dados usado no blog.
A função to_csv () funciona exatamente o oposto de read_csv (). Ajuda a gravar dados contidos no Pandas DataFrame ou Series para arquivo csv. Você pode ler mais sobre to_csv () aqui. read_csv () y to_csv () eles são uma das funções mais usadas no Pandas porque são usados ao ler dados de uma fonte de dados, e é muito importante conhecê-los.
2. cabeça ()
cabeça (n) usado para retornar as primeiras n linhas de um conjunto de dados. Por padrão, df.head () retornará o primeiro 5 linhas do DataFrame. Se você quiser mais / menos número de linhas, você pode especificar n como um inteiro.
data_1.head(6)
Produção:
| Nome | Idade | Cidade | Estado | DOB | Gênero | Temperatura da cidade | Salário | |
|---|---|---|---|---|---|---|---|---|
| 0 | Natureza | 29 | Indore | Madhya Pradesh | 20-11-1991 | Masculino | 35,5 | 50000 |
| 1 | Rohit | 23 | Nova Deli | Délhi | 19-09-1997 | Masculino | 39,0 | 85000 |
| 2 | Bimla | 35 | Rohtak | Haryana | 09-01-1985 | Mulher | 39,7 | 20000 |
| 3 | Rahul | 25 | Calcutá | bengala oeste | 19-09-1995 | Masculino | 36,5 | 40000 |
| 4 | Chaman | 32 | Chennai | Tamil Nadu | 12-03-1988 | Masculino | 41,1 | 65000 |
| 5 | Vivek | 38 | Gurugram | Haryana | 22-06-1982 | Masculino | 38,9 | 35000 |
As primeiras 6 filas (indexado de 0 uma 5) são retornados como saída de acordo com as expectativas.
cauda () é equivalente a cabeça () e retorna as n linhas inferiores de um conjunto de dados. cabeça () cauda () ajudá-lo a dar uma olhada rápida em seu conjunto de dados e verificar se os dados foram lidos corretamente a partir do DataFrame.
3. descrever ()
descrever () é usado para gerar estatísticas descritivas dos dados em um DataFrame ou Série Pandas. Resuma a tendência central e a dispersão do conjunto de dados. descrever () ajuda a obter uma visão geral rápida do conjunto de dados. Mais detalhes podem ser encontrados em describe () aqui.
data_1.describe()
Produção:
| Idade | Temperatura da cidade | Salário | |
|---|---|---|---|
| contar | 9.000000 | 8.000000 | 9.000000 |
| significar | 32.000000 | 38.575000 | 44444.444444 |
| std | 5.894913 | 1.771803 | 21360.659582 |
| min | 23.000000 | 35.500000 | 18000.000000 |
| 25% | 29.000000 | 38.300000 | 35000.000000 |
| 50% | 32.000000 | 38.950000 | 40000.000000 |
| 75% | 38.000000 | 39.175000 | 52000.000000 |
| max | 39.000000 | 41.100000 | 85000.000000 |
descrever () lista diferentes medidas estatísticas descritivas para todas as colunas numéricas em nosso conjunto de dados. Ao atribuir ao atributo de inclusão o valor 'all', podemos obter a descrição para incluir todas as colunas, incluindo aqueles que contêm informações categóricas.
4. memory_use ()
uso de memória () retorna uma string Pandas que tem o uso de memória de cada coluna (e bytes) em um Pandas DataFrame. Especificando o atributo deep como True, podemos saber o espaço real que cada coluna ocupa. Mais detalhes sobre memory_usage podem ser encontrados () aqui.
data_1.memory_usage(deep = True)
Produção:
Índice 80 Nome 559 Era 72 Cidade 578 Estado 584 DOB 603 Gênero 553 Temperatura da cidade 72 Salário 72 tipo d: int64
O uso de memória de cada coluna foi gerado em uma série Pandas. É essencial saber o uso de memória de um DataFrame, para que possa resolver erros como MemoryError em Python.
5. astype ()
astype () é usado para converter um objeto Python em um tipo de dados específico. Pode ser um recurso muito útil caso seus dados não sejam armazenados no formato correto (tipo de dados). Como um exemplo, se python de alguma forma interpretou mal números de ponto flutuante como strings, você pode convertê-los de volta para números de ponto flutuante com astype (). Ou se você deseja converter um tipo de dados de objeto em uma categoria, você pode usar astype ().
data_1['Sexo'] = data_1.Gender.astype('category')
Você pode verificar a mudança do tipo de dados observando os tipos de dados de todas as colunas no conjunto de dados usando o atributo dtypes. Para ver a documentação do astype (), Clique em aqui.
6. Lugar, colocar[:]
Lugar, colocar[:] ajuda a inserir um grupo de linhas e colunas em um conjunto de dados, uma parte do conjunto de dados, de acordo com nossa exigência. Como um exemplo, se quisermos apenas o último 2 linhas e o primeiro 3 colunas de um conjunto de dados, podemos inseri-los com a ajuda de loc[:]. Também podemos inserir linhas e colunas suportadas por rótulos em vez de linhas e números de coluna.
data_1.loc[0:4, ['Nome', 'Age', 'State']]
Produção:
| Nome | Idade | Estado | |
|---|---|---|---|
| 0 | Natureza | 29 | Madhya Pradesh |
| 1 | Rohit | 23 | Délhi |
| 2 | Bimla | 35 | Haryana |
| 3 | Rahul | 25 | bengala oeste |
| 4 | Chaman | 32 | Tamil Nadu |
O código acima irá retornar as colunas “Nome”, “Era” e “Estado” pela primeira vez 5 registros de clientes. Observe que o índiceo "Índice" É uma ferramenta fundamental em livros e documentos, que permite localizar rapidamente as informações desejadas. Geralmente, é apresentado no início de um trabalho e organiza os conteúdos de forma hierárquica, incluindo capítulos e seções. Sua correta preparação facilita a navegação e melhora a compreensão do material, tornando-se um recurso essencial para estudantes e profissionais de várias áreas.... começa de 0 e Python, e daí[:] isto é inclusivo em ambos os valores mencionados. Então 0: 4 significará índices de 0 uma 4, ambos incluidos.
Lugar, colocar[:] é uma das funções mais poderosas do Pandas, e é essencial para todos os analistas e cientistas de dados. Você pode encontrar a documentação para loc[:] aqui.
iloc[:] funciona de forma equivalente, apenas aquele iloc[:] isto é não inclusivo em ambos os valores. Tan iloc[0:4] retornaria linhas com índice 0, 1, 2 e 3, enquanto loc[0:4] retornaria linhas com índice 0, 1, 2, 3 e 4. Documentação para iloc[:] Pode ser encontrado aqui.
7. to_datetime ()
to_datetime () converter um objeto Python para o formato datetime. Pode levar um inteiro, um número de ponto flutuante, uma lista, Pandas Series o Pandas DataFrame como argumento. to_datetime () é muito poderoso quando o conjunto de dados tem séries temporais ou valores de data.
data_1['DOB'] = pd.to_datetime(data_1['DOB'])
A coluna DOB agora foi alterada para o formato de data e hora do Pandas. Todo Funções de dataAs funções de data são ferramentas essenciais na programação e análise de dados. Permite manipulação, Calcule e formate datas com eficiência. Entre suas aplicações mais comuns estão o cálculo da diferença entre datas, a extração de componentes como o ano ou mês, e conversão entre diferentes formatos. Essas funções são críticas em áreas como gerenciamento de projetos, relatórios financeiros e análises estatísticas.... e o tempo agora pode ser aplicado nesta coluna. Você pode ler mais sobre to_datetime () aqui.
8. valor_contas ()
valor_contas () retorna uma string Pandas contendo as contagens de valores únicos. Considere um conjunto de dados que contém informações do cliente sobre 5,000 clientes de uma empresa. valor_contas () nos ajudará a identificar o número de ocorrências de cada valor único em uma série. Pode ser aplicado a colunas contendo dados como Status, Indústria de emprego ou idade dos clientes.
data_1['State'].valor_contas()
Produção:
Haryana 3 Délhi 2 Bengala Ocidental 1 Tamil Nadu 1 Bihar 1 Madhya Pradesh 1 Nome: Estado, tipo d: int64
O número de ocorrências de cada estado em nosso conjunto de dados foi retornado na saída, como esperado. valor_contas () também pode ser usado para traçar gráficos de barras de dados categóricos e ordinais.
data_1['State'].valor_contas(normalize = True).enredo(kind='bar', título ="Estado")
A documentação para value_counts () pode ser encontrado aqui.
9. drop_duplicates ()
drop_duplicates () retorna um Pandas DataFrame com linhas duplicadas removidas. Mesmo entre duplicatas, existe a opção de manter a primeira ocorrência (Cadastro) da duplicata ou da última. Você também pode especificar os atributos inplace e ignore_index.
data_1.drop_duplicates(inplace = True)
inplace = True garante que as alterações sejam aplicadas ao conjunto de dados original. Você pode verificar as mudanças observando a forma do conjunto de dados original e o conjunto de dados modificado (depois de excluir duplicatas). Você notará que o número de linhas foi reduzido de 9 uma 8 (porque foi removido 1 duplicado).
10. groupby ()
groupby () é usado para agrupar um DataFrame Pandas por 1 ou mais colunas e realizar alguma operação matemática nelas. groupby () pode ser usado para resumir dados de uma maneira simples.
data_1.groupby(by='State').Salary.mean()
Produção:
Estado Bihar 18000 Délhi 68500 Haryana 27500 Madhya Pradesh 50000 Tamil Nadu 65000 Bengala Ocidental 40000 Nome: Salário, tipo d: int64
O código acima irá agrupar o conjunto de dados por coluna “Estado” e ele retornará a idade média em todos os estados. Pode clicar aqui saber mais sobre groupby ().
11. fusível ()
fundir () é usado para fundir 2 Objetos Pandas DataFrame ou um DataFrame e um objeto Series em uma coluna (interior) comum. Se você está familiarizado com o conceito de JUNTE"JUNTE" é uma operação fundamental em bancos de dados que permite combinar registros de duas ou mais tabelas com base em uma relação lógica entre elas. Existem diferentes tipos de JOIN, como INNER JOIN, JUNÇÃO À ESQUERDA e JUNÇÃO DIREITA, cada um com suas próprias características e usos. Essa técnica é essencial para consultas complexas e informações mais relevantes e detalhadas de várias fontes de dados.... e SQL, combinar uma função equivalente àquela. Retorna o DataFrame combinado.
data_1.merge(data_2, on='Name', how='left')
Para obter mais informações sobre atributos como em (incluidos left_on y right_on), como e sufixos, Veja o documentação.
12. sort_values()
sort_values() usado para classificar a coluna em um quadro de dados do Pandas (ou uma série de Pandas) por valores em ordem crescente ou decrescente. Especificando o atributo inplace como True, você pode fazer uma alteração diretamente no DataFrame original.
data_1.sort_values(by='Name', inplace = True)
Produção:
| Nome | Idade | Cidade | Estado | DOB | Gênero | Temperatura da cidade | Salário | |
|---|---|---|---|---|---|---|---|---|
| 0 | Natureza | 29 | Indore | Madhya Pradesh | 1991-11-20 | Masculino | 35,5 | 50000 |
| 2 | Bimla | 35 | Rohtak | Haryana | 1985-09-01 | Mulher | 39,7 | 20000 |
| 4 | Chaman | 32 | Chennai | Tamil Nadu | 1988-12-03 | Masculino | 41,1 | 65000 |
| 6 | Charu | 29 | Nova Deli | Délhi | 1992-03-18 | Mulher | 39,0 | 52000 |
| 7 | Ganesh | 39 | Patna | Bihar | 1981-07-12 | Masculino | Yaya | 18000 |
| 3 | Rahul | 25 | Calcutá | bengala oeste | 1995-09-19 | Masculino | 36,5 | 40000 |
| 1 | Rohit | 23 | Nova Deli | Délhi | 1997-09-19 | Masculino | 39,0 | 85000 |
| 5 | Vivek | 38 | Gurugram | Haryana | 1982-06-22 | Masculino | 38,9 | 35000 |
Você pode ver que a ordem dos registros mudou agora. Os registros agora estão listados em ordem alfabética de nomes. sort_values() tem muitos outros atributos que podem ser especificados. Você pode ler sobre isso aqui.
Semejante a sort_values() es sort_index (). Usado para classificar o DataFrame por índice em vez de um valor de coluna.
13. Fillna ()
Em geral, em um grande conjunto de dados, você encontrará várias entradas rotuladas NaN por Python. NaN significa “não é um número” y representa entradas que não foram concluídas na fonte de dados original. Ao preencher os valores no DataFrame, O Pandas garante que o usuário possa identificar essas entradas separadamente.
Fillna () ajuda a substituir todos os valores NaN em um DataFrame ou Series, imputando esses valores ausentes com valores mais apropriados.
data_1['City temp'].Fillna(38.5, inplace = True)
O código acima irá substituir todas as entradas em branco em “temperatura da cidade” com 38.5. Valores ausentes podem ser imputados com a média, a medianaA mediana é uma medida estatística que representa o valor central de um conjunto de dados ordenados. Para calculá-lo, Os dados são organizados do menor para o maior e o número no meio é identificado. Se houver um número par de observações, Os dois valores principais são calculados em média. Este indicador é especialmente útil em distribuições assimétricas, uma vez que não é afetado por valores extremos...., moda ou algum outro valor. Nós escolhemos o meio para o nosso caso.
Notas finais
Neste post, nós damos uma olhada no 13 Funções e métodos mais importantes do Pandas que são importantes para análise de dados e ciência de dados. Esta postagem foi escrita por Vishesh Arora (LinkedIn).
A mídia mostrada nesta postagem não é propriedade da DataPeaker e é usada a critério do autor.



