Le 13 les fonctions pandas les plus importantes pour la science des données

Contenu

Ce message a été rendu public dans le cadre de la Blogathon sur la science des données.

introduction

Python est facile à apprendre, a une grande communauté en ligne d'étudiants et d'instructeurs, et possède des bibliothèques centrées sur les données vraiment puissantes. Pandas est l'une des bibliothèques Python les plus importantes pour l'analyse de données et la science des données.

Changer la forme des données Pandas avec Melt |  Codementeur

Dans ce billet, nous verrons le 13 Fonctions et méthodes Pandas les plus importantes que tous les analystes et data scientists doivent connaître.

1. lire_csv ()

La fonction read_csv () aide à lire un fichier de valeurs séparées par des virgules (csv) dans un DataFrame Pandas. Tout ce que vous avez à faire est de mentionner le chemin du fichier que vous voulez qu'il lise. Il peut également lire des fichiers séparés par des délimiteurs autres que des virgules, Quoi | ou onglet. Plus de détails ici.

data_1 = pd.read_csv(r'C:UsersABCDesktopblog_dataset.csv')

Les données ont été lues depuis la Source des données en Pandas DataFrame. Vous devrez changer le chemin du fichier que vous voulez lire. Vous pouvez télécharger le jeu de données utilisé dans le blog.

La fonction to_csv () fonctionne exactement à l'opposé de read_csv (). Aide à écrire les données contenues dans Pandas DataFrame ou Series dans un fichier csv. Vous pouvez en savoir plus sur to_csv () ici. lire_csv () y à_csv () elles sont l'une des fonctions les plus utilisées dans Pandas car elles sont utilisées lors de la lecture de données à partir d'une source de données, et il est très important de les connaître.

2. Tête ()

diriger (m) utilisé pour renvoyer les n premières lignes d'un ensemble de données. Par défaut, df.head () retournera le premier 5 lignes du DataFrame. Si tu veux plus / moins de lignes, vous pouvez spécifier n comme un entier.

data_1.head(6)

Production:

nom L'âge Ville État Date de naissance Genre Température de la ville Un salaire
0 La nature 29 Indoré Madhya Pradesh 20-11-1991 Masculin 35,5 50000
1 Rohit 23 New Delhi Delhi 19-09-1997 Masculin 39,0 85000
2 Bimla 35 Rohtak Haryana 09-01-1985 Femme 39,7 20000
3 Rahul 25 Calcutta Bengale-Occidental 19-09-1995 Masculin 36,5 40000
4 Chaman 32 Chennai Tamil Nadu 12-03-1988 Masculin 41,1 65000
5 Vivek 38 Gurugram Haryana 22-06-1982 Masculin 38,9 35000

Les premières 6 Lignes (indexé à partir de 0 une 5) sont retournés comme sortie selon les attentes.

queue () équivaut à la tête () et renvoie les n dernières lignes d'un ensemble de données. diriger () y queue () vous aider à jeter un rapide coup d'œil à votre ensemble de données et à vérifier si les données ont été lues correctement à partir du DataFrame.

3. décris ()

décris () est utilisé pour générer des statistiques descriptives des données dans un DataFrame ou une série Pandas. Résume la tendance centrale et la dispersion de l'ensemble de données. décris () aide à obtenir un aperçu rapide de l'ensemble de données. Plus de détails peuvent être trouvés sur décrire () ici.

data_1.description()

Production:

L'âge Température de la ville Un salaire
raconter 9.000000 8.000000 9.000000
vouloir dire 32.000000 38.575000 44444.444444
std 5.894913 1.771803 21360.659582
min 23.000000 35.500000 18000.000000
25% 29.000000 38.300000 35000.000000
50% 32.000000 38.950000 40000.000000
75% 38.000000 39.175000 52000.000000
max 39.000000 41.100000 85000.000000

décris () répertorie différentes mesures statistiques descriptives pour toutes les colonnes numériques de notre ensemble de données. Lors de l'attribution de la valeur à l'attribut d'inclusion ‘Tout le monde’, nous pouvons obtenir la description pour inclure toutes les colonnes, y compris ceux contenant des informations catégorielles.

4. utilisation_de_la_mémoire ()

utilisation de la mémoire () renvoie une chaîne Pandas qui a l'utilisation de la mémoire de chaque colonne (et octets) dans un DataFrame Pandas. En spécifiant l'attribut deep comme True, nous pouvons connaître l'espace réel que chaque colonne occupe. Plus de détails sur memory_usage peuvent être trouvés () ici.

data_1.memory_usage(profond=Vrai)

Production:

Indice         80
Nom         559
Âge           72
Ville         578
État        584
Date de naissance          603
Le genre       553
Température de la ville     72
Un salaire        72
dtype: int64

L'utilisation de la mémoire de chaque colonne a été sortie dans une série Pandas. Il est essentiel de connaître l'utilisation de la mémoire d'un DataFrame, afin qu'il puisse corriger des erreurs comme MemoryError en Python.

5. astype ()

astype () est utilisé pour convertir un objet Python en un type de données particulier. Cela peut être une fonctionnalité très utile au cas où vos données ne seraient pas stockées dans le bon format (type de données). Par exemple, si python a mal interprété les nombres à virgule flottante comme des chaînes, vous pouvez les reconvertir en nombres à virgule flottante avec astype (). Ou si vous souhaitez convertir un type de données d'objet en catégorie, vous pouvez utiliser astype ().

données_1['Gender'] = data_1.Sexe.astype('category')

Vous pouvez vérifier le changement de type de données en examinant les types de données de toutes les colonnes de l'ensemble de données à l'aide de l'attribut dtypes. Pour afficher la documentation astype (), cliquez sur ici.

6. endroit[:]

endroit[:] aide à saisir un groupe de lignes et de colonnes dans un ensemble de données, une partie de l'ensemble de données, selon notre exigence. Par exemple, si nous voulons seulement le dernier 2 rangées et le premier 3 colonnes d'un jeu de données, nous pouvons les saisir avec l'aide de loc[:]. Nous pouvons également saisir des lignes et des colonnes prises en charge par des étiquettes au lieu des numéros de lignes et de colonnes.

data_1.loc[0:4, ['Nom', 'Âge', 'State']]

Production:

nom L'âge État
0 La nature 29 Madhya Pradesh
1 Rohit 23 Delhi
2 Bimla 35 Haryana
3 Rahul 25 Bengale-Occidental
4 Chaman 32 Tamil Nadu

Le code ci-dessus renverra les colonnes « nom », « Âge » Oui « État » pour le premier 5 dossiers clients. Veuillez noter que le indice commence à partir de 0 et Python, et alors[:] il est compris dans les deux valeurs mentionnées. Ensuite 0: 4 signifiera des indices de 0 une 4, les deux inclus.

endroit[:] est l'une des fonctions les plus puissantes de Pandas, et est un incontournable pour tous les analystes de données et scientifiques de données. Vous pouvez trouver la documentation pour loc[:] ici.

iloc[:] fonctionne de manière équivalente, juste cet iloc[:] il est non inclus dans les deux valeurs. Tan iloc[0:4] renverrait des lignes avec un index 0, 1, 2 Oui 3, tandis que loc[0:4] renverrait des lignes avec un index 0, 1, 2, 3 Oui 4. Documentation pour iloc[:] Il peut être trouvé ici.

7. to_datetime ()

to_datetime () convertir un objet python au format datetime. Peut prendre un entier, un nombre à virgule flottante, une liste, Pandas Series o Pandas DataFrame comme argument. to_datetime () il est très puissant lorsque l'ensemble de données a des séries temporelles ou des valeurs de date.

données_1['DOB'] = pd.to_datetime(données_1['DOB'])

La colonne DOB a maintenant été modifiée au format de l'heure des données Pandas. Toutes les fonctions de date et l'heure actuelle peuvent maintenant être appliquées dans cette colonne. Vous pouvez en savoir plus sur to_datetime () ici.

8. value_counts ()

value_counts () renvoie une chaîne Pandas contenant le nombre de valeurs uniques. Considérons un ensemble de données qui contient des informations client sur 5,000 clients d'une entreprise. value_counts () nous aidera à identifier le nombre d'occurrences de chaque valeur unique dans une série. Peut être appliqué aux colonnes contenant des données telles que Status, Secteur d'emploi ou âge des clients.

données_1['State'].value_counts()

Production:

Haryana           3
Delhi             2
Bengale-Occidental       1
Tamil Nadu        1
Bihar             1
Madhya Pradesh    1
Nom: État, dtype: int64

Le nombre d'occurrences de chaque état dans notre ensemble de données a été renvoyé dans la sortie, comme prévu. value_counts () il peut également être utilisé pour tracer des graphiques à barres de données catégorielles et ordinales.

données_1['State'].value_counts(normaliser=Vrai).terrain(type='bar', titre="État")

La documentation pour value_counts () peut être trouvé ici.

9. drop_duplicates ()

drop_duplicates () renvoie un Pandas DataFrame avec les lignes en double supprimées. Même parmi les doublons, il y a la possibilité de garder la première occurrence (Inscription) du duplicata ou du dernier. Vous pouvez également spécifier les attributs inplace et ignore_index.

data_1.drop_duplicates(inplace=Vrai)

inplace = True garantit que les modifications sont appliquées à l'ensemble de données d'origine. Vous pouvez vérifier les changements en regardant la forme de l'ensemble de données d'origine et l'ensemble de données modifié (après suppression des doublons). Vous remarquerez que le nombre de lignes a été réduit de 9 une 8 (car il a été supprimé 1 dupliquer).

10. par groupe ()

par groupe () est utilisé pour regrouper un Pandas DataFrame par 1 ou plusieurs colonnes et effectuez une opération mathématique dessus. par groupe () peut être utilisé pour résumer les données de manière simple.

data_1.groupby(by='State').Salaire.moyen()

Production:

État
Bihar             18000
Delhi             68500
Haryana           27500
Madhya Pradesh    50000
Tamil Nadu        65000
Bengale-Occidental       40000
Nom: Un salaire, dtype: int64

Le code ci-dessus regroupera l'ensemble de données par colonne « État » et renverra l'âge moyen dans tous les états. Peut cliquer ici en savoir plus sur groupby ().

11. fusible ()

fusionner () est utilisé pour fusionner 2 Objets DataFrame Pandas ou un DataFrame et un objet Series dans une colonne (Campagne) commun. Si vous êtes familier avec le concept de REJOINDRE et SQL, combiner une fonction équivalente à celle. Renvoie le DataFrame combiné.

data_1.merge(données_2, on='Nom', how='gauche')

Pour plus d'informations sur les attributs comme sur (inclus left_on y right_on), comment et suffixes, voir le Documentation.

12. sort_values()

sort_values() est utilisé pour trier la colonne dans un bloc de données Pandas (ou une série Pandas) par valeurs par ordre croissant ou décroissant. En spécifiant l'attribut inplace comme True, vous pouvez apporter une modification directement au DataFrame d'origine.

data_1.sort_values(by='Nom', inplace=Vrai)

Production:

nom L'âge Ville État Date de naissance Genre Température de la ville Un salaire
0 La nature 29 Indoré Madhya Pradesh 1991-11-20 Masculin 35,5 50000
2 Bimla 35 Rohtak Haryana 1985-09-01 Femme 39,7 20000
4 Chaman 32 Chennai Tamil Nadu 1988-12-03 Masculin 41,1 65000
6 Charu 29 New Delhi Delhi 1992-03-18 Femme 39,0 52000
7 Ganesh 39 Patna Bihar 1981-07-12 Masculin Yaya 18000
3 Rahul 25 Calcutta Bengale-Occidental 1995-09-19 Masculin 36,5 40000
1 Rohit 23 New Delhi Delhi 1997-09-19 Masculin 39,0 85000
5 Vivek 38 Gurugram Haryana 1982-06-22 Masculin 38,9 35000

Vous pouvez voir que l'ordre des enregistrements a changé maintenant. Les enregistrements sont désormais classés par ordre alphabétique des noms. sort_values() a de nombreux autres attributs qui peuvent être spécifiés. Vous pouvez lire à ce sujet ici.

Semejante a sort_values ​​​​() es tri_index (). Utilisé pour trier le DataFrame par index au lieu d'une valeur de colonne.

13. remplir ()

Comme d'habitude, dans un grand ensemble de données, vous trouverez plusieurs entrées étiquetées NaN par Python. NaN signifie « ce n'est pas un nombre » y représente les entrées qui n'ont pas été complétées dans la source de données d'origine. Lors du remplissage des valeurs dans le DataFrame, Pandas s'assure que l'utilisateur peut identifier ces entrées séparément.

remplir () aide à remplacer toutes les valeurs NaN dans un DataFrame ou une série en imputant ces valeurs manquantes avec des valeurs plus appropriées.

données_1['Température de la ville'].remplir(38.5, inplace=Vrai)

Le code ci-dessus remplacera toutes les entrées vides dans « température de la ville » avec 38.5. Les valeurs manquantes peuvent être imputées avec la moyenne, la médian, la mode ou une autre valeur. Nous avons choisi le support pour notre cas.

Notes de fin

Dans ce billet, nous jetons un coup d'oeil à la 13 Pandas les fonctions et méthodes les plus importantes qui sont importantes pour l'analyse des données et la science des données. Cet article a été écrit par Vishesh Arora (LinkedIn).

Les médias présentés dans cet article ne sont pas la propriété de DataPeaker et sont utilisés à la discrétion de l'auteur.

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données