Ce message a été rendu public dans le cadre de la Blogathon sur la science des données.
introduction
Python est facile à apprendre, a une grande communauté en ligne d'étudiants et d'instructeurs, et possède des bibliothèques centrées sur les données vraiment puissantes. Pandas est l'une des bibliothèques Python les plus importantes pour l'analyse de données et la science des données.
Dans ce billet, nous verrons le 13 Fonctions et méthodes Pandas les plus importantes que tous les analystes et data scientists doivent connaître.
1. lire_csv ()
La fonction read_csv () aide à lire un fichier de valeurs séparées par des virgules (csv) dans un DataFrame Pandas. Tout ce que vous avez à faire est de mentionner le chemin du fichier que vous voulez qu'il lise. Il peut également lire des fichiers séparés par des délimiteurs autres que des virgules, Quoi | ou onglet. Plus de détails ici.
data_1 = pd.read_csv(r'C:UsersABCDesktopblog_dataset.csv')
Les données ont été lues depuis la Source des donnéesOngle "Source des données" désigne tout lieu ou support où des informations peuvent être obtenues. Ces sources peuvent être à la fois primaires et, tels que les enquêtes et les expériences, en tant que secondaire, comme bases de données, articles universitaires ou rapports statistiques. Le bon choix d’une source de données est crucial pour garantir la validité et la fiabilité des informations dans la recherche et l’analyse.... en Pandas DataFrame. Vous devrez changer le chemin du fichier que vous voulez lire. Vous pouvez télécharger le jeu de données utilisé dans le blog.
La fonction to_csv () fonctionne exactement à l'opposé de read_csv (). Aide à écrire les données contenues dans Pandas DataFrame ou Series dans un fichier csv. Vous pouvez en savoir plus sur to_csv () ici. lire_csv () y à_csv () elles sont l'une des fonctions les plus utilisées dans Pandas car elles sont utilisées lors de la lecture de données à partir d'une source de données, et il est très important de les connaître.
2. Tête ()
diriger (m) utilisé pour renvoyer les n premières lignes d'un ensemble de données. Par défaut, df.head () retournera le premier 5 lignes du DataFrame. Si tu veux plus / moins de lignes, vous pouvez spécifier n comme un entier.
data_1.head(6)
Production:
| nom | L'âge | Ville | État | Date de naissance | Genre | Température de la ville | Un salaire | |
|---|---|---|---|---|---|---|---|---|
| 0 | La nature | 29 | Indoré | Madhya Pradesh | 20-11-1991 | Masculin | 35,5 | 50000 |
| 1 | Rohit | 23 | New Delhi | Delhi | 19-09-1997 | Masculin | 39,0 | 85000 |
| 2 | Bimla | 35 | Rohtak | Haryana | 09-01-1985 | Femme | 39,7 | 20000 |
| 3 | Rahul | 25 | Calcutta | Bengale-Occidental | 19-09-1995 | Masculin | 36,5 | 40000 |
| 4 | Chaman | 32 | Chennai | Tamil Nadu | 12-03-1988 | Masculin | 41,1 | 65000 |
| 5 | Vivek | 38 | Gurugram | Haryana | 22-06-1982 | Masculin | 38,9 | 35000 |
Les premières 6 Lignes (indexé à partir de 0 une 5) sont retournés comme sortie selon les attentes.
queue () équivaut à la tête () et renvoie les n dernières lignes d'un ensemble de données. diriger () y queue () vous aider à jeter un rapide coup d'œil à votre ensemble de données et à vérifier si les données ont été lues correctement à partir du DataFrame.
3. décris ()
décris () est utilisé pour générer des statistiques descriptives des données dans un DataFrame ou une série Pandas. Résume la tendance centrale et la dispersion de l'ensemble de données. décris () aide à obtenir un aperçu rapide de l'ensemble de données. Plus de détails peuvent être trouvés sur décrire () ici.
data_1.description()
Production:
| L'âge | Température de la ville | Un salaire | |
|---|---|---|---|
| raconter | 9.000000 | 8.000000 | 9.000000 |
| vouloir dire | 32.000000 | 38.575000 | 44444.444444 |
| std | 5.894913 | 1.771803 | 21360.659582 |
| min | 23.000000 | 35.500000 | 18000.000000 |
| 25% | 29.000000 | 38.300000 | 35000.000000 |
| 50% | 32.000000 | 38.950000 | 40000.000000 |
| 75% | 38.000000 | 39.175000 | 52000.000000 |
| max | 39.000000 | 41.100000 | 85000.000000 |
décris () répertorie différentes mesures statistiques descriptives pour toutes les colonnes numériques de notre ensemble de données. Lors de l'attribution de la valeur à l'attribut d'inclusion ‘Tout le monde’, nous pouvons obtenir la description pour inclure toutes les colonnes, y compris ceux contenant des informations catégorielles.
4. utilisation_de_la_mémoire ()
utilisation de la mémoire () renvoie une chaîne Pandas qui a l'utilisation de la mémoire de chaque colonne (et octets) dans un DataFrame Pandas. En spécifiant l'attribut deep comme True, nous pouvons connaître l'espace réel que chaque colonne occupe. Plus de détails sur memory_usage peuvent être trouvés () ici.
data_1.memory_usage(profond=Vrai)
Production:
Indice 80 Nom 559 Âge 72 Ville 578 État 584 Date de naissance 603 Le genre 553 Température de la ville 72 Un salaire 72 dtype: int64
L'utilisation de la mémoire de chaque colonne a été sortie dans une série Pandas. Il est essentiel de connaître l'utilisation de la mémoire d'un DataFrame, afin qu'il puisse corriger des erreurs comme MemoryError en Python.
5. astype ()
astype () est utilisé pour convertir un objet Python en un type de données particulier. Cela peut être une fonctionnalité très utile au cas où vos données ne seraient pas stockées dans le bon format (type de données). Par exemple, si python a mal interprété les nombres à virgule flottante comme des chaînes, vous pouvez les reconvertir en nombres à virgule flottante avec astype (). Ou si vous souhaitez convertir un type de données d'objet en catégorie, vous pouvez utiliser astype ().
données_1['Gender'] = data_1.Sexe.astype('category')
Vous pouvez vérifier le changement de type de données en examinant les types de données de toutes les colonnes de l'ensemble de données à l'aide de l'attribut dtypes. Pour afficher la documentation astype (), cliquez sur ici.
6. endroit[:]
endroit[:] aide à saisir un groupe de lignes et de colonnes dans un ensemble de données, une partie de l'ensemble de données, selon notre exigence. Par exemple, si nous voulons seulement le dernier 2 rangées et le premier 3 colonnes d'un jeu de données, nous pouvons les saisir avec l'aide de loc[:]. Nous pouvons également saisir des lignes et des colonnes prises en charge par des étiquettes au lieu des numéros de lignes et de colonnes.
data_1.loc[0:4, ['Nom', 'Âge', 'State']]
Production:
| nom | L'âge | État | |
|---|---|---|---|
| 0 | La nature | 29 | Madhya Pradesh |
| 1 | Rohit | 23 | Delhi |
| 2 | Bimla | 35 | Haryana |
| 3 | Rahul | 25 | Bengale-Occidental |
| 4 | Chaman | 32 | Tamil Nadu |
Le code ci-dessus renverra les colonnes « nom », « Âge » Oui « État » pour le premier 5 dossiers clients. Veuillez noter que le indiceLe "Indice" C’est un outil fondamental dans les livres et les documents, qui vous permet de localiser rapidement les informations souhaitées. Généralement, Il est présenté au début d’une œuvre et organise les contenus de manière hiérarchique, y compris les chapitres et les sections. Sa préparation correcte facilite la navigation et améliore la compréhension du matériau, ce qui en fait une ressource incontournable tant pour les étudiants que pour les professionnels dans divers domaines.... commence à partir de 0 et Python, et alors[:] il est compris dans les deux valeurs mentionnées. Ensuite 0: 4 signifiera des indices de 0 une 4, les deux inclus.
endroit[:] est l'une des fonctions les plus puissantes de Pandas, et est un incontournable pour tous les analystes de données et scientifiques de données. Vous pouvez trouver la documentation pour loc[:] ici.
iloc[:] fonctionne de manière équivalente, juste cet iloc[:] il est non inclus dans les deux valeurs. Tan iloc[0:4] renverrait des lignes avec un index 0, 1, 2 Oui 3, tandis que loc[0:4] renverrait des lignes avec un index 0, 1, 2, 3 Oui 4. Documentation pour iloc[:] Il peut être trouvé ici.
7. to_datetime ()
to_datetime () convertir un objet python au format datetime. Peut prendre un entier, un nombre à virgule flottante, une liste, Pandas Series o Pandas DataFrame comme argument. to_datetime () il est très puissant lorsque l'ensemble de données a des séries temporelles ou des valeurs de date.
données_1['DOB'] = pd.to_datetime(données_1['DOB'])
La colonne DOB a maintenant été modifiée au format de l'heure des données Pandas. Toutes les fonctions de dateLes fonctions de date sont des outils essentiels en programmation et en analyse de données. Elles permettent de manipuler, de calculer et de formater les dates de manière efficace. Parmi leurs applications les plus courantes figurent le calcul de la différence entre les dates, l'extraction de composants tels que l'année ou le mois, et la conversion entre différents formats. Ces fonctions sont fondamentales dans des domaines tels que la gestion de projets, les rapports financiers et l'analyse statistique.... et l'heure actuelle peuvent maintenant être appliquées dans cette colonne. Vous pouvez en savoir plus sur to_datetime () ici.
8. value_counts ()
value_counts () renvoie une chaîne Pandas contenant le nombre de valeurs uniques. Considérons un ensemble de données qui contient des informations client sur 5,000 clients d'une entreprise. value_counts () nous aidera à identifier le nombre d'occurrences de chaque valeur unique dans une série. Peut être appliqué aux colonnes contenant des données telles que Status, Secteur d'emploi ou âge des clients.
données_1['State'].value_counts()
Production:
Haryana 3 Delhi 2 Bengale-Occidental 1 Tamil Nadu 1 Bihar 1 Madhya Pradesh 1 Nom: État, dtype: int64
Le nombre d'occurrences de chaque état dans notre ensemble de données a été renvoyé dans la sortie, comme prévu. value_counts () il peut également être utilisé pour tracer des graphiques à barres de données catégorielles et ordinales.
données_1['State'].value_counts(normaliser=Vrai).terrain(type='bar', titre="État")
La documentation pour value_counts () peut être trouvé ici.
9. drop_duplicates ()
drop_duplicates () renvoie un Pandas DataFrame avec les lignes en double supprimées. Même parmi les doublons, il y a la possibilité de garder la première occurrence (Inscription) du duplicata ou du dernier. Vous pouvez également spécifier les attributs inplace et ignore_index.
data_1.drop_duplicates(inplace=Vrai)
inplace = True garantit que les modifications sont appliquées à l'ensemble de données d'origine. Vous pouvez vérifier les changements en regardant la forme de l'ensemble de données d'origine et l'ensemble de données modifié (après suppression des doublons). Vous remarquerez que le nombre de lignes a été réduit de 9 une 8 (car il a été supprimé 1 dupliquer).
10. par groupe ()
par groupe () est utilisé pour regrouper un Pandas DataFrame par 1 ou plusieurs colonnes et effectuez une opération mathématique dessus. par groupe () peut être utilisé pour résumer les données de manière simple.
data_1.groupby(by='State').Salaire.moyen()
Production:
État Bihar 18000 Delhi 68500 Haryana 27500 Madhya Pradesh 50000 Tamil Nadu 65000 Bengale-Occidental 40000 Nom: Un salaire, dtype: int64
Le code ci-dessus regroupera l'ensemble de données par colonne « État » et renverra l'âge moyen dans tous les états. Peut cliquer ici en savoir plus sur groupby ().
11. fusible ()
fusionner () est utilisé pour fusionner 2 Objets DataFrame Pandas ou un DataFrame et un objet Series dans une colonne (Campagne) commun. Si vous êtes familier avec le concept de REJOINDRE"REJOINDRE" est une opération fondamentale dans les bases de données qui permet de combiner des enregistrements de deux tables ou plus en se basant sur une relation logique entre elles. Il existe différents types de JOIN, comme INNER JOIN, LEFT JOIN et RIGHT JOIN, chacun avec ses propres caractéristiques et usages. Cette technique est essentielle pour effectuer des requêtes complexes et obtenir des informations plus pertinentes et détaillées à partir de plusieurs sources de données.... et SQL, combiner une fonction équivalente à celle. Renvoie le DataFrame combiné.
data_1.merge(données_2, on='Nom', how='gauche')
Pour plus d'informations sur les attributs comme sur (inclus left_on y right_on), comment et suffixes, voir le Documentation.
12. sort_values()
sort_values() est utilisé pour trier la colonne dans un bloc de données Pandas (ou une série Pandas) par valeurs par ordre croissant ou décroissant. En spécifiant l'attribut inplace comme True, vous pouvez apporter une modification directement au DataFrame d'origine.
data_1.sort_values(by='Nom', inplace=Vrai)
Production:
| nom | L'âge | Ville | État | Date de naissance | Genre | Température de la ville | Un salaire | |
|---|---|---|---|---|---|---|---|---|
| 0 | La nature | 29 | Indoré | Madhya Pradesh | 1991-11-20 | Masculin | 35,5 | 50000 |
| 2 | Bimla | 35 | Rohtak | Haryana | 1985-09-01 | Femme | 39,7 | 20000 |
| 4 | Chaman | 32 | Chennai | Tamil Nadu | 1988-12-03 | Masculin | 41,1 | 65000 |
| 6 | Charu | 29 | New Delhi | Delhi | 1992-03-18 | Femme | 39,0 | 52000 |
| 7 | Ganesh | 39 | Patna | Bihar | 1981-07-12 | Masculin | Yaya | 18000 |
| 3 | Rahul | 25 | Calcutta | Bengale-Occidental | 1995-09-19 | Masculin | 36,5 | 40000 |
| 1 | Rohit | 23 | New Delhi | Delhi | 1997-09-19 | Masculin | 39,0 | 85000 |
| 5 | Vivek | 38 | Gurugram | Haryana | 1982-06-22 | Masculin | 38,9 | 35000 |
Vous pouvez voir que l'ordre des enregistrements a changé maintenant. Les enregistrements sont désormais classés par ordre alphabétique des noms. sort_values() a de nombreux autres attributs qui peuvent être spécifiés. Vous pouvez lire à ce sujet ici.
Semejante a sort_values () es tri_index (). Utilisé pour trier le DataFrame par index au lieu d'une valeur de colonne.
13. remplir ()
Comme d'habitude, dans un grand ensemble de données, vous trouverez plusieurs entrées étiquetées NaN par Python. NaN signifie « ce n'est pas un nombre » y représente les entrées qui n'ont pas été complétées dans la source de données d'origine. Lors du remplissage des valeurs dans le DataFrame, Pandas s'assure que l'utilisateur peut identifier ces entrées séparément.
remplir () aide à remplacer toutes les valeurs NaN dans un DataFrame ou une série en imputant ces valeurs manquantes avec des valeurs plus appropriées.
données_1['Température de la ville'].remplir(38.5, inplace=Vrai)
Le code ci-dessus remplacera toutes les entrées vides dans « température de la ville » avec 38.5. Les valeurs manquantes peuvent être imputées avec la moyenne, la médianLa médiane est une mesure statistique qui représente la valeur centrale d’un ensemble de données ordonnées. Pour le calculer, Les données sont organisées de la plus basse à la plus élevée et le numéro au milieu est identifié. S’il y a un nombre pair d’observations, La moyenne des deux valeurs fondamentales est calculée. Cet indicateur est particulièrement utile dans les distributions asymétriques, puisqu’il n’est pas affecté par les valeurs extrêmes...., la mode ou une autre valeur. Nous avons choisi le support pour notre cas.
Notes de fin
Dans ce billet, nous jetons un coup d'oeil à la 13 Pandas les fonctions et méthodes les plus importantes qui sont importantes pour l'analyse des données et la science des données. Cet article a été écrit par Vishesh Arora (LinkedIn).
Les médias présentés dans cet article ne sont pas la propriété de DataPeaker et sont utilisés à la discrétion de l'auteur.
En rapport
Articles Similaires:
- Rôles importants dans l'industrie de la science des données aujourd'hui
- Fonctions PySpark | 9 fonctions plus utiles pour PySpark DataFrame
- 13 exigences importantes d'un ordinateur portable pour les tâches de science des données
- Pandas loc contre iloc | loc vs iloc dans les pandas pour sélectionner les données



