Cadre de vérification de l'exactitude de vos ensembles de données

Contenu

Quand la journée touchait à sa fin, J'ai pensé à m'intégrer dans une autre réunion. Deux analystes de mon équipe travaillaient à la création d'un ensemble de données pour l'un des modèles prédictifs que nous voulions créer.. Expérience de travail combinée (dans les modèles prédictifs) parmi les analystes, c'était ~ 5 ans. J'espérais traverser la réunion et sortir pour la journée.

Ensuite, la réunion a commencé. Cinq minutes après la réunion et je savais que la réunion prendrait beaucoup plus de temps que je ne le pensais au départ !!

Le motif? Revoyons la discussion telle qu'elle s'est déroulée:

data_accuracy_image

Kunal: Combien de lignes avez-vous dans l'ensemble de données?

Analyste 1: (Après avoir examiné l'ensemble de données) X lignes

Kunal: Combien de lignes attends-tu?

Analyste 1 Oui 2: Regard vide sur leurs visages

Kunal: Combien d'événements / points de données attendus dans la période / chaque mois?

Analyste 1 Oui 2: …. (Aucun d'eux n'avait la moindre idée)

Le nombre de lignes dans l'ensemble de données m'a semblé plus élevé. Les analystes l'avaient clairement oublié, parce qu'ils ne l'ont pas comparé aux attentes commerciales (ou ils ne l'avaient pas en premier lieu). Lors de l'approfondissement, nous avons constaté que certains événements avaient plusieurs lignes dans les ensembles de données et, pour cela, un plus grand nombre de lignes.

Un pourcentage élevé d'analystes auraient vécu une expérience similaire à un moment donné de leur carrière..

Parfois, soit en raison de contraintes de temps ou pour une autre raison, nous oublions de faire des vérifications de base sur l'ensemble de données sur lequel nous travaillons. Malgré cela, négliger l'exactitude des données dans les premières étapes du projet peut être très coûteux et, pour cela, en général, il est important de souligner être paranoïaque quant à l'exactitude des données.

Comme d'habitude, Je suis un cadre simple pour vérifier l'exactitude des points de données. Dans ce billet, Je partagerai la procédure que j'utilise habituellement pour vérifier l'intégrité des données. Le cadre va de haut en bas, ce qui va bien. Si vous avez des erreurs évidentes dans vos ensembles de données, sera évident au début de la procédure.

Notez que le post restant suppose que vous travaillez sur un ensemble de données structuré. Pour les ensembles de données non structurés, même si les principes s'appliqueraient toujours, la procédure changerait.

steps_data_accuracy

Paso 1: vérifier le nombre de colonnes et de lignes avec les attentes

La première étape dès que vous obtenez un ensemble de données serait de vérifier si vous avez toutes les lignes et colonnes requises. Le nombre de colonnes serait dicté par le nombre d'hypothèses que vous avez et les variables que vous auriez besoin de tester / réfuter ces hypothèses.

D'autre part, le nombre de lignes serait dicté par le nombre d'événements attendus dans la période sélectionnée. La référence la plus simple serait basée sur votre compréhension de l'entreprise.

Paso 2: Vérifier les doublons au niveau de l'identification (et pas pour toute la rangée)

Une fois que vous êtes sûr que toutes les colonnes sont présentes et que le nombre de lignes se situe dans la plage attendue, vérifier rapidement les doublons à votre niveau d'identification (ou le niveau auquel les lignes doivent être uniques; peut être une combinaison de variables)

Paso 3: vérifier les colonnes vides, grand pourcentage de données vierges, % élevé des mêmes données

Maintenant que vous savez que toutes les colonnes sont là et qu'il n'y a pas de doublons, rechercher des colonnes complètement vides. Cela peut arriver en cas d'échec d'une jointure ou en cas d'erreur dans l'extraction de données. Si aucune des colonnes n'est vide, regardez le % de cas vides pour chaque colonne et les distributions de fréquence pour savoir si les mêmes données se répètent dans plus de cas que prévu.

Paso 4: observer la distribution dans les différents segments; vérifier la compréhension de l'entreprise et utiliser les tableaux croisés dynamiques

Cette étape continue là où elle se termine 3. Au lieu de regarder les fréquences des points de données individuellement, regarde tes distributions. Attendez-vous une distribution normale, bipolaire l'uniforme? La mise en page ressemble-t-elle à ce que vous attendiez?

Paso 5. Vérifier les valeurs aberrantes dans toutes les variables clés, surtout calculés

Une fois que les distributions semblent bonnes, rechercher des valeurs aberrantes. Surtout dans les cas où vous avez calculé des colonnes. Les valeurs d'Extreme sont-elles proches de ce que vous vouliez ?? Assurez-vous qu'il n'y a pas de divisions par zéro, vous avez limité les valeurs que vous voudriez.

Paso 6: vérifier si les valeurs de certains cas de test sont synchronisées

Une fois que vous avez vérifié toutes les colonnes individuellement, vérifier s'ils sont synchronisés les uns avec les autres. Vérifiez si les différentes dates des cas sont dans l'ordre chronologique (p. Pas., Faire les soldes, les dépenses et la limite de crédit sont synchronisées pour les clients de votre carte de crédit?

Paso 7: choisissez quelques lignes et vérifiez leurs valeurs sur les systèmes sous-jacents

Une fois toutes les étapes ci-dessus effectuées, il est temps de vérifier quelques échantillons en interrogeant les systèmes ou bases de données sous-jacents. S'il y avait une erreur dans les données, idéalement j'aurais déjà dû l'identifier. Cette étape garantit uniquement que les données sont telles qu'elles étaient sur les systèmes sous-jacents.

Veuillez noter que certaines de ces erreurs peuvent être détectées grâce à l'utilisation des journaux fournis par votre outil. L'examen général des journaux fournit de nombreuses informations sur les erreurs et les avertissements.

Ce sont les étapes que j'ai utilisées pour vérifier l'exactitude des données et, comme d'habitude, aidez-moi à détecter les erreurs évidentes dans les données. Apparemment, ils ne sont pas la solution à toutes les erreurs possibles, mais ils devraient vous donner un bon point de départ et une bonne direction. Que pensez-vous de ce cadre? Existe-t-il d'autres cadres / méthodes que vous utilisez pour vérifier l'exactitude des données? Le cas échéant, ajoutez-les dans les commentaires ci-dessous.

Si vous aimez ce que vous venez de lire et souhaitez continuer à apprendre sur l'analyse, abonnez-vous à nos e-mails ou comme le nôtre page le Facebook.

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données