Une grande partie des données que les institutions collectent seront utilisées pour orienter leur façon de faire des affaires. Qu'il s'agisse d'informations sur la façon dont les utilisateurs utilisent votre produit, les résultats collectés à partir des efforts de marketing ou des statistiques internes sur les processus de développement; est sur des actifs qui n'ont rien à voir avec données sombres.
Malgré cela, dans cet océan de données sans cesse croissant toutes les informations ne sont pas également rentables. Avec ces précieuses informations, de plus, une quantité de données est stockée qui n'a pas de réelle valeur tactique. et que, en même temps, n'arrête pas d'augmenter.
Gartner a défini ces informations non gérées comme des données obscures ou des données fournies. Ce type d'information représente une entreprise coûteuse et potentiellement risquée pour les institutions qui pourrait devenir un entrave à l'utilisation du Big Data.

Quelles données y a-t-il dans l'organisation?
Les informations disponibles dans l'organisation peuvent être classées en quatre catégories:
- Données connues et utilisées. Ces informations sont identifiées et utilisées à des fins d'analyse ou à toute autre fin qui ajoute de la valeur à l'organisation..
- Données connues mais non utilisées. Ces informations ont été stockées après avoir été identifiées dans les processus d'analyse, mais il n'est pas possible de l'utiliser, soit par manque de temps, budget ou l'ignorance de la façon d'y parvenir. Parfois la non-utilisation est due au fait que la taille et le format de ces données dépassent les possibilités de l'entreprise.
- Des données connues mais désorganisées. Ce phénomène a beaucoup à voir avec l'apparition du Big Data. Lorsque nous travaillons avec des structures Hadoop, nous avons tendance à stocker dans le désordre, reléguant ce travail et la modélisation à l'avenir. Mais le jour où l'on se concentre sur l'organisation de toutes ces informations, dans la majorité des cas, ne vient jamais. Même si la première étape est que ces données n'échappent pas, et sa collection est un succès; L'effort ne paie pas, car cela coûte cher d'extraire de la valeur de ces clusters Hadoop.
- Données inconnues. Comme ils n'ont pas été identifiés, ces données ne peuvent pas être utilisées par les entreprises.
Vous devez faire attention à quelques aspects, Quoi la plupart de ces données ne sont pas structurées et que, bien que le premier groupe soit le plus petit, le plus grand volume de données est concentré dans cette dernière catégorie.
Une étude numérique EMC, comparer l'évolution, Quoi la taille des données numériques augmente, multiplier par 10 en sept ans; mais fondamentalement, comment cette proportion persiste dans la faible proportion de ces données disponibles dans les systèmes analytiques et les systèmes embarqués, et qui proviennent d'appareils mobiles. En d'autres termes, il s'agit d'une grande taille d'informations qui non seulement augmente, mais contribue également à augmenter le défi de pouvoir en profiter, en partie à cause du type de formats, où plus de 90% sont non structurés et, pourtant, difficile à utiliser et difficile à consommer.
Qu'est-ce que les données sombres?
Les données ont longtemps été prisonnières de la technologie, applications et personnes.. Par chance, la maturité des systèmes nous permet de les libérer et de les mettre à disposition de l'ensemble de l'organisation.
Et dans ce concept de libéralisation apparaissent données sombres, données sombres, une définition créée par Gartner et qui est établi comme « les actifs informationnels que les entreprises traitent et stockent au cours de leurs activités commerciales, mais qu'ils ne peuvent pas utiliser à d'autres fins, comme la vision analytiqueL’analytique fait référence au processus de collecte, Mesurer et analyser les données pour obtenir des informations précieuses qui facilitent la prise de décision. Dans divers domaines, Comme les affaires, Santé et sport, L’analytique peut identifier des modèles et des tendances, Optimiser les processus et améliorer les résultats. L’utilisation d’outils et de techniques statistiques de pointe est essentielle pour transformer les données en connaissances applicables et stratégiques.... ou la monétisation. A savoir, Ils ne sont ni convertibles ni réutilisables et, pourtant, ils n'ajoutent pas de valeur.
Malgré cela, ce concept de dark data évolue dans le temps.. Actuellement, la valeur d'une grande partie de ces données peut désormais être saisie et exploitée. Même s'il y a encore de grandes zones qui ne sont pas accessibles et continuent de se conformer à cette prémisse, ce sont des données sombres.
Quels problèmes les données sombres créent-elles?
Les données obscures freinent les institutions, car ce type de données implique des inconvénients tels que:
- Coût plus élevé de la gestion des données.
- Risque accru.
Il existe de nombreux problèmes associés aux données sombres qui peuvent devenir plus fréquents avec le temps.. Le premier est le plus évident: l'espace. Alors que les données désorganisées continuent de croître, occuper un espace de stockage qui pourrait autrement être utilisé pour des actifs plus précieux. Plus de stockage signifie plus de frais généraux, Quoi, surtout à l'ère du Big Data, est une préoccupation majeure dans la plupart des institutions.
Dans le même temps, les coûts de stockage augmentent, avoir de grandes quantités de données non structurées ou désorganisées peut poser de graves risques de sécurité. Avec des documents obsolètes et apparemment inutiles, les données obscures sont également susceptibles de contenir des informations sensibles que les pirates pourraient vouloir intercepter.
A l'autre bout du spectre, l'organisation peut également perdre de grandes opportunités en permettant aux données obscures de s'accumuler dans la base de donnéesUne base de données est un ensemble organisé d’informations qui vous permet de stocker, Gérez et récupérez efficacement les données. Utilisé dans diverses applications, Des systèmes d’entreprise aux plateformes en ligne, Les bases de données peuvent être relationnelles ou non relationnelles. Une bonne conception est essentielle pour optimiser les performances et garantir l’intégrité de l’information, facilitant ainsi la prise de décision éclairée dans différents contextes..... Il y a probablement un grand potentiel inexploité dans cette masse d'informations., et plus ça augmente, sans ordre ni contrôle, plus il devient difficile pour l'organisation d'extraire la valeur de ces données.



