Stockage interne partagé sur les architectures Hadoop

Contenu

Las arquitecturas Hadoop son la base de un proyecto de software open source que admite aplicaciones distribuidas, diseñado para ser sûr (sin pérdida de datos) y escalable, capaz de almacenar grandes cantidades de datos, por lo que es muy útil para afrontar los retos del Big Data. El almacenamiento interno compartido es sinónimo de Resultados satisfactorios a bajo costo.

istock-634577262-9323708

Crédits photos: Anna_leni

Apache Hadoop hace frente con éxito a las complejidades de alto volumen, vitesse et variété des données, lo que le posibilita cargar, analizar y almacenar petabytes de información a través del análisis por lotes y el procesamiento distribuido.

Para introducir la cuestión de almacenamiento interno compartido en arquitecturas Hadoop, tenemos que centrarnos en el núcleo o corazón de este marco diseñado para operar en la clave de Big Data. Su composición consta de:

  • Una implementación Capa de mapa / disminución o procesamiento: Petite carte procesa grandes cantidades de información de una manera fácil de utilizar, Grace à almacenamiento interno compartido, muy fácil de utilizar, dado que la complejidad está oculta a los usuarios.
  • UNE capa de almacenamiento HDFS (Sistema de archivos distribuidos de Hadoop): c'est un système de fichiers distribué escrito en Java creado por Doug Cutting, que constituye la capa de almacenamiento en un grappe le Hadoop.

Almacenamiento interno compartido, transparente para el usuario

El modelo de programación paralela de datos Map / Reduce está, en effet, diseñado de tal manera que la complejidad de la distribución et tolérance aux pannes permanecer oculto. Este procedimiento en paralelo que no vemos, transparente avec Hadoop, cela donne au système une grande accessibilité et facilité d'utilisation.

La technologie de traitement parallèle de Map / Reduce suit le principe du « diviser pour mieux régner ». Sa logique de traitement se déploie dans les fonctions de mappage et de réduction. D'une part, mappe le problème en parties plus petites, en divisant les données entre les nœuds, ce qui permet à chaque machine de traiter sa partie et, autre, l'étape Réduire additionne les valeurs partielles de chaque clé pour obtenir le résultat final. .

stockage_interne_partagé_architectures_hadoop-4643288

Crédits photos: anankkml / FreeDigitalPhotos.net

UNE) Et, toutes les machines traitent l'information simultanément, grâce à la technologie de traitement parallèle qui est stockée dans chaque ordinateur à l'étape Map, jusqu'à ce que le composant Réduire consolide le résultat, avec cette autre donnée pour laquelle ils conservent également fournir de la fiabilité au système.

Avec Hadoop, Toute cette procédure s'exécute en parallèle de manière transparente pour l'utilisateur, puisqu'il n'a qu'à se soucier d'enregistrer le fichier dans le cluster Hadoop. Pourtant, Grâce à traitement parallèle, à ce stockage interne partagé dont Hadoop s'occupe automatiquement, il est possible de traiter de grands volumes de données plus rapidement.

La vitesse, tolérance aux pannes (chaque machine traite une partie et possède des informations sur l'autre), Facile à utiliser, son riche écosystème et, depuis lors, son faible coût, ont considérablement élargi l'utilisation des architectures Hadoop, démocratiser le traitement du big data pour obtenir des informations précieuses.

Profitez-vous des avantages du stockage interne partagé dans votre entreprise ??

Article similaire:

(une fonction(ré, s, identifiant) {
var js, fjs = d.getElementsByTagName(s)[0];
si (d.getElementById(identifiant)) revenir;
js = d.createElement(s); js.id = identifiant;
js.src = « //connect.facebook.net/es_ES/all.js#xfbml=1&état=0 »;
fjs.parentNode.insertAvant(js, fjs);
}(document, ‘script’, ‘facebook-jssdk’));

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données