HDFS und MapReduce, die Grundlage eines robusten Hadoop

Inhalt

hadoop_cluster-resized-600-2287879

Hadoop, das erfolgreiche Open-Source-Projekt, das von der Apache Software Foundation betreut wird, ist eine kostengünstige Technologie, mit der Sie große Mengen unterschiedlichster Daten verarbeiten können. Ihr riesige Vorteile Im Vergleich zu typischen verteilten Systemen, bedeutet nicht, dass es keine Nachteile hat, wie Latenz- oder Streaming- und Batch-Datei-Kompatibilitätsprobleme, aber das macht keine kompromisse Robustheit von diesem Rahmen.

Wie bekannt, Hadoop ist ein Java-basiertes Framework, das zwei einfachen Konzepten folgt: Daten speichern in dem Verteiltes Dateisystem die Hadoop (HDF) und sie verarbeiten durch Karte verkleinern, das Programmiermodell für verteilte Datenverarbeitung.

MapReduce y HDFS

MapReduce macht die berühmte römische Maxime von Teile und herrsche (teilen und erobern), da es ein komplexes Problem nimmt und es parallel in umsetzbare Teile zerlegt. Jedes dieser Teile wird an einen Knoten des Clusters oder Servers gesendet, um damit in den Mapping-Phasen zu arbeiten (Karte) Ja Reduzieren, In diesem Fall nehmen Sie die in der erhaltenen Listen als Eingabe Karte und eine Sammlung von Werten generieren.

Was ist mehr, HDFS ist ein verteiltes Dateisystem, das große Datenmengen und kostengünstige Hardware speichert. Leistung wird durch das Verbinden von Knoten mit dem Cluster erreicht, nämlich, Ausrüstung, die keine außergewöhnlichen Eigenschaften hat, was den Austausch im Pannenfall erleichtert.

Wenn Sie Hadoop mit Programmen wie HDFS oder MapReduce verwenden, können Sie parallel mit Big Data arbeiten, bietet eine integrierte und leicht skalierbare Lösung. In „Hadoop. Der endgültige Leitfaden“, Tom Whites berühmtes Buch, Hadoop ist definiert als linear skalierbar (Knoten können nach Bedarf hinzugefügt werden), mit einem hohe Verfügbarkeit (Dateien werden so oft wie nötig repliziert, was macht es zuverlässig) und Fehlertoleranz.

Eigentlich, beim Arbeiten mit MapReduce und HDFS in Hadoop werden die Ausfälle von Cluster Server, nämlich, das Framework hat das gleiche Verhalten bei Serverausfällen, damit die Berechnungsprozesse nicht abgebrochen werden.

Diese Fehlertoleranz übersetzt sich in a Robustheit für Hadoop was weitere unbestreitbare Vorteile wie niedrige Lagerkosten hinzufügt, Benutzerfreundlichkeit, Leistung, Geschwindigkeit und Flexibilität bei der Analyse strukturierter und unstrukturierter Daten.

Angenommen, kein verteiltes System kann Maximalwerte in erreichen Konsistenz, Verfügbarkeit und Fehlertoleranz, laut der lehrerin Eric Brewer, Hadoop kommt diesen drei Anforderungen ziemlich nahe, man kann also sagen, dass es sich um ein verteiltes System mit sehr hoher Performance handelt.

Die Zukunft von MapReduce

Die Entwicklung von Hadoop schreitet weiter voran mit neue Beiträge die die Benutzerfreundlichkeit verbessern, als rahmen Apache Funke, was die Leistung von MapReduce verbessern kann, deinen Kernel bereichern. Obwohl Spark MapReduce ersetzen oder sogar unabhängig agieren könnte, Nachfolger von Hadoop werden, die Wahrheit ist, dass es ein großes Potenzial hat, mit ihnen zusammenzuarbeiten, um Probleme wie Latenz zu verbessern, Echtzeit-Datenanalyse und höhere Effizienz bei Abfragen, die wiederholt Daten anfordern. .

Die Vielseitigkeit von Spark könnte als Gefahr für die Zukunft von Hadoop, das seinerzeit den Unterschied zu relationalen Datenbanken ausmachte (RDBMS) als verteiltes Lager- und Verarbeitungssystem. Zur Zeit, viele Analysten halten ihn für den Hauptkandidaten als Nachfolger von MapReduce oder Hadoop selbst. In jedem Fall, die Wahrheit ist, dass Spark ein autonomes Framework ist, aber sein Design ermöglicht es, mit dem verteilten Hadoop-Dateisystem zu arbeiten. Speziell, kann direkt auf HDFS ausgeführt werden, innerhalb von MapReduce oder parallel zu MapReduce im selben Cluster zu arbeiten.

Verwandter Beitrag:

Databricks zertifiziert Drittanbieter-Software für Spark Apache

Hadoop si o nein? Die Fragen zur Entscheidungshilfe

Hadoop-API 1.0.3: Wolkenreise

Bildnachweis: Cubie-Team

(Funktion(D, S, Ich würde) {
var js, fjs = d.getElementsByTagName(S)[0];
Wenn (d.getElementById(Ich würde)) Rückkehr;
js = d.createElement(S); js.id = id;
js.src = „//connect.facebook.net/es_ES/all.js#xfbml=1&Status=0“;
fjs.parentNode.insertBefore(js, fjs);
}(dokumentieren, ‚Skript‘, ‚facebook-jssdk‘));

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher