Apache Hadoop präsentiert Spark v1.0

Inhalt

apache_presenta_spark-2290152

Um die Latenz von Big-Data-Verarbeitungsvorgängen zu reduzieren und eine Reihe von Verbesserungen zu erzielen, Apache Software Foundation (ASF) hat die Verfügbarkeit der ersten Version von Spark . angekündigt, eine Open-Source-Analysesoftware, die beschleunigt Aufgabenausführung Echtzeitanalyse über die Hadoop-Datenverarbeitungsplattform.

Bekannt als „das Hadoop Schweizer Taschenmesser“, So funktioniert dieses neue Tool bereichert das Ökosystem von diesem verteilten Rechenmodell, das eine interessante Alternative zu bietet Karte verkleinern. Ihr Ersatz bedeutet Vorteile, da Echtzeitanalysen auf Hadoop-Clustern möglich sind und Geschwindigkeit multiplizieren mit 100 im Speicher im Vergleich zu MapReduce und bis zu 10 mehrmals auf der Festplatte.

Anstatt die Jobs im Batch-Modus auszuführen, macht Echtzeitanalysen zwischen Clustern unmöglich, Funke arbeitet in Mikrochargen Intervalle von fünf Sekunden oder weniger, die auch mehr Stabilität bietet als andere Echtzeit-Behandlungstools.

Echtzeitanalyse und Benutzerfreundlichkeit

Mit dieser Version 1.0 der Funke, Apache bietet eine stabile Anwendungsprogrammierschnittstelle unter Apache-Lizenz 2.0, wie bei all der Software, die aus der fieberhaften Tätigkeit des Gründerzentrums der Stiftung hervorgegangen ist. des Weiteren, Databriks vertreibt es in seiner kommerziellen Version.

Für seine Kompatibilität, Entwickler können damit auch MapReduce-Code in ihre eigenen Anwendungen eingeben, sowie um andere geschriebene in . zu erstellen Java, Scala oder Python, drei der häufigsten Sprachen.

Strukturierte Daten zusammen mit anderen unstrukturierten Daten im selben Analysevorgang gemeinsam analysieren können und deren Verwendung in kleine und große Teams o CPDs sind ein weiteres herausragendes Merkmal dieser Version.

Zusätzlich zur Unterstützung der Datenquellen des Dateisystems HDFS (Das verteilte Dateisystem von Hadoop), ist es mit einigen seiner Komponenten kompatibel wie GARN (Noch ein weiterer Ressourcen-Netotiator) oder mit der Datenbank verteilt HBase, eine der Hadoop-Datenbanken. .

Eine auf die permanente Analyse von Daten in Echtzeit ausgerichtete Nutzung kommt hinzu, weitere Funktionalitäten rund um seine Softwarebibliothek, neben anderen grafischen Behandlungen oder eingehenden Berechnungen mit maschinellem Lernen, sowie interaktive Datenabfragen.

Das AMP-Labor (Algorithmen, Maschinen und Menschen) Berkeley initiierte die Gründung von Spark, und im Juni 2013, vor einem Jahr, das Die ASF-Community hat das Projekt übernommen um dir den maximalen Schub zu geben. Heutzutage, Spark ist in Unternehmen auf der ganzen Welt im Einsatz, wie IBM, Cloudera Intel oder Pivotal haben Spark bereits in ihre Hadoop-Distributionen integriert, Daher sind die Erwartungen hoch, dass diese neue Software eine wichtige Rolle in der Big-Data-Datenverarbeitung spielen wird..

Erstellt in 1999, Die Foundation betreut Dutzende von Open-Source-Projekten und hat Tausende von Softwarelösungen beigesteuert, die unter der Apache-Lizenz vertrieben werden., einschließlich des berühmten Apache HTTP-Server-Frameworks, das weltweit beliebteste verteilte Datenverarbeitungssystem.

Verwandter Beitrag:


Bildquelle: renjith krishnan / FreeDigitalPhotos.net

(Funktion(D, S, Ich würde) {
var js, fjs = d.getElementsByTagName(S)[0];
Wenn (d.getElementById(Ich würde)) Rückkehr;
js = d.createElement(S); js.id = id;
js.src = „//connect.facebook.net/es_ES/all.js#xfbml=1&Status=0“;
fjs.parentNode.insertBefore(js, fjs);
}(dokumentieren, ‚Skript‘, ‚facebook-jssdk‘));

Abonniere unseren Newsletter

Wir senden Ihnen keine SPAM-Mail. Wir hassen es genauso wie du.

Datenlautsprecher