Im vorherigen Artikel, wir diskutieren das Hadoop-Ökosystem (Verknüpfung). Wir haben auch über die beiden am häufigsten verwendeten Hadoop-Tools gesprochen, nämlich, SCHWEINDas Schwein, ein domestiziertes Säugetier aus der Familie der Suidae, Es ist bekannt für seine Vielseitigkeit in der Landwirtschaft und Lebensmittelproduktion. In Asien beheimatet, Seine Züchtung hat sich über die ganze Welt verbreitet. Schweine sind Allesfresser und haben eine hohe Anpassungsfähigkeit an verschiedene Lebensräume. Was ist mehr, spielen eine wichtige Rolle in der Wirtschaft, Bereitstellung von Fleisch, Leder und andere abgeleitete Produkte. Ihre Intelligenz und ihr Sozialverhalten sind auch ... Ja HIVEHive ist eine dezentrale Social-Media-Plattform, die es ihren Nutzern ermöglicht, Inhalte zu teilen und sich mit anderen zu verbinden, ohne dass eine zentrale Behörde eingreifen muss. Verwendet die Blockchain-Technologie, um die Datensicherheit und das Eigentum zu gewährleisten. Im Gegensatz zu anderen sozialen Netzwerken, Hive ermöglicht es Nutzern, ihre Inhalte durch Krypto-Belohnungen zu monetarisieren, die die Schaffung und den aktiven Austausch von Informationen fördert..... Beide Sprachen haben ihre Anhänger und es gibt keine besondere Präferenz zwischen den beiden, allgemein. Aber trotzdem, in Fällen, in denen das Team, das diese Tools verwendet, eher programmorientiert ist, manchmal wird SCHWEIN dem HIVE vorgezogen, da es ihnen mehr Freiheit beim Kodieren gibt. In Fällen, in denen das Team nicht sehr versiert in der Programmierung ist, HIVE ist wahrscheinlich eine bessere Option, aufgrund seiner Ähnlichkeit mit SQL-Abfragen. Anfragen zu PIG werden in PIG Latein verfasst. In diesem Artikel stellen wir Ihnen PIG Latin anhand eines einfachen Praxisbeispiels vor.
SCHWEIN-Installation
Die PIG-Engine läuft auf dem Server des Clients. Es ist einfach ein Interpreter, der Ihren einfachen Code in komplexe Kartenreduktionsoperationen umwandelt. es ist Karte verkleinernMapReduce ist ein Programmiermodell, das entwickelt wurde, um große Datensätze effizient zu verarbeiten und zu generieren. Unterstützt von Google, Bei diesem Ansatz wird die Arbeit in kleinere Aufgaben aufgeteilt, die auf mehrere Knoten in einem Cluster verteilt sind. Jeder Knoten verarbeitet seinen Teil und dann werden die Ergebnisse kombiniert. Mit dieser Methode können Sie Anwendungen skalieren und große Informationsmengen verarbeiten, in der Welt von Big Data von grundlegender Bedeutung zu sein.... ahora se maneja en la red distribuida de Hadoop. Beachten Sie, dass das gesamte Netzwerk nicht einmal weiß, dass die Abfrage von einer PIG-Engine ausgeführt wurde. PIG bleibt nur in der UI und soll dem Benutzer das Codieren erleichtern.

Befolgen Sie die folgenden Schritte in Ihrer Shell, um PIG . zu installieren:
So installieren Sie mit Pig On Red Hat kompatible Systeme:
$ sudo yum installiere Schwein
So installieren Sie Pig auf SLES-Systemen:
$ sudo zypper installieren Schwein
So installieren Sie Pig auf Ubuntu und anderen Debian-Systemen:
$ sudo apt-get install Schwein
Wenn Sie daran denken, Pig unter Windows auszuführen, Sie sollten einfach eine virtuelle Maschine unter Linux laufen lassen und dann daran arbeiten. Sie können VMWare Player oder Oracle VirtualBox verwenden, um eine zu starten.
Nach der Installation des PIG-Pakets, du kannst mit der gruntshell beginnen.
So starten Sie die Grunt-Shell (MRv1):
$ export PIG_CONF_DIR=/usr/lib/pig/conf $ export PIG_CLASSPATH=/usr/lib/hbase/hbase-0.94.2-cdh4.2.1-security.jar:/usr/lib/ zookeeper"Tierpfleger" ist ein Simulationsvideospiel, das im 2001, in der die Spieler in die Rolle eines Zoowärters schlüpfen. Die Hauptaufgabe besteht darin, verschiedene Tierarten zu verwalten und zu pflegen, Sicherstellung Ihres Wohlbefindens und der Zufriedenheit der Besucher. Während des gesamten Spiels, Benutzer können ihren Zoo entwerfen und anpassen, Herausforderungen wie, den Lebensraum und die Gesundheit von Tieren..../zookeeper-3.4.5-cdh4.2.1.jar $ Schwein 2012-02-08 23:39:41,819 [hauptsächlich] INFO org.apache.pig.Main - Fehlermeldungen protokollieren in: /home/arvind/schwein-0.9.2-cdh4b1/bin/schwein_1328773181817.log 2012-02-08 23:39:41,994 [hauptsächlich] DIE INFO org.apache.pig.backend.hadoop.executionengine.HExecutionEngine - Verbindung zum hadoop-Dateisystem unter: hdfsHDFS, o Verteiltes Hadoop-Dateisystem, Es ist eine Schlüsselinfrastruktur für die Speicherung großer Datenmengen. Entwickelt für die Ausführung auf gängiger Hardware, HDFS ermöglicht die Datenverteilung über mehrere Knoten, Sicherstellung einer hohen Verfügbarkeit und Fehlertoleranz. Seine Architektur basiert auf einem Master-Slave-Modell, wobei ein Master-Knoten das System verwaltet und Slave-Knoten die Daten speichern, Erleichterung der effizienten Verarbeitung von Informationen..://localhost/ ... grunzen> So starten Sie die Grunt-Shell (GARNYARN ist ein Paketmanager für JavaScript, der die effiziente Installation und Verwaltung von Abhängigkeiten in Entwicklungsprojekten ermöglicht. Unterstützt von Facebook, Es zeichnet sich durch seine Schnelligkeit und Sicherheit im Vergleich zu anderen Managern aus. YARN verwendet ein Cache-System, um Installationen zu optimieren, und stellt eine Sperrdatei bereit, um die Konsistenz der Abhängigkeitsversionen in verschiedenen Entwicklungsumgebungen zu gewährleisten....):
$ export PIG_CONF_DIR=/usr/lib/pig/conf
$ export PIG_CLASSPATH=/usr/lib/hbase/hbase-0.94.2-cdh4.2.1 -security.jar:/usr/lib/zookeeper/zookeeper-3.4.5-cdh4.2.1.jar
$ Schwein ... grunzen>
Einmal sehe ich „Knurren>“, Sie können mit der Codierung in PIG . beginnen.
Fallhintergrund
Sie sind der Analytics-Führer in einem Einzelhandelsgeschäft namens XYZ. XYZ führt Aufzeichnungen über alle Kunden, die in diesem Geschäft einkaufen. Ihre Aufgabe für diese Übung besteht darin, eine neue Spalte namens Umsatzsteuer zu erstellen., was ist er 5% des Verkaufs. Später, filtern Sie die Personen, für die der Steuerbetrag geringer ist als $ 35. Sobald diese Teilmenge fertig ist, wählen Sie das 2 Hauptkunden mit den wenigsten Kunden. Unten ist eine Beispieltabelle für das Einzelhandelsgeschäft, die als .csv . gespeichert wird.

Schreiben Sie eine Anfrage in PIG Latin
Lassen Sie uns diese Abfrage Schritt für Schritt erstellen. Im Folgenden sind die Schritte, die Sie befolgen müssen:
Paso 1 : Laden Sie den Datensatz im verständlichen Format von PIG . hoch und temporärer Speicher, von dem aus die PIG-Abfrage direkt auf die Tabelle verweisen kann
Sales = LOAD 'dataset.csv' USING PigStorage (',') WIE (Kunde,Der Umsatz);
Tenga en cuenta que el comando anterior no carga la VariableIn Statistik und Mathematik, ein "Variable" ist ein Symbol, das einen Wert darstellt, der sich ändern oder variieren kann. Es gibt verschiedene Arten von Variablen, und qualitativ, die nicht-numerische Eigenschaften beschreiben, und quantitative, numerische Größen darstellen. Variablen sind grundlegend in Experimenten und Studien, da sie die Analyse von Beziehungen und Mustern zwischen verschiedenen Elementen ermöglichen, das Verständnis komplexer Phänomene zu erleichtern.... Alter. Bei der Arbeit mit Big Data, Sie müssen sehr genau sein, welche Variablen Sie verwenden müssen und, Daher, Stellen Sie sicher, dass Sie in Ihrem Code nur die Variablen auswählen, die für Sie wichtig sind.
Paso 2: Erstellen Sie eine neue Tabelle mit Steuerwerten.
Steuer = FOREACH Sales GENERATE Customer,Der Umsatz,Umsatz*0,05 als Steuer : schweben;
Der obige Befehl generiert eine neue Tabelle namens Steuern mit den drei Spalten. Die Tabelle sieht nun wie folgt aus:
Paso 3: Untergliedern Sie die gesamte Tabelle auf dem Client mit einem Steuerwert unten $ 35.
Niedrigsteuer = Steuer nach Steuer filtern < $35;
Das Ergebnis dieses Befehls wird angezeigt, wählen Sie die gelben Zellen in der folgenden Tabelle:
Paso 4: Jetzt müssen wir die Teilmengentabelle nach Kunde sortieren (ICH WÜRDE) und wählen Sie die beiden Hauptkunden.
sortedcust = ORDER Lowtax BY Kunde;
top_two = LIMIT sortierter Kunden 2;
Paso 5: temporäre Datei in permanenter CSV-Datei speichern
STORE sortedcust INTO 'salesreport' MIT PIGSTORAGE (',');
In diesem Schritt, unsere Aufgabe ist erledigt und Sie erhalten die benötigten Kundennummern mit allen Details. Dann, der komplette Code, der auf einmal ausgeführt werden kann, wird angezeigt:
Sales = LOAD 'dataset.csv' USING PigStorage (',') WIE (Kunde,Der Umsatz);
Steuer = FOREACH Sales GENERATE Customer,Der Umsatz,Umsatz*0,05 als Steuer : schweben;
Niedrigsteuer = Steuer nach Steuer filtern < $35;
sortedcust = ORDER Lowtax BY Kunde;
top_two = LIMIT sortierter Kunden 2;
STORE sortedcust INTO 'salesreport' MIT PIGSTORAGE (',');
Abschließende Anmerkungen
In diesem Artikel, wir haben gelernt, wie man grundlegenden Code in PIG Latin schreibt. Aber trotzdem, wir haben diesen Artikel auf einfache Filter- und Sortieranweisungen beschränkt, Wir werden in einigen der nächsten Artikel auch über komplexere Fusionen und andere Aussagen sprechen.
War der Artikel hilfreich für dich? Teilen Sie uns alle praktischen Anwendungen von PIG mit, die Sie in Ihrer Arbeit gefunden haben. Teilen Sie uns Ihre Meinung zu diesem Artikel im unten stehenden Feld mit..
Wenn Ihnen das, was Sie gerade gelesen haben, gefällt und Sie weiter über Analytics lernen möchten, abonnieren Sie unsere E-Mails, Folge uns auf Twitter oder wie bei uns Seite auf Facebook.
Verwandt
zusammenhängende Posts:
- Eine Einführung in Apache Pig für absolute Anfänger!!
- 5 Python-Tipps, die Sie kennen MÜSSEN, um besseren und kürzeren Code zu schreiben.
- Wie schreibe ich schwierige Briefe ("B", "Oder", "ICH") und andere seltsame Buchstaben auf dem iPhone
- Big-Data-Programm & Analytics und SP Jain Global School of Management



