No artigo anterior, discutimos o ecossistema Hadoop (ligação). Também falamos sobre as duas ferramentas Hadoop mais usadas, quer dizer, PORCOO Porco, um mamífero domesticado da família Suidae, É conhecida por sua versatilidade na agricultura e produção de alimentos. Nativo da Ásia, Sua criação se espalhou por todo o mundo. Os porcos são onívoros e têm alta capacidade de adaptação a vários habitats. O que mais, desempenham um papel importante na economia, Fornecimento de carne, couro e outros produtos derivados. Sua inteligência e comportamento social também são ... e COLMEIAHive é uma plataforma de mídia social descentralizada que permite que seus usuários compartilhem conteúdo e se conectem com outras pessoas sem a intervenção de uma autoridade central. Usa a tecnologia blockchain para garantir a segurança e a propriedade dos dados. Ao contrário de outras redes sociais, O Hive permite que os usuários monetizem seu conteúdo por meio de recompensas criptográficas, que incentiva a criação e a troca ativa de informações ..... Ambas as línguas têm seus seguidores e não há preferência específica entre as duas, em geral. Porém, nos casos em que a equipe que usa essas ferramentas é mais orientada para a programação, às vezes PIG é escolhido ao invés de HIVE, pois dá a eles mais liberdade durante a codificação. Nos casos em que a equipe não é muito especialista em programação, HIVE é provavelmente a melhor opção, dada sua semelhança com consultas SQL. As consultas sobre PIG são escritas em latim PIG. Neste artigo, iremos apresentá-lo ao PIG Latin usando um exemplo prático simples.
Instalação PIG
O motor PIG é executado no servidor do cliente. É simplesmente um interpretador que transforma seu código simples em operações complexas de redução de mapa. Isto é mapreduzirO MapReduce é um modelo de programação projetado para processar e gerar grandes conjuntos de dados com eficiência. Desenvolvido pelo Google, Essa abordagem divide o trabalho em tarefas menores, que são distribuídos entre vários nós em um cluster. Cada nó processa sua parte e, em seguida, os resultados são combinados. Esse método permite dimensionar aplicativos e lidar com grandes volumes de informações, sendo fundamental no mundo do Big Data.... ahora se maneja en la red distribuida de Hadoop. Observe que toda a rede nem saberá que a consulta foi executada a partir de um mecanismo PIG. O PIG permanece apenas na IU e tem como objetivo tornar a codificação mais fácil para o usuário.

Siga os passos abaixo em seu shell para instalar o PIG:
Para instalar sistemas compatíveis com Pig On Red Hat:
$ sudo yum install pig
Para instalar o Pig em sistemas SLES:
$ sudo zypper install pig
Para instalar o Pig no Ubuntu e outros sistemas Debian:
$ sudo apt-get install pig
Se você está pensando em executar o Pig no Windows, você deve apenas fazer uma máquina virtual rodar no Linux e então trabalhar nela. Você pode usar VMWare Player ou Oracle VirtualBox para iniciar um.
Depois de instalar o pacote PIG, você pode começar com o shell grunhido.
Para iniciar o Grunt Shell (MRv1):
$ exportar PIG_CONF_DIR = / usr / lib / pig / conf $ export PIG_CLASSPATH = / usr / lib / hbase / hbase-0.94.2-cdh4.2.1-security.jar:/usr/lib/ zookeeper"Funcionário do zoológico" é um videogame de simulação lançado em 2001, onde os jogadores assumem o papel de um tratador. A principal missão é gerenciar e cuidar de várias espécies de animais, garantindo o seu bem-estar e a satisfação dos visitantes. Ao longo do jogo, Os usuários podem projetar e personalizar seu zoológico, enfrentando desafios, incluindo alimentos, o habitat e a saúde dos animais..../zookeeper-3.4.5-cdh4.2.1.jar $ porco 2012-02-08 23:39:41,819 [a Principal] INFO org.apache.pig.Main - Registrando mensagens de erro para: /home / arvind / pig-0.9.2-cdh4b1 / bin / pig_1328773181817.log 2012-02-08 23:39:41,994 [a Principal] INFO org.apache.pig.backend.hadoop.executionengine.HExecutionEngine - Conectando-se ao sistema de arquivos hadoop em: hdfsHDFS, o Sistema de Arquivos Distribuído Hadoop, É uma infraestrutura essencial para armazenar grandes volumes de dados. Projetado para ser executado em hardware comum, O HDFS permite a distribuição de dados em vários nós, garantindo alta disponibilidade e tolerância a falhas. Sua arquitetura é baseada em um modelo mestre-escravo, onde um nó mestre gerencia o sistema e os nós escravos armazenam os dados, facilitando o processamento eficiente de informações..://localhost / ... grunhido> Para iniciar o Grunt Shell (FIOYARN é um gestor de pacotes para JavaScript que permite a instalação e gestão eficiente de dependências em projetos de desenvolvimento. Desenvolvido pelo Facebook, destaca-se pela sua rapidez e segurança em comparação com outros gestores. O YARN utiliza um sistema de cache para optimizar as instalações e fornece um arquivo de bloqueio para garantir a consistência das versões das dependências em diferentes ambientes de desenvolvimento....):
$ exportar PIG_CONF_DIR = / usr / lib / pig / conf
$ export PIG_CLASSPATH = / usr / lib / hbase / hbase-0.94.2-cdh4.2.1 -security.jar:/usr / lib / zookeeper / zookeeper-3.4.5-cdh4.2.1.jar
$ porco ... grunhido>
Uma vez que eu vejo “rosnar>”, você pode começar a codificar em PIG.
Fundo da caixa
Você é o líder de análise em uma loja de varejo chamada XYZ. XYZ mantém um registro de todos os clientes que compram nesta loja. Sua tarefa neste exercício é criar uma nova coluna chamada imposto sobre vendas., que é o 5% da venda. Mais tarde, filtrar as pessoas para as quais o valor do imposto é menor que $ 35. Assim que este subconjunto estiver pronto, escolha o 2 principais clientes com o menor número de clientes. Abaixo está uma tabela de amostra para a loja de varejo, que é salva como um .csv.

Escreva uma consulta em PIG Latin
Vamos construir esta consulta passo a passo. A seguir estão as etapas que você precisa seguir:
Paso 1 : Carregue o conjunto de dados no formato compreensível de PIG e armazenamento temporário de onde a consulta PIG pode referenciar a tabela diretamente
Sales = LOAD 'dataset.csv' USING PigStorage (',') COMO (Cliente,Vendas);
Tenga en cuenta que el comando anterior no carga la variávelEm estatística e matemática, uma "variável" é um símbolo que representa um valor que pode mudar ou variar. Existem diferentes tipos de variáveis, e qualitativo, que descrevem características não numéricas, e quantitativo, representando quantidades numéricas. Variáveis são fundamentais em experimentos e estudos, uma vez que permitem a análise de relações e padrões entre diferentes elementos, facilitando a compreensão de fenômenos complexos.... era. Ao trabalhar com Big Data, você precisa ser muito específico sobre as variáveis que você precisa usar e, portanto, certifique-se de escolher apenas as variáveis que são importantes para você em seu código.
Paso 2: criar uma nova tabela com valores de impostos.
Imposto = FOREACH Vendas GERAR Cliente,Vendas,Vendas * 0,05 como imposto : flutuador;
O comando acima gera uma nova tabela chamada impostos que possui as três colunas. A tabela agora será semelhante à seguinte:
Paso 3: Subconjunto de toda a tabela no cliente com um valor de imposto abaixo $ 35.
Imposto baixo = FILTRO Imposto POR Imposto < $35;
O resultado deste comando será visto escolha as células amarelas na seguinte tabela:
Paso 4: Agora precisamos classificar a tabela de subconjuntos por Cliente (EU IRIA) e escolha os dois principais clientes.
Sortcust = ORDER Lowtax BY Customer;
top_two = LIMIT Sortedcust 2;
Paso 5: armazenar arquivo temporário em arquivo csv permanente
STORE sortedcust INTO 'salesreport' USING PIGSTORAGE (',');
Nesta etapa, nossa tarefa está concluída e você obterá os números de cliente necessários com todos os detalhes. A seguir, o código completo que pode ser executado de uma vez é mostrado:
Sales = LOAD 'dataset.csv' USING PigStorage (',') COMO (Cliente,Vendas);
Imposto = FOREACH Vendas GERAR Cliente,Vendas,Vendas * 0,05 como imposto : flutuador;
Imposto baixo = FILTRO Imposto POR Imposto < $35;
Sortcust = ORDER Lowtax BY Customer;
top_two = LIMIT Sortedcust 2;
STORE sortedcust INTO 'salesreport' USING PIGSTORAGE (',');
Notas finais
Neste artigo, aprendemos como escrever código básico em PIG Latin. Porém, restringimos este artigo a declarações simples de filtragem e classificação, também falaremos sobre fusões mais complexas e outras declarações em alguns dos próximos artigos.
O artigo foi útil para você? Compartilhe conosco todas as aplicações práticas de PIG que você encontrou em seu trabalho. Deixe-nos saber sua opinião sobre este item na caixa abaixo..



