O que é Apache Hadoop?

Conteúdo

Mucha gente aún se pregunta que es Apache Hadoop. Tiene que ver con big data, Hortonworks está envolvido pero ¿en qué consiste verdaderamente? Apache Hadoop es un marco open source que possibilita el almacenamiento y el procesamiento distribuidos de grandes conjuntos de dados baseados en hardware comercial. Em outras palavras, Hadoop possibilidade a las instituciones obter informações rapidamente a partir de números masivas de dados estruturados y no estructurados, posicionándolos al nível de las demandas actuales del mercado en términos de dinamismo y capacidade.

apache hadoop

spainter_vfx

o Ecosistema de Hadoop cuenta con soluciones de todo tipo para cobrir qualquer necessidade que se le presente al negócio com respeito a:

Son exactamente estas funcionalidades las que mejor definen que es Apache Hadoop ainda quando, para conhecer verdadeiramente as posibilidades de esta herramienta y el secreto de su versatilidade, es necesario compreender o origem de los benefícios que aporta; los que impulsan a muchas corporaciones a decantarse por esta alternativa para sus proyectos de big data. Todos los beneficios de Hadoop se centram em algumas das suas principais cualidades:

  • Escalabilidade: esta herramienta te possibilidade de almacenar y repartir enormes conjuntos de dados nos seus centenas de servidores que operam em paralelo, permitiéndote olvidarte de los límites que imponen otras alternativas.

  • Velocidade– Garante una eficiência de procesamiento que nadie puede igualar, ¿de qué otra manera se pueden processar terabytes de informação em minutos?

  • Eficácia de custos: O armazenamento de dados torna-se uma realidade para as empresas, uma vez que o investimento necessário passa de dezenas ou centenas de euros por terabyte para ser reduzido a centenas de euros por terabyte.

  • Flexibilidade: Novas fontes de dados? não há problema, Novos tipos de dados? desde já… Apache Hadoop Adapta-se às necessidades do negócio e acompanha-o na sua expansão, Oferecendo soluções reais para qualquer iniciativa que surja.

  • Resistência ao fracasso: A sua tolerância a erros é um dos atributos mais valorizados pelos utilizadores, dado que toda a informação contida em cada nó é replicada noutros nós do cluster. em caso de falha, Haverá sempre uma cópia pronta para ser utilizada.

Hadoop elefante RGB redimensionado 600

O que é o Apache Hadoop: Soluções empresariais

Cada problema precisa de uma solução e, por tanto, aproximar-se para descobrir que es Apache Hadoop implica entrar no Projetos da Apache Software Foundation. Cada um deles foi desenvolvido para oferecer uma função explícita e, por isso, cada um tem a sua própria comunidade de desenvolvedores, bem como ciclos de lançamento individuais. Implemente, integre e trabalhe com Hadoop está relacionado com:

1. Gestão de dados: O objetivo é armazenar e processar grandes quantidades de dados numa camada de armazenamento escalável e, para alcançar, vem o Sistema de arquivos distribuído o Hadoop (HDFS). Esta tecnologia, que funciona através de hardware de baixo custo, estabelece a base para uma escala eficiente a partir da camada de armazenamento. Além disso, baseia-se em Apache Hadoop THREAD, Fornece uma arquitetura conectável e gestão de recursos para permitir uma ampla variedade de métodos de acesso a dados, o que torna viável operar com dados armazenados no Hadoop nos níveis de desempenho e serviço desejados. Em resumo Apache Tez, que faz a magia, processando big data quase em tempo real, graças à sua generalização do paradigma Mapa pequeno que ganha em eficiência.

2. Acesso aos dados: Não se pode ter a perspetiva necessária para responder à pergunta do que é o Apache Hadoop sem saber que um dos seus pontos fortes é a acessibilidade que garante, ao permitir interagir com os dados de uma grande variedade de formas e em tempo real. As aplicações que conseguem isto são:

  • Apache Colmeia: a tecnologia de acesso a dados mais amplamente adotada.

  • Mapa pequeno: o que lhe possibilita criar aplicações que processam grandes quantidades de dados estruturados e não estruturados em paralelo.

  • Porco apache: una plataforma para el procesamiento y análisis de grandes conjuntos de datos.

  • Apache HCatalog: que proporciona uma forma centralizada para los sistemas de procesamiento de datos que hace factible comprender la estructura y ubicación de los datos almacenados en Apache Hadoop.

  • Apache Hive: almacén de datos que posibilita un resumen sencillo y el lançamento de consultas ad-hoc por medio de una interface equivalente a SQL para grandes conjuntos de datos almacenados em HDFS.

  • Apache HBase: Sistema de almacenamiento de datos orientado a colunas NoSQL que proporciona acesso para leer o escribir big data en tiempo real para qualquer aplicação.

  • Tormenta Apache: agrega capacidades confiables de processamento de datos en tiempo real.

  • Apache Kafka: é um sistema de mensagens de publicação-assinatura rápido e escalável que é frequentemente utilizado em vez dos intermediários de mensagens tradicionais devido ao seu elevado desempenho, replicação e tolerância a falhas.

  • Apache Mahout– Fornece algoritmos de aprendizagem automática escaláveis para Hadoop que ajudam imenso os cientistas de dados nas suas tarefas de agrupamento, classificação e filtragem.

  • Apache Accumulo– Um dispositivo de armazenamento de dados de alto desempenho que inclui sistemas de recuperação.

3. Governança e integração de dados: possibilita uma carga de dados rápida e eficiente baseada na intervenção de:

  • Apache Falcon: es un marco de administración de datos que simplifica la administración y el procesamiento del ciclo de vida de los datos, lo que posibilita a los usuarios configurar, administrar y orquestar el movimiento de datos, el procesamiento paralelo, la recuperación de errores y la retención de datos; basado en políticas de gobernanza.

  • Canal Apache– Le posibilita mover, de manera agregada y eficiente, grandes números de dados de registo de muchas fuentes diferentes para Hadoop.

  • Apache Sqoop– Agiliza y facilita el movimiento de datos dentro y fuera de Hadoop.

4. Segurança: Apache Knox se encarga de proporcionar un único punto de autenticación y acesso a la Servicios de Apache Hadoop en un grupo. Desta forma, se assegurara la simplicidad en términos de seguridad, tanto para os utilizadores que accedem a los dados del cacho, como para los operadores que se encargan de administrar el clúster y controlar su acesso.

5. Operações: Apache Ambari proporciona la interfaz y las API imprescindibles para el aprovisionamiento, la administración y la supervisión y la integración del clúster de Hadoop con outro software de consola de administración. Apache Funcionário do zoológico coordina los procesos distribuidos, lo que posibilita que las aplicaciones distribuidas armazenen y medien mudanças en la informação de configuração importante. Finalmente, Apache Oozie se encarga de garantir la lógica de trabajo en las tareas de programación.

Hoje, con las nuevas plataformas sin servidor, a nuvem, Fagulha, Kafka y el auge de la ingeniería de datos, Apache Hadoop ha perdido algo de relevância. Es la consecuencia lógica de la transición de la inteligencia empresarial y el big data a la inteligencia artificial y el aprendizaje automático. Apesar disto, pese a los cambios, esta tecnología y su ecosistema seguirán adaptándose para, presumiblemente, volver a liderar, en alguna vez, la evolución digital, como ya lo hicieron en su día.

Postagem Relacionada:


Assine a nossa newsletter

Nós não enviaremos SPAM para você. Nós odiamos isso tanto quanto você.

Datapeaker