
Soluzioni Hadoop e Grandi dati apre un ampio ventaglio di alternative per il trattamento dei big data. Sebbene Cloudera abbia lanciato una volta il primo pacchetto commerciale basato su Hadoop, oggi esiste un numero molto grande di distribuzioni commerciali che cercano di facilitare la configurazione e l'installazione.
Come guida, in un rapporto recente di Analyze Future intitolato “Hadoop: Tendenze e previsioni di crescita dell'industria fino al 2020”, le seguenti dieci aziende sono selezionate come le principali aziende che operano nel mercato Hadoop:
- Servizi Web Amazon
- Cisco Systems
- Cloudera Inc
- Datameer, Inc
- Hortonworks ·, Inc
- Karmasphere, Inc.
- MapR Technologies
- Pentaho Corporation
- Teradata Corporation
- MarkLogic
Nonostante questo, il panorama cambia costantemente. Secondo lo stesso rapporto, se espera que aumente el número de distribuidores de Hadoop y, perché, la oferta de software empaquetado. In realtà, esta es una tendencia actual, debido a que al mismo tiempo de estas compañías, constantemente están surgiendo proveedores más pequeños que van ganando fuerza por su agilidad, obligando a las grandes compañías a innovar.
In particolare, el mercado de software empaquetado Hadoop registraría una tasa annual compuesta del 62,9% in el periodo analizado, Entra 2013 e 2020.
Los revendedores ayudan a sus clientes a administrar los datos por medio de Hadoop, un software open source que puede categorizar y analizar grandes cantidades de información de Big Data. è, In sintesi, simplificar el análisis datos que agregan valor al marco original de Apache Hadoop, el marco común.
El ecosistema de Hadoop
Anche se il suo nome è unico, in realtà Hadoop è una famiglia di tecnologie open source supervisionate dalla Apache Software Foundation, e per questo alcuni dei suoi prodotti consentono diverse combinazioni e li possiamo trovare in pacchetti commerciali.
Secondo Philip Russom, direttore della ricerca sulla gestione dei dati presso The Data Warehousing Institute, la libreria di Hadoop include, “In ordine di priorità per la BI: Hadoop Distributed File System (HDFSHDFS, o File system distribuito Hadoop, Si tratta di un'infrastruttura chiave per l'archiviazione di grandi volumi di dati. Progettato per funzionare su hardware comune, HDFS consente la distribuzione dei dati su più nodi, garantire un'elevata disponibilità e tolleranza ai guasti. La sua architettura si basa su un modello master-slave, dove un nodo master gestisce il sistema e i nodi slave memorizzano i dati, facilitare l'elaborazione efficiente delle informazioni..), Riduci mappaMapReduce è un modello di programmazione progettato per elaborare e generare in modo efficiente set di dati di grandi dimensioni. Sviluppato da Google, Questo approccio suddivide il lavoro in attività più piccole, che sono distribuiti tra più nodi in un cluster. Ogni nodo elabora la sua parte e poi i risultati vengono combinati. Questo metodo consente di scalare le applicazioni e gestire enormi volumi di informazioni, essere fondamentali nel mondo dei Big Data...., MaialeIl maiale, un mammifero addomesticato della famiglia dei Suidi, È noto per la sua versatilità in agricoltura e nella produzione alimentare. Originario dell'Asia, Il suo allevamento si è diffuso in tutto il mondo. I maiali sono onnivori e hanno un'elevata capacità di adattarsi a vari habitat. Cosa c'è di più, svolgono un ruolo importante nell'economia, Fornitura di carne, cuoio e altri prodotti derivati. Anche la loro intelligenza e il loro comportamento sociale sono ..., AlveareHive è una piattaforma di social media decentralizzata che consente ai suoi utenti di condividere contenuti e connettersi con gli altri senza l'intervento di un'autorità centrale. Utilizza la tecnologia blockchain per garantire la sicurezza e la proprietà dei dati. A differenza di altri social network, Hive consente agli utenti di monetizzare i propri contenuti attraverso ricompense in criptovalute, che incoraggia la creazione e lo scambio attivo di informazioni...., HBaseHBase è un database NoSQL progettato per gestire grandi volumi di dati distribuiti in cluster. In base al modello a colonne, Consente un accesso rapido e scalabile alle informazioni. HBase si integra facilmente con Hadoop, il che lo rende una scelta popolare per le applicazioni che richiedono un'elevata quantità di archiviazione ed elaborazione dei dati. La sua flessibilità e capacità di crescita lo rendono ideale per i progetti di big data...., HCatalog, Ambari, Mahout, HBase, tra gli altri.
Allo stesso tempo, la comunità di Hadoop crea costantemente nuovi progetti. Anche se può essere combinato in diversi modi, secondo l'esperto, uno stack tecnologico pratico sarebbe HDFS e MapReduce (forse con Pig, Hive e HBase) per applicazioni di business intelligence (CON UN), archivio dati (DW), integrazione dei dati (DI) e analisi avanzata.
Apache Hadoop o distribuzione commerciale?
I vantaggi comparativi tra i fornitori si concentrano sulle loro diverse formule riguardo all'implementazione e alla facilità di gestione, anche se le soluzioni BI open source possono rispondere magnificamente alle esigenze del business, secondo un rapporto di Forrestar Research.
Perciò, ogni distribuzione è diversa e, allo stesso tempo, tutte condividono il loro nucleo, anche se alcuni produttori offrono le proprie applicazioni MapReduce. A) Sì, allo stesso tempo delle nuove generazioni di strumenti e delle diverse opzioni commerciali disponibili, Apache Hadoop è aperto a chiunque voglia utilizzarlo per l'archiviazione e l'elaborazione di grandi quantità di dati disparati.
Il fatto che Apache Hadoop sia open source e disponibile tramite i fornitori solleva l'inevitabile dilemma di chiedersi quale opzione sia più conveniente. Allo stesso tempo di essere fondamentale confrontare Le alternative tecnologiche prima di scegliere, è necessario prestare attenzione al costo economico, l'inclusione e la necessità di strumenti amministrativi, così come aspetti altrettanto decisivi come la manutenzione e l'assistenza tecnica.
Articolo correlato:
Fonte immagine: Twobee / FreeDigitalPhotos.net



