Spark vs Hadoop, ¿quién ganará?

Conteúdo

apache Spark vs Hadoop Son dos dos productos más importantes y conocidos de la familia Big Data.

spark_vs_hadoop.jpg

Créditos fotográficos: OlgaYakovenko

Ainda quando há quem ven estes frameworks como competidores no espaço de big data, não é tão fácil fazer uma comparación Spark contra Hadoop. Fazem muchas cosas de la mesma maneira, pero hay algunas áreas en las que no se superponen. Como um exemplo, Apache Spark no tiene un sistema de archivos y, por isso, se basa en el Sistema de arquivos distribuído o Hadoop.

Si consulta Trends de Google, puede ver que Hadoop es más popular en comparación con Apache Spark. Mas mesmo assim, compañías como Yahoo, Inteligência, Baidu, Trend Micro y Groupon ya están usando Apache Spark.

Apache Spark vs Hadoop son comparables en different parametros. ¿Te interessa saber cuáles son los campos que marcan la diferença?

Spark contra Hadoop. La batalla esta servida

o resolução de acertijos de Spark vs Hadoop se sirve en tres claves:

uma) Usabilidade. Uno de los problemas más habituales al momento de contrastar ambos frameworks está relacionado con su facilidad de uso. ¿Cuál es más fácil de utilizar? Spark vs Hadoop? Nesta circunstância Apache Spark superaria a seu oponente dado que viene equipado con API verdaderamente simples para Scala, Pitão, Java y Spark SQL. Ao mesmo tempo, proporciona información en formato REPL sobre los comandos. Por sua vez, aunque es cierto que MapReduce tiene plugins como Porco e Colmeia que lo hacen algo más fácil de utilizar, al final lo que pasa es que la lógica simple necesita más programación (los programas deben estar escritos en Java), por lo que lo que se gana en usabilidade por una parte se perdería por el outra.

b) Desempeño. Este punto es tal vez el más difícil de solucionar en cualquier comparação entre Spark y Hadoop. O ponto é que, Dado que ambos processan los datos de manera distinto, no es nada fácil determinar quién logra el mejor rendimiento. Para hacer una elección se debe prestar atenção que:

Falando sobre Fagulha – fagulha:

  • Funciona en la memoria y por eso todos los procesos se aceleran.
  • Mas necessita mais memória para armazenamento.
  • Su rendimiento puede verse afectado por la necesidad de usar aplicações pesadas.

Em caso de Hadoop:

  • Los datos están en el disco y eso ralentiza todo.
  • La ventaja es que, en comparação con la otra alternativa, las necesidades de almacenamiento son menores.
  • Al ocuparse de borrar los dados cuando ya no se necesitan, no se producen perdas de rendimento significativas para aplicações pesadas.

c) Segurança. Se em usabilidade o Spark superou o Hadoop, nesta circunstância não tem nada a ver. O Hadoop não tem rivais O que:

  • Fornece aos seus utilizadores todos os benefícios dos avanços realizados nos projetos de segurança do Hadoop. (Knox Gateway ou Sentry são alguns exemplos).
  • HDFS apoia a autorização a nível de serviço, o que garante as permissões adequadas para os clientes a nível de ficheiro.
  • E, ao mesmo tempo … tenho um gerenciador de cluster simples incluído no Spark que facilita a configuração de um cluster

Por sua vez, O Spark deve ser executado no HDFS para aceder às permissões a nível de ficheiro e, ao mesmo tempo para obter benefícios de segurança, deve recorrer ao Hadoop FIO.

Mas então, Quem pode ser considerado o vencedor da competição Spark vs Hadoop? Cada um domina o outro em diferentes áreas. Como um exemplo, Hadoop seria la elección correcta cuando el tamaño de la memoria sea significativamente menor que el tamanho de los datos; pero si lo que buscas es velocidad, no podrías considerar outra alternativa que no sea Spark. ¿Cuál prefieres? ¿Crees que Spark podría terminar reemplazando a MapReduce? ¿Parece mais probable que Hadoop siga disfrutando de sua hegemonía?

Assine a nossa newsletter

Nós não enviaremos SPAM para você. Nós odiamos isso tanto quanto você.

Datapeaker