Spark vs Hadoop, qui va gagner?

Contenu

apache Spark vs Hadoop Ils sont deux des produits les plus importants et connus de la famille Big Data.

spark_vs_hadoop.jpg

Crédits photos: OlgaYakovenko

Même si certains considèrent ces deux frameworks comme des concurrents dans le domaine du big data, il n'est pas si simple de faire une comparaison Spark contre Hadoop. Ils font beaucoup de choses de la même manière, mais il y a des domaines dans lesquels ils ne se superposent pas. Par exemple, Apache Spark il n'a pas de système de fichiers et, pour cela, il se base sur le système de fichiers distribué le Hadoop.

Si vous consultez Google Trends, vous pouvez voir que Hadoop est plus populaire par rapport à Apache Spark. Mais cependant, des entreprises comme Yahoo, Intelligence, Baidu, Trend Micro et Groupon utilisent déjà Apache Spark.

Apache Spark vs Hadoop sont comparables dans différents paramètres. Voulez-vous savoir quels sont les domaines qui font la différence?

Spark contre Hadoop. La bataille est lancée

La résolution de acertijos de Spark vs Hadoop se sirve en tres claves:

une) Convivialité. Uno de los problemas más habituales al momento de contrastar ambos frameworks está relacionado con su facilidad de uso. ¿Cuál es más fácil de utilizar? Spark vs Hadoop? Dans cette circonstance Apache Spark superaría a su oponente dado que viene equipado con API verdaderamente simples para Scala, Python, Java y Spark SQL. En même temps, proporciona información en formato REPL sobre los comandos. Pour sa part, aunque es cierto que CarteRéduire tiene plugins como Porc Oui Ruche que lo hacen algo más fácil de utilizar, al final lo que pasa es que la lógica simple necesita más programación (los programas deben estar escritos en Java), por lo que lo que se gana en usabilidad por una parte se perdería por el otro.

b) Performance. Este punto es tal vez el más difícil de solucionar en cualquier comparación entre Spark y Hadoop. Le fait est que, Dado que ambos procesan los datos de manera distinto, no es nada fácil determinar quién logra el mejor rendimiento. Para hacer una elección se debe prestar atención que:

Hablando sobre Étincelle – étincelle:

  • Funciona en la memoria y por eso todos los procesos se aceleran.
  • Pero necesita más memoria para almacenamiento.
  • Su rendimiento puede verse afectado por la necesidad de usar aplicaciones pesadas.

Dans le cas d Hadoop:

  • Los datos están en el disco y eso ralentiza todo.
  • La ventaja es que, en comparación con la otra alternativa, las necesidades de almacenamiento son menores.
  • Al ocuparse de borrar los datos cuando ya no se necesitan, no se producen pérdidas de rendimiento significativas para aplicaciones pesadas.

c) Sécurité. Si en matière d’utilisabilité Spark a surpassé Hadoop, dans cette circonstance, cela n’a rien à voir. Hadoop n’a pas de rivaux Quoi:

  • Il offre à ses utilisateurs tous les avantages des progrès réalisés dans les projets de sécurité de Hadoop. (Knox Gateway ou Sentry en sont quelques exemples).
  • HDFS il prend en charge l’autorisation au niveau du service, ce qui garantit les permissions appropriées pour les clients au niveau du fichier.
  • Oui, en même temps … possède Hadoop HILO

Pour sa part, Spark doit s’exécuter sur HDFS pour accéder aux permissions au niveau du fichier et, en même temps pour bénéficier de la sécurité, il doit faire appel à Hadoop FIL.

Mais alors, Qui peut être considéré comme le gagnant de la compétition Spark vs Hadoop? Chacun domine l’autre dans des domaines différents. Par exemple, Hadoop sería la elección correcta cuando el tamaño de la memoria sea significativamente menor que el tamaño de los datos; pero si lo que buscas es velocidad, no podrías considerar otra alternativa que no sea Spark. ¿Cuál prefieres? ¿Crees que Spark podría terminar reemplazando a MapReduce? ¿Parece más probable que Hadoop siga disfrutando de su hegemonía?

Abonnez-vous à notre newsletter

Nous ne vous enverrons pas de courrier SPAM. Nous le détestons autant que vous.

Haut-parleur de données