Ce cours tentera d'articuler les résultats attendus des scientifiques des données, puis enseignera aux étudiants comment utiliser PySpark (parte de Apache SparkApache Spark est un moteur de traitement de données open source qui permet l'analyse de grands volumes d'informations de manière rapide et efficace. Sa conception est basée sur la mémoire, ce qui optimise les performances par rapport à d'autres outils de traitement par lots. Spark est largement utilisé dans les applications de big data, apprentissage automatique et analyse en temps réel, grâce à sa facilité d'utilisation et....) pour répondre à ces attentes. Les devoirs du cours comprennent des exercices d'extraction de grumes, accréditation d'entités textuelles et filtrage collaboratif qui enseignent aux étudiants comment manipuler des ensembles de données via un traitement parallèle avec PySpark.



