In diesem Kurs wird versucht, die erwarteten Ergebnisse von Datenwissenschaftlern zu artikulieren und den Schülern dann die Verwendung von PySpark beizubringen (parte de Apache SparkApache Spark ist eine Open-Source-Datenverarbeitungs-Engine, die die schnelle und effiziente Analyse großer Informationsmengen ermöglicht. Sein Design basiert auf dem Speicher, Dies optimiert die Leistung im Vergleich zu anderen Batch-Verarbeitungstools. Spark wird häufig in Big-Data-Anwendungen verwendet, Maschinelles Lernen und Echtzeitanalysen, Dank seiner Benutzerfreundlichkeit und...) um diese Erwartungen zu erfüllen. Zu den Kursaufgaben gehören Log-Mining-Übungen, Akkreditierung von Textentitäten und kollaboratives Filtern, die den Schülern beibringen, wie man Datensätze durch parallele Verarbeitung mit PySpark manipuliert.



