Weiter zum Inhalt

Kurs

Grundlagen von Big Data mit PySpark

Fortgeschritten4 Std.

Dieser Kurs zeigt praxisnah, wie du in PySpark mit Big Data arbeitest.

Python4 Std.16 Videos55 Übungen4,600 XP65,832Leistungsnachweis

Erstelle dein kostenloses Konto

Mit Google fortfahren
oder
Indem du fortfährst, akzeptierst du unsere Nutzungsbedingungen, unser Datenschutzrichtlinie und dass Ihre Daten in den USA gespeichert werden.

Geliebt von Lernenden in Tausenden Unternehmen

Kursbeschreibung

In den letzten Jahren wurde viel über Big Data geredet und in vielen Unternehmen ist dieses Thema endlich angekommen. Aber was ist mit Big Data eigentlich gemeint? Dieser Kurs vermittelt die Grundlagen von Big Data mit PySpark. Spark ist ein extrem schnelles Cluster-Computing-Framework für Big Data. Es bietet eine allgemeine Datenverarbeitungsplattform und lässt dich Programme bis zu 100x schneller im Speicher oder 10x schneller auf der Festplatte ausführen als Hadoop. Du verwendest PySpark, ein Python-Paket für die Spark-Programmierung, und seine leistungsstarken, höheren Bibliotheken wie SparkSQL, MLlib (für maschinelles Lernen) und so weiter. In Übungen untersuchst du die Werke von William Shakespeare, analysierst Daten zur FIFA-WM 2018 und führst Clustering mit Genom-Datensätzen durch. Am Ende dieses Kurses hast du ein tiefes Verständnis von PySpark und seiner Nutzung für allgemeine Big-Data-Analysen.

Voraussetzungen

Lernprogramm

Kursübersicht

1

Einführung in die Big-Data-Analyse mit Spark

Dieses Kapitel führt in die spannende Welt von Big Data ein und stellt die verschiedenen Konzepte und Frameworks für die Verarbeitung dieser riesigen Datenmengen vor. Du wirst verstehen, warum Apache Spark als bestes Framework für Big Data gilt.
Kapitel starten
2

Programmieren in PySpark-RDDs

Die wichtigste Abstraktion, die Spark zur Verfügung stellt, ist ein fehlertoleranter verteilter Datensatz – Resilient Distributed Dataset (RDD) –, der die Grundlage und das Rückgrat dieser Engine bildet. Dieses Kapitel führt in RDDs ein und zeigt, wie sie mit RDD-Transformationen und -Aktionen erstellt und ausgeführt werden.
Kapitel starten
4

Maschinelles Lernen mit PySpark MLlib

PySpark MLlib ist die skalierbare Bibliothek von Apache Spark für maschinelles Lernen in Python und besteht aus gängigen Lernalgorithmen und Dienstprogrammen. In diesem letzten Kapitel lernst du wichtige Algorithmen für maschinelles Lernen kennen. Du erstellst eine Engine für Filmempfehlungen und einen Spam-Filter und wendest k-Means-Clustering an.
Kapitel starten

Grundlagen von Big Data mit PySpark

Kurs
abgeschlossen

Bescheinigung über den Abschluss erhalten

Jetzt einschreiben

Datenkompetenz für unterwegs – mit der DataCamp-App

Mit unseren Kursen für Mobilgeräte und täglichen Programmier-Challenges erweiterst du deine Datenkompetenz von unterwegs.