Kurs · Schulung · Workshop
Apache Spark
Zwei Tage intensiver Einstieg in Apache Spark mit Scala und Python: verteiltes In-Memory-Computing für Data Engineering, Data Science, Machine Learning und KI-Pipelines.
Einführung in Apache Spark, die derzeit leistungsfähigste Open-Source-Plattform für Data Engineering, Data Science, maschinelles Lernen und KI-Pipelines. Zwei Tage intensives Eintauchen in Spark-Kernkonzepte, Funktionen und Best Practices. Mit Scala und Python werden wir sicherstellen, dass Sie Ihre Fähigkeiten aufbauen, um Ihre Reise mit Spark zu beginnen.
Trainer
Stimmen unserer Teilnehmer:innen






Diese Kunden haben Kurse im gleichen Themen-Cluster bei uns gebucht.Mehr Kunden →
Inhalt
Apache Spark ist eine mehrsprachige Engine für die Ausführung von Data Engineering-, Data Science- und Machine Learning-Aufgaben. Tausende von Unternehmen, darunter 80 % der Fortune 500, nutzen Apache Spark™. Spark kann Daten in Batches und Streams verarbeiten und kann auf einem einzelnen Knoten oder in Clustern ausgeführt werden. Das Open-Source-Projekt Spark hat über 2.000 Mitwirkende aus Industrie und Wissenschaft.
Wir werden alle Grundlagen abdecken, damit Sie bereit sind, Ihre nächsten Big-Data-Verarbeitungspipelines zu betreiben.
Neben vielen anderen Themen werden wir die Spark-Architektur, die Verwendung von Scala, Python, R und SQL, Datenquellen, DataFrames, Datasets, Joins, Aggregationen, Spark-Typen, SparkUI, MLlib usw. behandeln.
Der effektive Kursinhalt kann, abhängig von Trainer, Durchführung, Dauer und Konstellation der Teilnehmer:innen, von obigen Angaben abweichen.
In-House Kurs anfragen
Öffentlichen Termin anfragen
Kein passender öffentlicher Termin dabei? Trag dich unverbindlich ein – sobald genug Interesse besteht, planen wir einen neuen öffentlichen Termin und informieren dich zuerst.
Mehr über Apache Spark
Apache Spark ist ein verteiltes Computing-System für Big Data-Verarbeitung, das In-Memory-Computing und DAG-basierte Ausführung kombiniert. Es bietet High-Level APIs in Scala, Java, Python und R sowie eine optimierte Engine, die automatisch verteilte Datenverarbeitung und Fehlertoleranz handhabt.Weitere Ressourcen:
History
Spark wurde 2009 von Matei Zaharia an der UC Berkeley's AMPLab entwickelt. Das Projekt entstand aus der Erkenntnis, dass MapReduce für iterative Algorithmen und interaktive Datenanalysen ineffizient war. Die erste Version wurde 2010 als Open-Source-Projekt veröffentlicht.
Die Entwicklung wurde massgeblich von der Gründung von Databricks durch Zaharia, Ali Ghodsi, Ion Stoica und anderen AMPLab-Mitgliedern beeinflusst. 2013 wurde Spark an die Apache Software Foundation übergeben. Die Einführung von DataFrames in Spark 1.3 und der strukturierten Streaming-API in Spark 2.0 waren wichtige Meilensteine.
Heute ist Spark das grösste Open-Source-Projekt im Bereich Big Data-Verarbeitung und wird von Unternehmen wie Netflix, Yahoo und Alibaba eingesetzt. Es hat die Art und Weise, wie Unternehmen grosse Datenmengen verarbeiten, grundlegend verändert und neue Standards für verteilte Datenverarbeitung gesetzt. Die Integration mit Cloud-Plattformen und die Unterstützung für Deep Learning haben Spark's Position als universelle Engine für Big Data-Analytics weiter gestärkt.
