Introduzione a PySpark

IntermedioLivello di competenza

Aggiornato 01/2026

Diventa esperto di PySpark per gestire i big data: elabora, interroga e ottimizza grandi dataset per analisi efficaci.

Crea il tuo account gratuito

Continuando, accetti i nostri Termini di utilizzo, la nostra Informativa sulla privacy e che i tuoi dati siano conservati negli Stati Uniti.

Descrizione del corso

Questo corso è perfetto per ingegneri dei dati, data scientist e professionisti del machine learning che vogliono lavorare in modo efficiente con grandi set di dati. Che tu stia passando da strumenti come Pandas o ti stia avvicinando per la prima volta alle tecnologie dei big data, questo corso ti dà una solida introduzione a PySpark e all'elaborazione distribuita dei dati.

Perché Spark? Perché adesso?

Scopri la velocità e la scalabilità di Apache Spark, il potente framework fatto apposta per gestire i big data. Grazie a lezioni interattive ed esercizi pratici, scoprirai come l'elaborazione in memoria di Spark gli dia un vantaggio rispetto ai framework tradizionali come Hadoop. Inizierai configurando le sessioni Spark e ti immergerai nei componenti principali come i Resilient Distributed Datasets (RDD) e i DataFrame. Impara a filtrare, raggruppare e unire i set di dati in modo facile mentre lavori su esempi reali.

Migliora le tue competenze in Python e SQL per i Big Data

Scopri come usare PySpark SQL per fare query e gestire i dati usando la sintassi SQL che già conosci. Affronta schemi, tipi di dati complessi e funzioni definite dall'utente (UDF), mentre impari a gestire la cache e a ottimizzare le prestazioni per i sistemi distribuiti.

Costruisci le tue basi per i big data

Alla fine di questo corso, avrai la sicurezza necessaria per gestire, interrogare ed elaborare grandi quantità di dati usando PySpark. Con queste competenze di base, sarai pronto per approfondire argomenti più complessi come l'apprendimento automatico e l'analisi dei big data.

Prerequisiti

Introduction to SQL Data Manipulation with pandas

Introduction to Apache Spark and PySpark

A General introduction to PySpark and distributed computing. This section introduces PySpark, PySpark DataFrames, and RDDs.

Descrizione del corso

Perché Spark? Perché adesso?

Migliora le tue competenze in Python e SQL per i Big Data

Costruisci le tue basi per i big data

Ottieni Attestato di conseguimento

Unisciti a oltre .css-nklxlk{color:var(--wf-brand--main, #03EF62);}19 milioni di studenti e inizia Introduzione a PySpark oggi!

Crea il tuo account gratuito

Aumenta le tue competenze sui dati con l'app di DataCamp

Unisciti a oltre 19 milioni di studenti e inizia Introduzione a PySpark oggi!