Après avoir suivi ces cours, je me sens confiant dans la création de visualisations et de tableaux de bord professionnels.
Description du cours
Le monde réel est désordonné, et votre rôle est d’y mettre de l’ordre. Les jeux de données jouets comme MTCars et Iris sont le fruit d’un important travail de curation et de nettoyage ; malgré cela, ils doivent encore être transformés pour que des algorithmes de Machine Learning puissants puissent en extraire du sens, prévoir, classer ou regrouper. Ce cours couvre les aspects concrets auxquels les data scientists consacrent 70 à 80 % de leur temps : la préparation des données et le feature engineering. Comme les jeux de données deviennent toujours plus volumineux, utilisons PySpark pour ramener ce problème de Big Data à une échelle gérable !
Prérequis
Programme de formation
Plan du cours
1
Analyse exploratoire des données
Faites connaissance avec votre problématique avant de vous lancer ! Puis apprenez à inspecter votre jeu de données, statistiquement et visuellement.
- Par où commencer50 XP
- Par où commencer ?50 XP
- Vérifier la version100 XP
- Charger les données100 XP
- Définir un problème50 XP
- Que cherchons-nous à prédire ?100 XP
- Vérifier le chargement des données100 XP
- Vérifier les types de données100 XP
- Inspection visuelle des données / EDA50 XP
- Utiliser corr()100 XP
- Utiliser des visualisations : distplot100 XP
- Utiliser des visualisations : lmplot100 XP
2
Préparation avec les fonctions Spark
Les données réelles sont rarement propres et prêtes pour l’analyse. Dans ce chapitre, apprenez à supprimer les informations inutiles, gérer les valeurs manquantes et ajouter des données complémentaires à votre analyse.
3
Feature Engineering
Dans ce chapitre, vous apprendrez à créer de nouvelles variables pour aider votre modèle de Machine Learning à apprendre. Nous verrons comment les générer en combinant des champs, en extrayant des valeurs de colonnes peu structurées ou en les encodant pour de meilleurs résultats.
4
Construire un modèle
Dans ce chapitre, nous apprendrons à choisir le type de modèle adapté. Ensuite, nous verrons comment appliquer nos données au modèle et l’évaluer. Enfin, nous apprendrons à interpréter les résultats et à enregistrer le modèle pour plus tard.
Feature Engineering avec PySpark
Cours
terminé

