Accéder au contenu principal

Cours

Confidentialité des données et anonymisation en Python

Avancé4 h

Apprenez à traiter les informations sensibles à l'aide de techniques préservant la confidentialité.

Python4 h16 vidéos49 exercices3,850 XP3,788Attestation de réussite

Créez votre compte gratuit

Continuer avec Google
ou
En continuant, vous acceptez nos Conditions d’utilisation, notre notre Politique de confidentialité et que vos données sont stockées aux États-Unis.

Plébiscité par des apprenants dans des milliers d’entreprises

Description du cours

La confidentialité des données n’a jamais été aussi cruciale. Mais comment trouver l’équilibre entre protection de la vie privée et besoin de recueillir et de partager des informations métier utiles ? Dans ce cours, vous apprendrez à le faire en vous appuyant sur les mêmes méthodes que Google et Amazon — notamment la généralisation des données et des modèles de confidentialité comme la k-anonymat et la differential privacy. En plus d’aborder des sujets comme le RGPD, vous découvrirez comment créer et entraîner des modèles de Machine Learning en Python tout en protégeant les informations sensibles des utilisateurs, telles que les données d’employés et de revenus. Commençons !

Prérequis

Programme de formation

Plan du cours

1

Introduction à la confidentialité des données

Préparez-vous à appliquer des techniques d’anonymisation comme la suppression de données, le masquage, la génération de données synthétiques et la généralisation. Dans ce chapitre, vous apprendrez à distinguer les informations personnellement identifiables (PII) sensibles et non sensibles, les quasi-identifiants, ainsi que les bases du RGPD. Vous verrez aussi des exemples concrets de ce qui peut mal tourner si ces bonnes pratiques ne sont pas respectées.
Commencer le chapitre
2

Aller plus loin avec les techniques de protection de la vie privée

3

Differential Privacy

4

Anonymiser et publier des jeux de données

Dans ce dernier chapitre, vous apprendrez à appliquer des méthodes de réduction de dimensionnalité telles que l’analyse en composantes principales (PCA) pour anonymiser de grands jeux de données multicolonnes. Vous utiliserez ensuite Faker pour générer des jeux de données réalistes et cohérents, et scikit-learn pour créer des jeux de données synthétiques suivant une distribution normale. Enfin, vous rassemblerez tout ce que vous avez appris dans ce cours en combinant plusieurs techniques afin de publier des jeux de données en toute sécurité.
Commencer le chapitre

Confidentialité des données et anonymisation en Python

Cours
terminé

Obtenir un certificat d'achèvement

S’inscrire maintenant

Apprenez où que vous soyez avec l'application DataCamp

Même en déplacement, suivez quotidiennement nos cours mobiles et nos défis de codage de 5 minutes.