Après avoir suivi ces cours, je me sens confiant dans la création de visualisations et de tableaux de bord professionnels.
Description du cours
Des réseaux sociaux aux avis produits, le texte est un type de données de plus en plus important dans de nombreuses applications, y compris en marketing analytics. Dans bien des cas, le texte remplace d’autres formes de données non structurées, car il est peu coûteux et à jour. Cependant, pour tirer pleinement parti de ce que le texte peut offrir, vous devez savoir comment le conceptualiser, le nettoyer, le résumer et le modéliser. Dans ce cours, vous utiliserez les tout derniers outils tidy pour démarrer rapidement et facilement avec le texte. Vous apprendrez à préparer et à visualiser du texte, à réaliser une analyse de sentiment, puis à exécuter et interpréter des modèles de sujets.
Prérequis
Programme de formation
Plan du cours
1
Préparer des textes
Étant donné que le texte est une donnée non structurée, il faut le préparer pour l’amener dans une forme analysable. Dans ce chapitre, vous apprendrez à structurer le texte en le tokenisant, en le nettoyant et en le traitant comme une donnée catégorielle.
- Le texte comme données50 XP
- Données de tweets sur les compagnies aériennes100 XP
- Synthèses par groupe100 XP
- Compter des données catégorielles50 XP
- Compter les types d’utilisateurs100 XP
- Résumer les types d’utilisateurs100 XP
- Tokenisation et nettoyage50 XP
- Tokenisation et comptage100 XP
- Nettoyer et compter100 XP
2
Visualiser des textes
Les décomptes, c’est bien, mais les visualisations, c’est mieux. Dans ce chapitre, vous apprendrez à appliquer ce que vous connaissez de ggplot2 à des données textuelles au format tidy.
3
Analyse de sentiment
Les décomptes de mots et les visualisations donnent une idée du contenu, mais nous pouvons aller plus loin. Dans ce chapitre, nous dépassons les simples décomptes pour analyser le sentiment, ou valence émotionnelle, d’un texte.
4
Modélisation de sujets
Dans ce dernier chapitre, nous allons au-delà des décomptes de mots pour révéler les sujets sous-jacents d’un ensemble de documents. Nous utiliserons un modèle de sujets standard appelé latent Dirichlet allocation.
R
Introduction à l’analyse de texte en R
Cours
terminé

