Après avoir suivi ces cours, je me sens confiant dans la création de visualisations et de tableaux de bord professionnels.
Description du cours
Comme tout cours d’initiation, Introduction au Natural Language Processing en R a pour objectif de vous donner les outils essentiels pour débuter vos analyses de texte. Le Natural Language Processing (NLP) est un domaine de la data science en expansion constante, avec des avancées très enthousiasmantes au cours de la dernière décennie. Ce cours couvre les bases de ces sujets et vous prépare à développer vos capacités d’analyse. Nous abordons les expressions régulières, le topic modeling, la reconnaissance d’entités nommées, entre autres, en fournissant des exemples complets pour lancer vos futures analyses.
Prérequis
Programme de formation
Plan du cours
1
Les véritables fondamentaux
Le chapitre 1 d’Introduction au Natural Langauge Processing vous prépare à exécuter votre première analyse de texte. Vous explorerez les expressions régulières et la tokenisation, deux composants très courants dans la plupart des tâches d’analyse. Avec les expressions régulières, vous pouvez rechercher n’importe quel motif imaginé ; avec la tokenisation, vous préparez et nettoyez le texte pour des analyses plus poussées. Ce chapitre est indispensable pour aborder les techniques que nous verrons dans le reste du cours.
- Bases des expressions régulières50 XP
- S’exercer à la syntaxe avec grep100 XP
- Explorer les fonctions d’expressions régulières.100 XP
- Tokenisation50 XP
- Fonctions tidytext50 XP
- Tokenisation : phrases100 XP
- Notions de base du nettoyage de texte50 XP
- Prétraitement du texte : supprimer les stop words100 XP
- Prétraitement de texte : stemming100 XP
2
Représentations du texte
Dans ce chapitre, vous apprendrez les approches les plus courantes et étudiées pour analyser du texte. Vous verrez comment créer un corpus, étendre une représentation en sac de mots vers une matrice TF-IDF, et utiliser des mesures de similarité cosinus pour déterminer à quel point deux textes se ressemblent. Vous consoliderez vos bases pour pratiquer le NLP avant de plonger dans ses applications aux chapitres 3 et 4.
3
Applications : classification et topic modeling
Le chapitre 3 se concentre sur deux approches classiques d’analyse de texte : la modélisation de classification et le topic modeling. Si vous travaillez sur des projets d’analyse de texte, vous utiliserez inévitablement l’une ou l’autre de ces méthodes. Ce chapitre vous apprend à mettre en œuvre ces deux techniques et vous donne des pistes pour les aborder de manière pratique.
4
Techniques avancées
Au chapitre 4, nous couvrons deux incontournables du Natural Language Processing : l’analyse de sentiments et les word embeddings. Ce sont deux techniques essentielles pour toute personne qui apprend les fondamentaux de l’analyse de texte. De plus, vous découvrirez brièvement BERT, l’étiquetage morphosyntaxique (part-of-speech tagging) et la reconnaissance d’entités nommées. Près de 15 techniques d’analyse différentes sont abordées dans ce cours ; le chapitre 4 se termine donc en récapitulant toutes les excellentes méthodes que vous allez découvrir.
R
Introduction au Natural Language Processing en R
Cours
terminé

