Description
Objectif général de la formation: À l’issue de la formation, les participants seront capables de mettre en œuvre des techniques de traitement automatique du langage naturel en utilisant Python et ses bibliothèques dédiées, pour analyser et manipuler des données textuelles. Modalité : Toutes les modalités (présentiel, classe virtuelle et hybride) sont possibles Lieu possible de réalisation : Locaux du bénéficiaire ou locaux d’Ascent Formation, en France métropolitaine et dans les DROM-COM Nombre maximal de participants : 20 Niveau SAME visé : Application (A) Compétences visées Comprendre les concepts fondamentaux du traitement automatique du langage naturel. Utiliser des bibliothèques Python pour traiter et analyser des textes. Implémenter des projets de classification et extraction d’information textuelle.
Objectifs pédagogiques
- Apprendre les bases du traitement automatique du langage naturel.
- Manipuler des données textuelles avec Python et des bibliothèques NLP.
- Implémenter des algorithmes pour l’analyse et la classification de texte.
Public concerné
Prérequis
Déroulé du programme
Jour 1 : Introduction au NLP et manipulation des données textuelles (6 heures)
- Introduction au traitement automatique du langage naturel (2 heures) :
Concepts fondamentaux : tokenization, stemming, lemmatization.
Présentation des cas d’usage : analyse de sentiment, classification de texte, chatbots.
Bibliothèques Python pour le NLP (NLTK, spaCy, TextBlob).
Travaux pratiques : Tokenizer un texte et appliquer le stemming/lemmatization avec NLTK.
- Préparation des données textuelles (2 heures) :
Nettoyage des données : suppression des stopwords, ponctuation, et caractères spéciaux.
Représentation des textes : bag-of-words, TF-IDF.
Préparation des jeux de données pour l’apprentissage automatique.
Travaux pratiques : Nettoyer et vectoriser un corpus de textes avec TF-IDF.
- Exploration des modèles de base pour le NLP (2 heures) :
Modèles statistiques et apprentissage supervisé (SVM, régression logistique).
Introduction aux embeddings : Word2Vec, GloVe.
Évaluation des modèles NLP (précision, rappel, F1-score).
Travaux pratiques : Entraîner un modèle de classification sur un corpus textuel simple.
Jour 2 : Modèles avancés et applications du NLP (6 heures)
- Techniques avancées avec spaCy et Transformers (2 heures) :
Utilisation de spaCy pour l’analyse grammaticale et la reconnaissance d’entités nommées.
Introduction aux modèles Transformers (BERT, GPT) et leur utilisation dans le NLP.
Travaux pratiques : Utiliser spaCy pour détecter les entités nommées dans un texte et tester un modèle pré-entraîné avec Transformers.
- Applications pratiques du NLP (2 heures) :
Analyse de sentiment sur des jeux de données réels.
Extraction d’information à partir de documents structurés et non structurés.
Classification de documents par thème ou catégorie.
Travaux pratiques : Réaliser une analyse de sentiment sur un dataset de tweets avec TextBlob.
- Mise en œuvre d’un projet complet de NLP (2 heures) :
Collecte et préparation des données textuelles.
Développement et entraînement d’un modèle pour un cas pratique.
Évaluation des performances et déploiement de l’application.
Travaux pratiques : Concevoir un mini-projet de NLP avec un pipeline complet de traitement et analyse de texte.
Informations
Durée
2 jour(s)
12h
1500 € HT
HT