Python - Initiation à la manipulation et à l'analyse de données
Description
Cette formation initie les participants à la manipulation et à l'analyse de jeux de données avec Python. Elle est conçue pour un public non développeur, dont l'objectif est d'exploiter des données plutôt que d'apprendre la programmation pour elle-même. Après une prise en main de l'environnement Jupyter Notebook et l'acquisition du socle minimal du langage, les participants découvrent la bibliothèque pandas et ses structures de données, puis apprennent à importer un jeu de données, en contrôler la qualité, recoder, sélectionner et regrouper les variables. La formation se poursuit par une initiation à la visualisation avec matplotlib et s'achève par un atelier de synthèse. À l'issue de cet atelier, chaque participant dispose d'un notebook structuré permettant d'importer un jeu de données, de réaliser des contrôles simples, de produire des indicateurs descriptifs, de générer des graphiques et d'exporter les résultats. La progression privilégie la pratique immédiate en notebook, chaque notion étant introduite puis appliquée.
Objectifs pédagogiques
- À l'issue de la formation, le participant sera capable de :
- Utiliser l'environnement Jupyter Notebook pour exécuter et documenter un traitement
- Mobiliser les éléments essentiels du langage Python nécessaires à l'exécution, la lecture et l'adaptation de traitements simples en notebook
- Identifier les structures de données pandas (Series, DataFrame) et leurs propriétés
- Importer des données depuis des fichiers CSV et Excel, et exporter des résultats exploitables
- Contrôler la qualité d'un jeu de données avant analyse : dimensions, types, valeurs manquantes, doublons, • modalités, formats de dates
- Identifier et corriger les erreurs courantes rencontrées lors d'un import ou d'un traitement
- Créer, recoder et transformer des variables au sein d'un DataFrame
- Sélectionner, filtrer et regrouper des données selon des critères définis
- Produire et personnaliser des graphiques de base avec matplotlib
- Réaliser des traitements de statistique descriptive simples avec pandas : indicateurs de synthèse, distributions, tableaux croisés et comparaisons par groupes
Public concerné
Prérequis
Déroulé du programme
Jour 1
Séquence 1 - Généralités et prise en main de l'environnement (1h30)
• Présentation de Python et de son écosystème pour l'analyse de données
• Prise en main de Jupyter Notebook : cellules de code, cellules de texte, exécution, sauvegarde
• Notion de package et importation de bibliothèques
• Utilisation des aides : docstrings, fonction help, documentation en ligne
TP : premiers pas dans un notebook, exécution de cellules, importation de pandas
Séquence 2 Le socle du langage utile à l'analyse de données (1h30)
• Variables et types de base : chaînes, entiers, flottants, booléens
• Les listes : création, indexation, parcours
• Les tests conditionnels simples
• Appel de fonctions et de méthodes existantes
• Lecture et interprétation d'un message d'erreur
TP : exécution, lecture et adaptation d'un traitement simple en notebook
Séquence 3 – Les objets de Python pour les données : découverte de pandas (2h)
• Positionnement de pandas dans l'écosystème d'analyse de données
• La Series: structure indexée à une dimension
• Le DataFrame : structure tabulaire, lignes, colonnes, index
• Types de données au sein d'un DataFrame, dont les variables catégorielles
• Exploration d'un DataFrame : dimensions, aperçu, types, valeurs distinctes
• Principe des opérations vectorisées
TP : création et exploration de Series et de DataFrames
Jour 2
Séquence 4 – Importer et contrôler la qualité d'un jeu de données (2h)
• Importation de fichiers CSV : chemin d'accès, séparateur, encodage
• Importation de fichiers Excel : lecture d'un classeur, choix d'une feuille, précautions de format
• Comparaison des formats CSV et Excel
• Contrôles de qualité avant analyse : dimensions, types de colonnes, valeurs manquantes, doublons, modalités mal codées, formats de dates
• Correction des erreurs courantes : chemin de fichier, séparateur inadapté, encodage, nom de colonne incorrect, variable numérique importée comme texte, erreur d'index
TP: importation du jeu de données de travail, diagnostic de qualité et corrections
Séquence 5 Transformer, filtrer et agréger des données avec pandas (3h)
• Création et recodage de variables : nouvelles colonnes, transformations, remplacement de valeurs
• Traitement des valeurs manquantes
• Sélection de données : sélection de colonnes, filtrage de lignes selon conditions
• Combinaison de critères de filtrage
• Regroupements et agrégations : la méthode groupby, fonctions d'agrégation
• Tri et classement des résultats
• Exportation des résultats vers CSV et Excel
TP: recodage de variables, filtrage, regroupement et export d'un résultat exploitable
• Séquence 6 - Initiation au graphe et analyses descriptives (2h)
• Présentation de matplotlib et de son articulation avec pandas
• Réalisation de graphiques de base : histogramme, nuage de points, courbe, diagramme en barres
• Personnalisation : titres, axes, légendes, couleurs
• Affichage et export des graphiques
• Indicateurs de position et de dispersion avec pandas
• Distributions, tableaux de fréquences et tableaux croisés
• Statistiques par groupe et comparaisons
TP : production d'indicateurs descriptifs et de graphiques associés sur le jeu de données de travail
Séquence 7 - Atelier de synthèse (2h)
• Construction guidée d'un notebook métier complet, de l'import à l'export
• Enchaînement : importation, contrôles de qualité, recodage, indicateurs descriptifs, graphiques, export des résultats
• Structuration et documentation du notebook en vue de sa réutilisation
Livrable : chaque participant repart avec un notebook structuré et réutilisable sur ses propres jeux de données
Informations
Durée
2 jour(s)
14h
Sur demande
Formations similaires
Migration vers le Cloud
Sur demande
Agents IA — Concevoir des systèmes autonomes avec LangChain et LangGraph - Avancé
Sur demande
AI Act européen — Comprendre vos obligations et vous mettre en conformité - Niveau débutant
Sur demande
Analyse bayésienne (4-107)
Sur demande