Description
Objectif général de la formation : Permettre aux participants de concevoir, développer et exploiter des projets Big Data en utilisant Spark et Python, tout en maîtrisant les outils analytiques et de visualisation. Modalité : Toutes les modalités (présentiel, classe virtuelle et hybride) sont possibles Lieu possible de réalisation : Locaux du bénéficiaire ou locaux d’Ascent Formation, en France métropolitaine et dans les DROM-COM Nombre maximal de participants : 20 Niveau SAME visé : Maîtrise (M) Compétences visées : Maîtriser les concepts de l’écosystème Big Data et son architecture. Manipuler et analyser des données massives avec PySpark et Python. Comprendre et appliquer des algorithmes de Data Analytics et Machine Learning sur Spark. Produire des visualisations dynamiques et interactives pour restituer les résultats.
Objectifs pédagogiques
- Comprendre l’écosystème technologique nécessaire pour réaliser un projet Big Data.
- Utiliser l’API PySpark pour interagir avec Spark en Python.
- Manipuler les données avec PySpark.sql.
- Appréhender les différentes classes d’algorithmes du Data Analytics pour répondre aux besoins métiers.
- Écrire des traitements Data Analytics/Machine Learning avec Python sur Spark.
- Appréhender la data visualisation pour restituer des analyses dynamiques.
Public concerné
Prérequis
Déroulé du programme
Jour 1 : Introduction à l’écosystème Big Data et Spark (6 heures)
- Concepts clés de l’écosystème Big Data (2 heures)
Comprendre les architectures distribuées (Hadoop, Spark).
Explorer les besoins technologiques des projets Big Data.
Travaux pratiques : Analyse d’une architecture Big Data et de ses composants.
- Introduction à Apache Spark (2 heures)
Présentation de Spark et de ses modules (Spark SQL, MLlib, Streaming).
Cas d’usage et positionnement par rapport à Hadoop.
Travaux pratiques : Installer et configurer Spark.
- Bases de PySpark (2 heures)
Introduction à l’API PySpark.
Exécution des premières commandes avec Spark en Python.
Travaux pratiques : Manipuler des données simples avec PySpark.
Jour 2 : Manipulation et analyse des données avec PySpark (6 heures)
- Utilisation de PySpark.sql (3 heures)
Création et gestion de DataFrames.
Exécution de requêtes SQL sur des données massives.
Travaux pratiques : Analyser des jeux de données avec PySpark.sql.
- Transformation des données (3 heures)
Filtrage, regroupement et jointures.
Optimisation des traitements avec Spark.
Travaux pratiques : Réaliser des transformations complexes sur un jeu de données.
Jour 3 : Introduction au Machine Learning avec Spark (6 heures)
- Algorithmes de Machine Learning avec MLlib (3 heures)
Présentation des classes d’algorithmes (classification, régression, clustering).
Déploiement d’un modèle de classification.
Travaux pratiques : Construire un modèle de régression sur un dataset.
- Optimisation et évaluation des modèles (3 heures)
Validation croisée et hyper-paramétrage.
Mesures de performances des modèles (précision, rappel).
Travaux pratiques : Évaluer et optimiser un modèle de clustering.
Jour 4 : Restitution des analyses avec visualisation de données (6 heures)
- Introduction à la visualisation dynamique (3 heures)
Outils de visualisation compatibles avec Spark.
Création de graphiques interactifs avec Python (Matplotlib, Seaborn).
Travaux pratiques : Créer des visualisations pour analyser des tendances.
- Création de tableaux de bord dynamiques (3 heures)
Intégration avec des outils de reporting (Tableau, Power BI).
Déploiement d’un tableau de bord interactif avec des données Spark.
Travaux pratiques : Concevoir un tableau de bord dynamique basé sur des métriques analytiques.
Jour 5 : Mise en œuvre complète d’un projet Big Data (6 heures)
- Réalisation d’un projet complet (6 heures)
Définition des besoins métiers et techniques.
Mise en œuvre des étapes : ingestion, transformation, analyse et restitution des données.
Travaux pratiques : Présentation d’un projet Big Data complet par chaque participant.
Informations
Durée
5 jour(s)
30h
Sur demande
Formations similaires
Migration vers le Cloud
Sur demande
Agents IA — Concevoir des systèmes autonomes avec LangChain et LangGraph - Avancé
Sur demande
AI Act européen — Comprendre vos obligations et vous mettre en conformité - Niveau débutant
Sur demande
Analyse bayésienne (4-107)
Sur demande