Formation en IA & Data: Traitement de données Big Data en temps réel avec Spark et Storm (4-091) - Ascent Formation
Retour aux formations
IA & Data

Traitement de données Big Data en temps réel avec Spark et Storm (4-091)

3 jour(s)18h

Description

Objectif général de la formation : Permettre aux participants de maîtriser le traitement de données massives en temps réel en utilisant les outils Spark et Storm, et d’implémenter des systèmes de calcul distribué performants. Modalité : Toutes les modalités (présentiel, classe virtuelle et hybride) sont possibles Lieu possible de réalisation : Locaux du bénéficiaire ou locaux d’Ascent Formation, en France métropolitaine et dans les DROM-COM Nombre maximal de participants : 20 Niveau SAME visé : Maîtrise (M) Compétences visées : Comprendre les fondamentaux du développement d’applications Big Data en temps réel. Évaluer les fonctionnalités et applications des outils Spark et Storm. Appliquer les systèmes de calcul distribué en temps réel de Spark et Storm. Traiter des volumes importants de données en temps réel.

Objectifs pédagogiques

  • Identifier les concepts fondamentaux des systèmes Big Data temps réel.
  • Configurer et utiliser Spark Streaming et Apache Storm.
  • Implémenter des pipelines de traitement pour des données en temps réel.
  • Optimiser les performances des systèmes de calcul distribué.

Public concerné

Développeurs et ingénieurs Big Data.
Data engineers travaillant sur des flux de données en temps réel.
Chefs de projet impliqués dans la gestion de données massives.

Prérequis

Connaissances de base en programmation et en systèmes distribués.
Expérience en manipulation de données massives (préférée).

Déroulé du programme

1

Jour 1 : Introduction et fondamentaux du traitement Big Data en temps réel (6 heures)

6h
  • Concepts clés du traitement temps réel (1 heure)
2

Définition du Big Data en temps réel et ses applications.

3

Différences entre traitement batch et traitement en streaming.

4

Cas d’usage et enjeux industriels.

  • Présentation des outils Spark et Storm (2 heures)
5

Vue d’ensemble de Spark Streaming : architecture et fonctionnalités.

6

Introduction à Apache Storm : principes et use cases.

7

Comparaison des deux outils et choix des contextes d’utilisation.

  • Développement d’applications Big Data (3 heures)
8

Configuration des environnements Spark et Storm.

9

Exploration des API principales pour le traitement des données.

10

Travaux pratiques : Installation et configuration des outils Spark et Storm.

11

Jour 2 : Implémentation des systèmes de calcul distribué (6 heures)

6h
  • Spark Streaming : traitement des données en temps réel (3 heures)
12

Concepts et mise en œuvre de RDD et DataFrame.

13

Traitement de flux avec Spark Streaming.

14

Travaux pratiques : Création d’une application Spark Streaming pour traiter des données en temps réel.

  • Apache Storm : pipelines de données temps réel (3 heures)
15

Architecture et fonctionnement des topologies Storm.

16

Gestion des flux et parallélisme.

17

Travaux pratiques : Développement d’un pipeline Storm pour des flux de données.

18

Jour 3 : Optimisation et mise en œuvre avancée (6 heures)

6h
  • Optimisation des systèmes de calcul distribué (3 heures)
19

Stratégies de partitionnement et gestion des ressources.

20

Surveillance et débogage des performances.

21

Travaux pratiques : Optimisation d’une application Spark ou Storm.

  • Intégration et cas d’étude final (3 heures)
22

Intégration avec des sources de données : Kafka, bases NoSQL.

23

Étude de cas : mise en œuvre complète d’un système temps réel.

24

Travaux pratiques : Réalisation d’un projet de bout en bout avec restitution.

Informations

Durée

3 jour(s)

18h

Tarif

2200 € HT

HT

Prochaines sessions