Développer des applications Big Data avec MapRéduce (4-120)
Description
Objectif général de la formation : Maîtriser la conception, le développement et l’optimisation de programmes Big Data en utilisant la technologie Hadoop MapReduce. Modalité : Toutes les modalités (présentiel, classe virtuelle et hybride) sont possibles Lieu possible de réalisation : Locaux du bénéficiaire ou locaux d’Ascent Formation, en France métropolitaine et dans les DROM-COM Nombre maximal de participants : 20 Niveau SAME : Maîtrise (M) Compétences visées : Comprendre le fonctionnement de l’architecture Hadoop et de MapReduce. Développer et déployer des programmes MapReduce. Optimiser les traitements Big Data pour des performances accrues. Identifier et résoudre les problèmes courants liés à MapReduce.
Objectifs pédagogiques
- Apprendre à manipuler les données massives avec Hadoop et MapReduce.
- Concevoir des applications distribuées performantes.
- Intégrer MapReduce dans des pipelines de traitement de données.
- Réaliser des optimisations avancées pour améliorer les temps de traitement.
Public concerné
Prérequis
Déroulé du programme
Jour 1 : Introduction et fondamentaux (6 heures)
- Présentation de l’écosystème Hadoop (1 heure)
Concepts clés du Big Data et de Hadoop.
Rôles des différents composants (HDFS, YARN, MapReduce).
- Principes de MapReduce (2 heures)
Fonctionnement du paradigme MapReduce.
Architecture interne : Mapper, Reducer, Combiner, Partitioner.
Études de cas : traitements simples avec MapReduce.
- Configuration et environnement de développement (2 heures)
Installation et configuration d’Hadoop en mode pseudo-distribué.
Configuration des jobs MapReduce.
Travaux pratiques : Déploiement de l’environnement Hadoop.
- Premier programme MapReduce (1 heure)
Écrire, compiler et exécuter un programme MapReduce en Java.
Analyse des logs et suivi de l’exécution des jobs.
Jour 2 : Approfondissement et applications avancées (6 heures)
- Optimisation des traitements MapReduce (2 heures)
Techniques d’optimisation (Combiner, Compression, Partitioning).
Gestion de la mémoire et des ressources.
Travaux pratiques : Optimisation d’un job MapReduce pour un dataset volumineux.
- Gestion des données avec HDFS (1 heure)
Stockage et récupération des données dans HDFS.
Bonnes pratiques pour organiser les fichiers et les partitions.
- Cas d’utilisation avancés (2 heures)
Conception de workflows complexes.
Intégration avec d’autres outils Big Data (ex. : Hive, Pig).
Travaux pratiques : Mise en œuvre d’un pipeline Big Data complet.
- Troubleshooting et gestion des erreurs (1 heure)
Identification des erreurs courantes dans MapReduce.
Bonnes pratiques pour le debugging et la surveillance.
Informations
Durée
2 jour(s)
12h
Sur demande
Formations similaires
Migration vers le Cloud
Sur demande
Agents IA — Concevoir des systèmes autonomes avec LangChain et LangGraph - Avancé
Sur demande
AI Act européen — Comprendre vos obligations et vous mettre en conformité - Niveau débutant
Sur demande
Analyse bayésienne (4-107)
Sur demande