Formation en IA & Data: Hadoop Cloudera - Développeur (4-128) - Ascent Formation
Retour aux formations
IA & Data

Hadoop Cloudera - Développeur (4-128)

4 jour(s)24h

Description

Objectif général de la formation: À l’issue de la formation, les participants seront capables de développer, optimiser et intégrer des solutions Hadoop dans des environnements Big Data tout en se préparant à la certification Cloudera. Modalité : Toutes les modalités (présentiel, classe virtuelle et hybride) sont possibles Lieu possible de réalisation : Locaux du bénéficiaire ou locaux d’Ascent Formation, en France métropolitaine et dans les DROM-COM Nombre maximal de participants : 20 Niveau SAME visé : Application (A) Compétences visées Découvrir et maîtriser les composants clés de l’écosystème Hadoop. Écrire et exécuter des programmes MapReduce. Utiliser les outils de l’écosystème Hadoop pour l’analyse et l’intégration des données. Optimiser les configurations Hadoop pour des performances accrues.

Objectifs pédagogiques

  • Comprendre l’architecture et les composants de Hadoop.
  • Exploiter HDFS pour le stockage et la gestion des données.
  • Développer des applications distribuées avec MapReduce.
  • Utiliser Hive, Pig, Flume, Mahout et Sqoop pour des projets Big Data.
  • Appliquer les bonnes pratiques de développement et de performance dans Hadoop.
  • Préparer efficacement la certification Cloudera.

Public concerné

Développeurs Big Data.
Administrateurs de solutions Hadoop.
Ingénieurs systèmes et données impliqués dans des projets Big Data.

Prérequis

Connaissances en programmation (Java ou Python).
Familiarité avec les systèmes Linux.
Notions de base sur le traitement et le stockage des données.

Déroulé du programme

1

Jour 1 : Introduction à Hadoop et HDFS (6 heures)

6h
  • Découverte de l’écosystème Hadoop (1,5 heure) :
2

Vue d’ensemble des composants (HDFS, YARN, MapReduce, Hive, Pig).

3

Cas d’usage concrets de Hadoop dans différents secteurs (finance, logistique).

4

Présentation des alternatives à Hadoop et leurs limites.

5

Travaux pratiques : Identifier les composants Hadoop dans une architecture donnée.

  • Introduction au système de fichiers HDFS (1,5 heure) :
6

Principes du stockage distribué : blocage des fichiers et tolérance aux pannes.

7

Gestion de la réplication et des facteurs de redondance.

8

Impact de la taille des blocs sur les performances du système.

9

Travaux pratiques : Charger un fichier dans HDFS et consulter ses propriétés.

  • Navigation et manipulation des fichiers dans HDFS (3 heures) :
10

Utilisation des commandes de base HDFS : création, lecture et suppression de fichiers.

11

Gestion des permissions et des accès utilisateurs dans HDFS.

12

Vérification et réparation des fichiers corrompus avec fsck.

13

Travaux pratiques : Créer, lire et supprimer des fichiers dans HDFS.

14

Jour 2 : Traitement des données avec MapReduce (6 heures)

6h
  • Concepts et architecture MapReduce (1,5 heure) :
15

Fonctionnement du schéma Mapper/Reducer avec exemples pratiques.

16

Étude des combinateurs et partionneurs pour les performances.

17

Analyse des journaux MapReduce pour diagnostiquer les erreurs.

18

Travaux pratiques : Écrire un programme MapReduce simple en Java/Python.

  • Développement avancé avec MapReduce (2 heures) :
19

Construction de chaînes de jobs MapReduce pour les workflows complexes.

20

Gestion des erreurs et des cas particuliers dans le traitement des données.

21

Optimisation des données d’entrée pour améliorer les performances.

22

Travaux pratiques : Intégrer plusieurs tâches MapReduce dans un workflow.

  • Optimisation des jobs MapReduce (2,5 heures) :
23

Analyse et ajustement des paramètres de configuration (mémoire, threads).

24

Techniques pour minimiser les transferts de données dans MapReduce.

25

Approche "in-memory" pour accélérer les traitements.

26

Travaux pratiques : Optimiser un job existant pour réduire le temps d’exécution.

27

Jour 3 : Utilisation des outils de l’écosystème Hadoop (6 heures)

6h
  • Analyse des données avec Hive et Pig (3 heures) :
28

Création de tables et gestion des partitions avec HiveQL.

29

Exécution de scripts Pig pour la transformation des données.

30

Requêtes avancées avec jointures et agrégats.

31

Travaux pratiques : Charger un dataset dans Hive et le manipuler avec Pig.

  • Intégration des données avec Flume et Sqoop (3 heures) :
32

Configuration des agents Flume pour le traitement en temps réel.

33

Automatisation des imports de données avec Sqoop.

34

Export de résultats vers des bases relationnelles ou d’autres systèmes.

35

Travaux pratiques : Utiliser Sqoop pour importer une base de données MySQL vers HDFS.

36

Jour 4 : Bonnes pratiques et certification Cloudera (6 heures)

6h
  • Bonnes pratiques de développement et d’implémentation (3 heures) :
37

Structuration des données pour les traitements distribués.

38

Analyse des logs Hadoop pour prévenir les pannes.

39

Techniques pour réduire l’impact des goulets d’étranglement.

40

Travaux pratiques : Appliquer les bonnes pratiques sur un scénario donné.

  • Préparation à la certification Cloudera (3 heures) :
41

Étude des questions types de l’examen Cloudera.

42

Analyse des retours d’expérience des candidats précédents.

43

Revue des sujets clés : HDFS, MapReduce, outils de l’écosystème.

44

Travaux pratiques : Résoudre des exercices types de l’examen Cloudera.

Informations

Durée

4 jour(s)

24h

Tarif

Sur demande