Formation en IA & Data: Hadoop - Stockage avec Hbase (4-127) - Ascent Formation
Retour aux formations
IA & Data

Hadoop - Stockage avec Hbase (4-127)

4 jour(s)24h

Description

Objectif général de la formation: À l’issue de la formation, les participants seront capables d’implémenter et de gérer des solutions Big Data avec Hadoop HBase, tout en exploitant les outils Apache Hive et Pig pour l’analyse des données. Modalité : Toutes les modalités (présentiel, classe virtuelle et hybride) sont possibles Lieu possible de réalisation : Locaux du bénéficiaire ou locaux d’Ascent Formation, en France métropolitaine et dans les DROM-COM Nombre maximal de participants : 20 Niveau SAME visé : Application (A) Compétences visées Construire des programmes de traitement à base de Map Reduce. Intégrer Hadoop HBase dans un workflow d’entreprise. Manipuler et interroger les données avec Apache Hive et Pig. Configurer et utiliser des graphes de tâches pour orchestrer les traitements Hadoop.

Objectifs pédagogiques

  • Comprendre les fondamentaux de Hadoop et de HBase.
  • Implémenter des traitements distribués avec Map Reduce.
  • Intégrer HBase dans un workflow de traitement Big Data.
  • Exploiter Apache Hive et Pig pour analyser des données dans HDFS.
  • Utiliser et gérer des graphes de tâches pour orchestrer les workflows.

Public concerné

Administrateurs systèmes et réseaux.
Ingénieurs Big Data.
Responsables techniques impliqués dans des projets de gestion de données volumineuses.

Prérequis

Connaissances de base en programmation (Java ou Python).
Familiarité avec les systèmes Linux.
Notions élémentaires de traitement des données et systèmes distribués.

Déroulé du programme

1

Jour 1 : Introduction à Hadoop et HBase (6 heures)

6h
  • Introduction à Hadoop et à l'écosystème Big Data (1 heure)
2

Présentation des enjeux du Big Data.

3

Vue d’ensemble des composants de l’écosystème Hadoop (HDFS, YARN, MapReduce, HBase).

4

Cas d’usage concrets des solutions Hadoop dans l’industrie.

  • Présentation de HBase et son rôle dans Hadoop (1,5 heure)
5

Concepts fondamentaux de HBase (base de données distribuée, modèle clé-valeur).

6

Comparaison HBase vs bases de données relationnelles.

7

Fonctionnalités et limites de HBase.

  • Installation et configuration initiale de Hadoop et HBase (2 heures)
8

Préparation de l’environnement technique (cluster virtuel ou local).

9

Installation des composants Hadoop et HBase.

10

Configuration des fichiers principaux (hbase-site.xml, core-site.xml).

11

Travaux pratiques :Installer Hadoop et HBase sur un environnement virtuel.Vérifier le bon fonctionnement avec des commandes de base.

  • Exploration de HDFS et manipulation de données simples (1,5 heure)
12

Gestion des fichiers avec HDFS (ajout, lecture, suppression).

13

Concepts de réplication et tolérance aux pannes.

14

Utilisation des commandes CLI pour interagir avec HDFS.

15

Travaux pratiques :

16

Charger un fichier dans HDFS et le manipuler via la ligne de commande.

17

Jour 2 : Map Reduce et intégration de HBase (6 heures)

6h
  • Introduction au framework Map Reduce (1,5 heure)
18

Comprendre le fonctionnement de Map Reduce : Mapper, Reducer, Combiner.

19

Cycle de vie d’un programme Map Reduce.

20

Exemple concret de traitement de données avec Map Reduce.

  • Développement d’un programme Map Reduce (2 heures)
21

Écriture d’un programme Java/Python pour analyser des données dans HDFS.

22

Compilation et exécution du programme dans un cluster Hadoop.

23

Travaux pratiques : Développer un programme Map Reduce simple pour compter les mots dans un fichier.

  • Intégration de HBase dans un workflow Hadoop (2,5 heures)
24

Utiliser l’API HBase pour lire et écrire des données depuis un programme Map Reduce.

25

Étude des opérations CRUD (Create, Read, Update, Delete) dans HBase.

26

Optimisation des performances d’intégration HBase-Hadoop.

27

Travaux pratiques : Construire un workflow simple où les résultats d’un traitement Map Reduce sont enregistrés dans HBase.

28

Jour 3 : Analyse des données avec Hive et Pig (6 heures)

6h
  • Présentation d’Apache Hive et Pig (1 heure)
29

Différences entre HiveQL et Pig Latin.

30

Cas d’usage : traitement structuré (Hive) vs traitement semi-structuré (Pig).

31

Intégration avec HDFS et HBase.

  • Requêtes avec HiveQL (2 heures)
32

Création et gestion de tables dans Hive.

33

Utilisation des requêtes SQL pour interroger et analyser des données dans HDFS.

34

Optimisation des requêtes pour améliorer les performances.

35

Travaux pratiques : Charger un dataset dans Hive et exécuter des requêtes pour analyser les données.

  • Traitement des données avec Pig Latin (2 heures)
36

Syntaxe et logique de Pig Latin pour le traitement des données.

37

Opérations courantes : filtres, transformations, jointures.

38

Génération de résultats exploitables dans HDFS.

39

Travaux pratiques :

40

Écrire un script Pig pour transformer et analyser un dataset semi-structuré.

  • Comparaison et combinaison des outils (1 heure)
41

Scénarios pratiques pour combiner Hive et Pig dans un workflow Big Data.

42

Discussion des meilleures pratiques pour utiliser ces outils efficacement.

43

Jour 4 : Orchestration avec des graphes de tâches (6 heures)

6h
  • Introduction aux graphes de tâches Hadoop (1 heure)
44

Comprendre les workflows et la dépendance entre tâches.

45

Présentation de solutions comme Apache Oozie pour l’orchestration.

  • Création et configuration de graphes de tâches (2 heures)
46

Définir des tâches séquentielles et parallèles.

47

Gestion des erreurs et reprise des workflows en cas d’échec.

48

Travaux pratiques :Construire un graphe de tâches simple pour orchestrer un workflow HDFS + HBase.

  • Optimisation et débogage des workflows (1,5 heure)
49

Analyse des performances des workflows.

50

Résolution des erreurs courantes (tâches échouées, erreurs de dépendance).

51

Travaux pratiques :Optimiser un graphe de tâches pour réduire le temps d’exécution.

  • Étude de cas final : mise en place d’un workflow complet (1,5 heure)
52

Mise en œuvre d’un scénario complet combinant Hadoop, HBase, Hive et Pig.

53

Validation des résultats et discussion sur les points d’amélioration.

54

Travaux pratiques :Créer un workflow complexe pour analyser un dataset, traiter les données avec Pig, et enregistrer les résultats dans HBase.

Informations

Durée

4 jour(s)

24h

Tarif

Sur demande