GCP300DATAFLOW

Formation Dataflow : traitement de données serverless

Cette formation s'adresse aux praticiens du big data qui souhaitent approfondir leur compréhension de Dataflow afin de faire évoluer leurs applications de traitement de données. En commençant par les fondamentaux, cette formation explique comment Apache Beam et Dataflow fonctionnent ensemble pour répondre à vos besoins de traitement de données sans risque de dépendance à un fournisseur. La section consacrée au développement de pipelines montre comment convertir votre logique métier en applications de traitement de données exécutables sur Dataflow. Cette formation se conclut par une partie consacrée aux opérations, qui passe en revue les leçons les plus importantes pour exploiter une application de données sur Dataflow, notamment la surveillance, le dépannage, les tests et la fiabilité.

Google Cloud
Formation officielle Google CloudNiveau Avancé⏱️ 3 jours (21h)

Ce que vous allez apprendre

  • Sélectionner la bonne combinaison d'autorisations IAM pour votre tâche Dataflow.
  • Mettre en œuvre les bonnes pratiques pour un environnement de traitement de données sécurisé.
  • Sélectionner et régler les I/O de votre choix pour votre pipeline Dataflow.
  • Utiliser les schémas pour simplifier votre code Beam et améliorer les performances de votre pipeline.
  • Développer un pipeline Beam à l'aide de SQL et de DataFrames.
  • Assurer la surveillance, le dépannage, les tests et le CI/CD des pipelines Dataflow.

Prérequis

  • Avoir suivi « Building Batch Data Pipelines »
  • Avoir suivi « Building Resilient Streaming Analytics Systems »

Public cible

  • Ingénieurs Data, analystes de données et data scientists souhaitant développer des compétences en ingénierie des données

Programme de la Formation

22 modules pour maîtriser les fondamentaux

Objectifs
  • Présenter les objectifs du cours.
  • Montrer comment Apache Beam et Dataflow fonctionnent ensemble pour répondre aux besoins de traitement de données de votre organisation.
Sujets abordés
  • Introduction au cours
  • Rappels sur Beam et Dataflow
Sujets abordés
  • Dataflow
Objectifs
  • Résumer les avantages du framework de portabilité de Beam.
  • Personnaliser l'environnement de traitement de données de votre pipeline à l'aide de conteneurs personnalisés.
  • Passer en revue les cas d'usage des transformations entre langages.
  • Activer le framework de portabilité pour vos pipelines Dataflow.
Sujets abordés
  • Portabilité de Beam
  • Runner v2
  • Environnements de conteneurs
  • Transformations entre langages
Activités

Quiz

Objectifs
  • Activer Shuffle et Streaming Engine, respectivement pour les pipelines par lots et en flux, afin d'obtenir des performances maximales.
  • Activer Flexible Resource Scheduling pour des performances plus économiques.
Sujets abordés
  • Dataflow Shuffle Service
  • Dataflow Streaming Engine
  • Flexible Resource Scheduling
Activités

Quiz

Objectifs
  • Sélectionner la bonne combinaison d'autorisations IAM pour votre tâche Dataflow.
  • Déterminer vos besoins en capacité en examinant les quotas pertinents pour vos tâches Dataflow.
Sujets abordés
  • IAM
  • Quota
Activités

Quiz

Objectifs
  • Choisir votre stratégie de traitement de données par zone avec Dataflow, en fonction de vos besoins de localisation des données.
  • Mettre en œuvre les bonnes pratiques pour un environnement de traitement de données sécurisé.
Sujets abordés
  • Localisation des données
  • VPC partagé
  • Adresses IP privées
  • CMEK
Activités

Atelier pratique et quiz

Objectifs
  • Revoir les principaux concepts d'Apache Beam (Pipeline, PCollections, PTransforms, Runner, lecture/écriture, PTransforms utilitaires, entrées annexes), les bundles et le cycle de vie des DoFn.
Sujets abordés
  • Notions de base de Beam
  • Transformations utilitaires
  • Cycle de vie des DoFn
Activités

Atelier pratique et quiz

Objectifs
  • Mettre en place une logique pour gérer vos données en retard.
  • Passer en revue les différents types de déclencheurs.
  • Revoir les concepts fondamentaux du streaming (PCollections non bornées, fenêtres).
Sujets abordés
  • Fenêtres
  • Watermarks
  • Déclencheurs
Activités

Atelier pratique et quiz

Objectifs
  • Écrire les I/O de votre choix pour votre pipeline Dataflow.
  • Optimiser votre transformation source/sink pour des performances maximales.
  • Créer des sources et des sinks personnalisés à l'aide de SDF.
Sujets abordés
  • Sources et sinks
  • Text IO et File IO
  • BigQuery IO
  • PubSub IO
  • Kafka IO
  • Bigtable IO
  • Avro IO
  • Splittable DoFn
Activités

Quiz

Objectifs
  • Présenter les schémas, qui permettent aux développeurs d'exprimer des données structurées dans leurs pipelines Beam.
  • Utiliser les schémas pour simplifier votre code Beam et améliorer les performances de votre pipeline.
Sujets abordés
  • Schémas Beam
  • Exemples de code
Activités

Atelier pratique et quiz

Objectifs
  • Identifier les cas d'usage des implémentations des API State et Timer.
  • Choisir le bon type d'état et de minuteurs pour votre pipeline.
Sujets abordés
  • State API
  • Timer API
  • Synthèse
Activités

Quiz

Objectifs
  • Mettre en œuvre les bonnes pratiques pour les pipelines Dataflow.
Sujets abordés
  • Schémas
  • Gestion des données non traitables
  • Gestion des erreurs
  • Générateur de code AutoValue
  • Gestion des données JSON
  • Exploiter le cycle de vie des DoFn
  • Optimisations de pipeline
Activités

Atelier pratique et quiz

Objectifs
  • Développer un pipeline Beam à l'aide de SQL et de DataFrames.
Sujets abordés
  • Dataflow et Beam SQL
  • Fenêtrage en SQL
  • Beam DataFrames
Activités

Atelier pratique et quiz

Objectifs
  • Prototyper votre pipeline en Python à l'aide des notebooks Beam.
  • Lancer une tâche vers Dataflow depuis un notebook.
Sujets abordés
  • Notebooks Beam
Activités

Quiz

Objectifs
  • Naviguer dans l'interface des détails de tâche Dataflow.
  • Interpréter les graphiques de métriques de tâche pour diagnostiquer les régressions de pipeline.
  • Configurer des alertes sur les tâches Dataflow à l'aide de Cloud Monitoring.
Sujets abordés
  • Liste des tâches
  • Informations sur la tâche
  • Graphe de la tâche
  • Métriques de la tâche
  • Metrics Explorer
Activités

Quiz

Objectifs
  • Utiliser les journaux Dataflow et les widgets de diagnostic pour résoudre les problèmes de pipeline.
Sujets abordés
  • Journalisation
  • Rapports d'erreurs
Activités

Quiz

Objectifs
  • Adopter une approche structurée pour déboguer vos pipelines Dataflow.
  • Examiner les causes courantes des défaillances de pipeline.
Sujets abordés
  • Processus de dépannage
  • Types de problèmes
Activités

Atelier pratique et quiz

Objectifs
  • Comprendre les considérations de performance pour les pipelines.
  • Étudier comment la forme de vos données peut affecter les performances du pipeline.
Sujets abordés
  • Conception de pipeline
  • Forme des données
  • Sources, sinks et systèmes externes
  • Shuffle et Streaming Engine
Activités

Quiz

Objectifs
  • Approches de test pour votre pipeline Dataflow.
  • Passer en revue les frameworks et fonctionnalités disponibles pour rationaliser votre processus CI/CD des pipelines Dataflow.
Sujets abordés
  • Présentation des tests et du CI/CD
  • Tests unitaires
  • Tests d'intégration
  • Création d'artefacts
  • Déploiement
Activités

Ateliers pratiques et quiz

Objectifs
  • Mettre en œuvre les bonnes pratiques de fiabilité pour vos pipelines Dataflow.
Sujets abordés
  • Introduction à la fiabilité
  • Surveillance
  • Géolocalisation
  • Reprise après sinistre
  • Haute disponibilité
Activités

Quiz

Objectifs
  • Utiliser les Flex Templates pour standardiser et réutiliser le code de vos pipelines Dataflow.
Sujets abordés
  • Modèles classiques
  • Flex Templates
  • Utilisation des Flex Templates
  • Modèles fournis par Google
Activités

Ateliers pratiques et quiz

Objectifs
  • Synthétiser les concepts fondamentaux de programmation Apache Beam pour les pipelines de données par lots et en flux
  • Concevoir des architectures de traitement de données en production tirant parti des capacités gérées de Cloud Dataflow
Sujets abordés
  • Récapitulatif rapide des sujets de la formation

Formations associées

Google Cloud

Intégration de données avec Cloud Data Fusion

Ce cours de 2 jours présente aux apprenants la capacité d'intégration de données de Google Cloud à l'aide de Cloud Data Fusion. Dans ce cours, nous discutons des défis liés à l'intégration de données et de la nécessité d'une plateforme d'intégration de données (middleware). Nous discutons ensuite de la manière dont Cloud Data Fusion peut aider à intégrer efficacement les données provenant d'une variété de sources et de formats et à générer des informations. Nous examinons les principaux composants de Cloud Data Fusion et leur fonctionnement, comment traiter les données par lots et les données en streaming en temps réel avec une conception de pipeline visuelle, un suivi riche des métadonnées et de la lignée des données, et comment déployer des pipelines de données sur divers moteurs d'exécution.

2 j
Intermédiaire
Google Cloud

Gérer un maillage de données avec Knowledge Catalog

Knowledge Catalog est une fabrique de données intelligente qui permet aux organisations de découvrir, gérer, surveiller et gouverner de manière centralisée leurs données à travers les lacs de données, les entrepôts de données et les datamarts. Vous pouvez utiliser Knowledge Catalog pour construire une architecture de maillage de données afin de décentraliser la propriété des données entre les propriétaires de domaines de données. Dans ce cours, vous apprendrez à découvrir, gérer, surveiller et gouverner vos données à travers les lacs de données, les entrepôts de données et les datamarts grâce à des conférences guidées et des exercices indépendants utilisant des données d'exemple.

2 j
Intermédiaire

Prochaines sessions

Aucune date ne vous convient ?

Nous organisons régulièrement de nouvelles sessions. Contactez-nous pour connaître les prochaines dates disponibles ou pour organiser une session à la date de votre choix.

S'inscrire à une date personnalisée

Processus Qualité

L'engagement de SFEIR Institute : une démarche d'excellence pour garantir la qualité et la réussite de toutes nos formations. En savoir plus sur notre démarche qualité

Méthodes pédagogiques mobilisées
  • Lectures / Apports théoriques (Slides)Présentation de concepts via des supports visuels (PowerPoint, PDF).
  • Démonstration technique (Démos)Le formateur réalise une manipulation ou une procédure devant les apprenants.
  • Laboratoires dirigés (Labs)Mise en pratique guidée sur logiciel, machine ou environnement technique.
  • Quiz / QCMTest rapide de connaissances (format papier ou numérique type Kahoot/Klaxoon).
Dispositif d'évaluation et de suivi

L'atteinte des objectifs de la formation est évaluée à plusieurs niveaux pour garantir la qualité de la prestation :

  • Évaluation continue des acquis : Vérification des connaissances tout au long de la formation via des méthodes participatives (en fonction de la formation: quiz, exercices pratiques, mises en situation) sous la supervision du formateur.
  • Mesure de la progression : Dispositif d'auto-évaluation comparatif comprenant un diagnostic initial pour situer le niveau de départ, suivi d'une évaluation finale pour valider l'évolution des compétences.
  • Évaluation de la qualité : Questionnaire de satisfaction en fin de session pour mesurer la pertinence et l'efficacité de la formation ressentie par les participants.

Questions fréquentes

Aux praticiens du big data et aux ingénieurs data qui construisent déjà des applications de traitement de données et souhaitent approfondir leur maîtrise de Dataflow et d'Apache Beam.
Une expérience du traitement de données et une bonne connaissance de Google Cloud sont recommandées. Une familiarité avec les concepts d'Apache Beam est un atout, car il s'agit d'une formation avancée (300).
Vous apprendrez comment Apache Beam et Dataflow fonctionnent ensemble, à développer des pipelines batch et streaming, à optimiser les performances (Shuffle, Streaming Engine, Flexible Resource Scheduling) et à appliquer les bonnes pratiques de sécurité, de tests, de CI/CD et de fiabilité.
Oui. La formation couvre les fenêtres, watermarks et triggers, l'état et les timers, les sources et sinks, ainsi que le Streaming Engine pour des pipelines streaming hautes performances.
Il s'agit d'une formation avancée (niveau 300) d'une durée de 3 jours, alternant théorie, démonstrations et ateliers pratiques.
Nos organismes de formation SFEIR SAS et SFEIR-Est sont certifiés Qualiopi pour les actions de formation. Contactez-nous pour obtenir un devis.

2 370€ HT

par apprenant