GCP300DATAFLOW

Formation Dataflow : traitement de données serverless

Cette formation s'adresse aux praticiens du big data qui souhaitent approfondir leur compréhension de Dataflow afin de faire progresser leurs applications de traitement de données. En commençant par les fondamentaux, cette formation explique comment Apache Beam et Dataflow fonctionnent ensemble pour répondre à vos besoins de traitement de données sans le risque de dépendance à un fournisseur. La section sur le développement de pipelines explique comment convertir votre logique métier en applications de traitement de données pouvant s'exécuter sur Dataflow. Cette formation se termine en mettant l'accent sur les opérations, en passant en revue les leçons les plus importantes pour exploiter une application de données sur Dataflow, notamment la surveillance, le dépannage, les tests et la fiabilité.

Google Cloud
Formation officielle Google CloudNiveau Avancé⏱️ 3 jours (21h)

Ce que vous allez apprendre

  • Montrer comment Apache Beam et Dataflow fonctionnent ensemble pour répondre aux besoins de traitement de données de votre organisation.
  • Résumer les avantages du Beam Portability Framework et l'activer pour vos pipelines Dataflow.
  • Activer Shuffle et Streaming Engine, respectivement pour les pipelines batch et streaming, pour des performances maximales.
  • Activer Flexible Resource Scheduling pour des performances plus économiques.
  • Sélectionner la bonne combinaison d'autorisations IAM pour votre tâche Dataflow.
  • Mettre en œuvre les bonnes pratiques pour un environnement de traitement de données sécurisé.
  • Sélectionner et ajuster les I/O de votre choix pour votre pipeline Dataflow.
  • Utiliser les schemas pour simplifier votre code Beam et améliorer les performances de votre pipeline.
  • Développer un pipeline Beam en utilisant SQL et DataFrames.
  • Effectuer la surveillance, le dépannage, les tests et le CI/CD sur les pipelines Dataflow.

Prérequis

  • Avoir suivi "Building Batch Data Pipelines"
  • Avoir suivi "Building Resilient Streaming Analytics Systems"

Public cible

  • Ingénieur de données, Analystes de données et Data Scientists aspirant à développer des compétences en ingénierie de données

Programme de la Formation

21 modules pour maîtriser les fondamentaux

Objectifs
  • Présenter les objectifs du cours.
  • Montrer comment Apache Beam et Dataflow fonctionnent ensemble pour répondre aux besoins de traitement de données de votre organisation.
Sujets abordés
  • Introduction au cours
  • Rappel sur Beam et Dataflow
Objectifs
  • Résumer les avantages du Beam Portability Framework.
  • Personnaliser l'environnement de traitement de données de votre pipeline en utilisant des conteneurs personnalisés.
  • Passer en revue les cas d'utilisation des transformations cross-language.
  • Activer le framework Portability pour vos pipelines Dataflow.
Sujets abordés
  • Beam Portability
  • Runner v2
  • Environnements de conteneurs
  • Cross-Language Transforms
Activités

Quiz

Objectifs
  • Activer Shuffle et Streaming Engine, respectivement pour les pipelines batch et streaming, pour des performances maximales.
  • Activer Flexible Resource Scheduling pour des performances plus économiques.
Sujets abordés
  • Dataflow
  • Dataflow Shuffle Service
  • Dataflow Streaming Engine
  • Flexible Resource Scheduling
Activités

Quiz

Objectifs
  • Sélectionner la bonne combinaison d'autorisations IAM pour votre tâche Dataflow.
  • Déterminer vos besoins de capacité en inspectant les quotas pertinents pour vos tâches Dataflow.
Sujets abordés
  • IAM
  • Quota
Activités

Quiz

Objectifs
  • Sélectionner votre stratégie de traitement de données zonal avec Dataflow, en fonction de vos besoins de localité des données.
  • Mettre en œuvre les bonnes pratiques pour un environnement de traitement de données sécurisé.
Sujets abordés
  • Localité des données
  • Shared VPC
  • Private IPs
  • CMEK
Activités

Atelier pratique et quiz

Objectifs
  • Passer en revue les principaux concepts d'Apache Beam (Pipeline, PCollections, PTransforms, Runner, lecture/écriture, Utility PTransforms, side inputs), les bundles et le cycle de vie DoFn.
Sujets abordés
  • Concepts de base de Beam
  • Transformations utilitaires
  • Cycle de vie DoFn
Activités

Atelier pratique et quiz

Objectifs
  • Mettre en œuvre la logique pour gérer vos données tardives.
  • Passer en revue les différents types de triggers.
  • Passer en revue les concepts fondamentaux du streaming (PCollections non bornées, windows).
Sujets abordés
  • Windows
  • Watermarks
  • Triggers
Activités

Atelier pratique et quiz

Objectifs
  • Écrire les I/O de votre choix pour votre pipeline Dataflow.
  • Ajuster votre transformation source/sink pour des performances maximales.
  • Créer des sources et des sinks personnalisés en utilisant SDF.
Sujets abordés
  • Sources et Sinks
  • Text IO et File IO
  • BigQuery IO
  • PubSub IO
  • Kafka IO
  • Bigtable IO
  • Avro IO
  • Splittable DoFn
Activités

Quiz

Objectifs
  • Présenter les schemas, qui offrent aux développeurs un moyen d'exprimer des données structurées dans leurs pipelines Beam.
  • Utiliser les schemas pour simplifier votre code Beam et améliorer les performances de votre pipeline.
Sujets abordés
  • Beam Schemas
  • Exemples de code
Activités

Atelier pratique et quiz

Objectifs
  • Identifier les cas d'utilisation pour les implémentations des API State et Timer.
  • Sélectionner le bon type de state et de timers pour votre pipeline.
Sujets abordés
  • State API
  • Timer API
  • Résumé
Activités

Quiz

Objectifs
  • Mettre en œuvre les bonnes pratiques pour les pipelines Dataflow.
Sujets abordés
  • Schemas
  • Gestion des données non traitables
  • Gestion des erreurs
  • Générateur de code AutoValue
  • Gestion des données JSON
  • Utiliser le cycle de vie DoFn
  • Optimisations de pipeline
Activités

Atelier pratique et quiz

Objectifs
  • Développer un pipeline Beam en utilisant SQL et DataFrames.
Sujets abordés
  • Dataflow et Beam SQL
  • Windowing en SQL
  • Beam DataFrames
Activités

Atelier pratique et quiz

Objectifs
  • Prototyper votre pipeline en Python en utilisant les Beam notebooks.
  • Lancer une tâche vers Dataflow depuis un notebook.
Sujets abordés
  • Beam Notebooks
Activités

Quiz

Objectifs
  • Naviguer dans l'interface Dataflow Job Details.
  • Interpréter les graphiques de Job Metrics pour diagnostiquer les régressions de pipeline.
  • Configurer des alertes sur les tâches Dataflow en utilisant Cloud Monitoring.
Sujets abordés
  • Liste des tâches
  • Informations sur la tâche
  • Graphe de la tâche
  • Métriques de la tâche
  • Metrics Explorer
Activités

Quiz

Objectifs
  • Utiliser les logs Dataflow et les widgets de diagnostic pour résoudre les problèmes de pipeline.
Sujets abordés
  • Logging
  • Error Reporting
Activités

Quiz

Objectifs
  • Utiliser une approche structurée pour déboguer vos pipelines Dataflow.
  • Examiner les causes courantes des défaillances de pipeline.
Sujets abordés
  • Flux de travail de dépannage
  • Types de problèmes
Activités

Atelier pratique et quiz

Objectifs
  • Comprendre les considérations de performance pour les pipelines.
  • Examiner comment la forme de vos données peut affecter les performances du pipeline.
Sujets abordés
  • Conception de pipeline
  • Forme des données
  • Sources, Sinks et systèmes externes
  • Shuffle et Streaming Engine
Activités

Quiz

Objectifs
  • Approches de test pour votre pipeline Dataflow.
  • Passer en revue les frameworks et fonctionnalités disponibles pour rationaliser votre flux de travail CI/CD pour les pipelines Dataflow.
Sujets abordés
  • Aperçu des tests et du CI/CD
  • Tests unitaires
  • Tests d'intégration
  • Construction d'artefacts
  • Déploiement
Activités

Ateliers pratiques et quiz

Objectifs
  • Mettre en œuvre les bonnes pratiques de fiabilité pour vos pipelines Dataflow.
Sujets abordés
  • Introduction à la fiabilité
  • Surveillance
  • Géolocalisation
  • Reprise après sinistre
  • Haute disponibilité
Activités

Quiz

Objectifs
  • Utiliser les flex templates pour standardiser et réutiliser le code de pipeline Dataflow.
Sujets abordés
  • Classic Templates
  • Flex Templates
  • Utiliser les Flex Templates
  • Templates fournis par Google
Activités

Ateliers pratiques et quiz

Objectifs
  • Récapitulatif rapide des sujets de la formation.
Sujets abordés
  • Résumé

Formations associées

Google Cloud

Intégration de données avec Cloud Data Fusion

Ce cours de 2 jours présente aux apprenants la capacité d'intégration de données de Google Cloud à l'aide de Cloud Data Fusion. Dans ce cours, nous discutons des défis liés à l'intégration de données et de la nécessité d'une plateforme d'intégration de données (middleware). Nous discutons ensuite de la manière dont Cloud Data Fusion peut aider à intégrer efficacement les données provenant d'une variété de sources et de formats et à générer des informations. Nous examinons les principaux composants de Cloud Data Fusion et leur fonctionnement, comment traiter les données par lots et les données en streaming en temps réel avec une conception de pipeline visuelle, un suivi riche des métadonnées et de la lignée des données, et comment déployer des pipelines de données sur divers moteurs d'exécution.

2 j
Intermédiaire
Google Cloud

Gérer un maillage de données avec Dataplex

Dataplex est une fabrique de données intelligente qui permet aux organisations de découvrir, gérer, surveiller et gouverner de manière centralisée leurs données à travers les lacs de données, les entrepôts de données et les datamarts. Vous pouvez utiliser Dataplex pour construire une architecture de maillage de données afin de décentraliser la propriété des données entre les propriétaires de domaines de données. Dans ce cours, vous apprendrez à découvrir, gérer, surveiller et gouverner vos données à travers les lacs de données, les entrepôts de données et les datamarts grâce à des conférences guidées et des exercices indépendants utilisant des données d'exemple.

2 j
Intermédiaire

Prochaines sessions

Aucune date ne vous convient ?

Nous organisons régulièrement de nouvelles sessions. Contactez-nous pour connaître les prochaines dates disponibles ou pour organiser une session à la date de votre choix.

S'inscrire à une date personnalisée

Processus Qualité

L'engagement de SFEIR Institute : une démarche d'excellence pour garantir la qualité et la réussite de toutes nos formations. En savoir plus sur notre démarche qualité

Méthodes pédagogiques mobilisées
  • Lectures / Apports théoriques (Slides)Présentation de concepts via des supports visuels (PowerPoint, PDF).
  • Démonstration technique (Démos)Le formateur réalise une manipulation ou une procédure devant les apprenants.
  • Laboratoires dirigés (Labs)Mise en pratique guidée sur logiciel, machine ou environnement technique.
  • Quiz / QCMTest rapide de connaissances (format papier ou numérique type Kahoot/Klaxoon).
Dispositif d'évaluation et de suivi

L'atteinte des objectifs de la formation est évaluée à plusieurs niveaux pour garantir la qualité de la prestation :

  • Évaluation continue des acquis : Vérification des connaissances tout au long de la formation via des méthodes participatives (en fonction de la formation: quiz, exercices pratiques, mises en situation) sous la supervision du formateur.
  • Mesure de la progression : Dispositif d'auto-évaluation comparatif comprenant un diagnostic initial pour situer le niveau de départ, suivi d'une évaluation finale pour valider l'évolution des compétences.
  • Évaluation de la qualité : Questionnaire de satisfaction en fin de session pour mesurer la pertinence et l'efficacité de la formation ressentie par les participants.

Questions fréquentes

Aux praticiens du big data et aux ingénieurs data qui construisent déjà des applications de traitement de données et souhaitent approfondir leur maîtrise de Dataflow et d'Apache Beam.
Une expérience du traitement de données et une bonne connaissance de Google Cloud sont recommandées. Une familiarité avec les concepts d'Apache Beam est un atout, car il s'agit d'une formation avancée (300).
Vous apprendrez comment Apache Beam et Dataflow fonctionnent ensemble, à développer des pipelines batch et streaming, à optimiser les performances (Shuffle, Streaming Engine, Flexible Resource Scheduling) et à appliquer les bonnes pratiques de sécurité, de tests, de CI/CD et de fiabilité.
Oui. La formation couvre les fenêtres, watermarks et triggers, l'état et les timers, les sources et sinks, ainsi que le Streaming Engine pour des pipelines streaming hautes performances.
Il s'agit d'une formation avancée (niveau 300) d'une durée de 3 jours, alternant théorie, démonstrations et ateliers pratiques.
Nos organismes de formation SFEIR SAS et SFEIR-Est sont certifiés Qualiopi pour les actions de formation. Contactez-nous pour obtenir un devis.

2 370€ HT

par apprenant