GCP200DE

Ingénierie des données sur Google Cloud

Acquérez une expérience pratique dans la conception et la création de systèmes de traitement de données sur Google Cloud. Ce cours utilise des présentations, des démonstrations et des travaux pratiques pour vous montrer comment concevoir des systèmes de traitement de données, créer des pipelines de données de bout en bout, analyser des données et implémenter le machine learning. Ce cours couvre les données structurees, non structurees et en streaming.

Ce cours est composé des quatre formations suivantes :

  • Introduction à l'ingénierie des données sur Google Cloud
  • Construire des lacs de données et des entrepôts de données avec Google Cloud
  • Construire des pipelines de données en batch sur Google Cloud
  • Construire des pipelines de données en streaming sur Google Cloud
Google Cloud
Formation officielle Google CloudNiveau Intermédiaire⏱️ 4 jours (28h)

Ce que vous allez apprendre

  • Concevoir des systèmes de traitement de données évolutifs dans Google Cloud.
  • Différencier les architectures de données et implémenter les concepts de lakehouse et de pipelines de données.
  • Construire et gérer des pipelines de données robustes en streaming et en batch.
  • Utiliser les outils IA/ML pour optimiser les performances et obtenir des informations sur les processus et les données.

Prérequis

  • Compréhension des principes d'ingénierie des données, y compris les processus ETL/ELT, la modélisation des données et les formats de données courants (Avro, Parquet, JSON).
  • Familiarité avec les concepts d'architecture de données, en particulier les entrepôts de données (Data Warehouses) et les lacs de données (Data Lakes).
  • Maîtrise de SQL pour l'interrogation des données.
  • Maîtrise d'un langage de programmation courant (Python recommandé).
  • Familiarité avec l'utilisation des interfaces de ligne de commande (CLI).
  • Familiarité avec les concepts et services de base de Google Cloud (Compute, Storage et gestion des identites).

Public cible

  • Ingénieurs de données, Analystes de données, Architectes de données

Programme de la Formation

19 modules pour maîtriser les fondamentaux

Cours 1 : Introduction à l'ingénierie des données sur Google Cloud

Objectifs
  • Expliquer le rôle d'un ingénieur de données.
  • Comprendre les différences entre une source de données et un récepteur de données.
  • Expliquer les différents types de formats de données.
  • Expliquer les options de solutions de stockage sur Google Cloud.
  • Découvrir les options de gestion des métadonnées sur Google Cloud.
  • Comprendre comment partager facilement des jeux de données avec Analytics Hub.
  • Comprendre comment charger des données dans BigQuery à l'aide de la console Google Cloud ou de la CLI gcloud.
Sujets abordés
  • Le rôle d'un ingénieur de données
  • Sources de données versus récepteurs de données
  • Formats de données
  • Options de solutions de stockage sur Google Cloud
  • Options de gestion des métadonnées sur Google Cloud
  • Partage de jeux de données avec Analytics Hub
Activités

Lab : Chargement de données dans BigQuery

Quiz

Objectifs
  • Expliquer l'architecture de base de réplication et de migration de données de Google Cloud.
  • Comprendre les options et les cas d'utilisation de l'outil de ligne de commande gcloud.
  • Expliquer la fonctionnalité et les cas d'utilisation de Storage Transfer Service.
  • Expliquer la fonctionnalité et les cas d'utilisation de Transfer Appliance.
  • Comprendre les fonctionnalités et le déploiement de Datastream.
Sujets abordés
  • Architecture de réplication et de migration
  • L'outil de ligne de commande gcloud
  • Déplacement de jeux de données
  • Datastream
Objectifs
  • Expliquer le schéma d'architecture de base d'extraction et de chargement.
  • Comprendre les options de l'outil de ligne de commande bq.
  • Expliquer la fonctionnalité et les cas d'utilisation du service de transfert de données BigQuery.
  • Expliquer la fonctionnalité et les cas d'utilisation de BigLake en tant que modèle sans extraction-chargement.
Sujets abordés
  • Architecture d'extraction et de chargement
  • L'outil de ligne de commande bq
  • Service de transfert de données BigQuery
  • BigLake
Activités

Lab : BigLake : Démarrage rapide

Quiz

Objectifs
  • Expliquer le schéma d'architecture de base d'extraction, de chargement et de transformation.
  • Comprendre un pipeline ELT courant sur Google Cloud.
  • Découvrir les capacités de scripting SQL et de planification de BigQuery.
  • Expliquer la fonctionnalité et les cas d'utilisation de Dataform.
Sujets abordés
  • Architecture d'extraction, de chargement et de transformation (ELT)
  • Scripting SQL et planification avec BigQuery
  • Dataform
Activités

Lab : Créer et exécuter un workflow SQL dans Dataform

Quiz

Objectifs
  • Expliquer le schéma d'architecture de base d'extraction, de transformation et de chargement.
  • Découvrir les outils d'interface graphique sur Google Cloud utilisés pour les pipelines de données ETL.
  • Expliquer le traitement des données en batch avec Dataproc.
  • Apprendre à utiliser Dataproc Serverless pour Spark pour l'ETL.
  • Expliquer les options de traitement des données en streaming.
  • Expliquer le rôle que joue Bigtable dans les pipelines de données.
Sujets abordés
  • Architecture d'extraction, de transformation et de chargement (ETL)
  • Outils d'interface graphique Google Cloud pour les pipelines de données ETL
  • Traitement de données en batch avec Dataproc
  • Options de traitement de données en streaming
  • Bigtable et pipelines de données
Activités

Lab : Utiliser Dataproc Serverless pour Spark pour charger BigQuery (optionnel)

Lab : Créer un pipeline de données en streaming pour un tableau de bord en temps réel avec Dataflow

Quiz

Objectifs
  • Expliquer les modèles d'automatisation et les options disponibles pour les pipelines.
  • Découvrir Cloud Scheduler et Workflows.
  • Découvrir Cloud Composer.
  • Découvrir Cloud Run Functions.
  • Expliquer la fonctionnalité et les cas d'utilisation d'automatisation pour Eventarc.
Sujets abordés
  • Modèles d'automatisation et options pour les pipelines
  • Cloud Scheduler et Workflows
  • Cloud Composer
  • Cloud Run Functions
  • Eventarc
Activités

Lab : Utiliser Cloud Run Functions pour charger BigQuery (optionnel)

Quiz

Cours 2 : Construire des lacs de données et des entrepôts de données avec Google Cloud

Objectifs
  • Comparer et contraster les architectures de lac de données, d'entrepôt de données et de lakehouse de données.
  • Évaluer les avantages de l'approche lakehouse.
Sujets abordés
  • Les classiques : Lacs de données et entrepôts de données
  • L'approche moderne : Data lakehouse
  • Choisir la bonne architecture
Activités

Quiz

Objectifs
  • Discuter des options de stockage de données, y compris Cloud Storage pour les fichiers, les formats de table ouverts comme Apache Iceberg, BigQuery pour les données analytiques et AlloyDB pour les données opérationnelles.
  • Comprendre le rôle d'AlloyDB pour les cas d'utilisation de données opérationnelles.
Sujets abordés
  • Construire une fondation de lac de données
  • Introduction au format de table ouvert Apache Iceberg
  • BigQuery comme moteur de traitement central
  • Combiner les données opérationnelles dans AlloyDB
  • Combiner les données opérationnelles et analytiques avec les requêtes fédérées
  • Cas d'utilisation réel
Activités

Quiz

Lab : Requete federee avec BigQuery

Objectifs
  • Expliquer pourquoi BigQuery est une solution d'entreposage de données évolutive sur Google Cloud.
  • Discuter des concepts de base de BigQuery.
  • Comprendre le rôle de BigLake dans la création d'une architecture lakehouse unifiée et son intégration avec BigQuery pour les données externes.
  • Apprendre comment BigQuery interagit nativement avec les tables Apache Iceberg via BigLake.
Sujets abordés
  • Fondamentaux de BigQuery
  • Partitionnement et clustering dans BigQuery
  • Introduction a BigLake et aux tables externes
Activités

Quiz

Lab : Interroger des données externes et des tables Iceberg

Objectifs
  • Implémenter des pratiques robustes de gouvernance et de sécurité des données sur la plateforme de données unifiée, y compris la protection des données sensibles et la gestion des métadonnées.
  • Explorer l'analytique avancée et le machine learning directement sur les données du lakehouse.
Sujets abordés
  • Gouvernance et sécurité des données dans une plateforme unifiée
  • Demo : Prévention de la perte de données
  • Analytique et machine learning sur le lakehouse
  • Architectures lakehouse réelles et stratégies de migration
Activités

Quiz

Objectifs
  • Renforcer les principes fondamentaux de la plateforme de données de Google Cloud.
Sujets abordés
  • Révision
  • Bonnes pratiques
Activités

Lab : Démarrer avec BigQuery ML

Lab : Recherche vectorielle avec BigQuery

Cours 3 : Construire des pipelines de données en batch sur Google Cloud

Objectifs
  • Expliquer le rôle critique d'un ingénieur de données dans le développement et la maintenance des pipelines de données en batch.
  • Décrire les composants de base et le cycle de vie typique des pipelines de données en batch, de l'ingestion à la consommation en aval.
  • Analyser les défis courants du traitement de données en batch, tels que le volume de données, la qualité, la complexite et la fiabilité, et identifier les services Google Cloud clés qui peuvent les résoudre.
Sujets abordés
  • Pipelines de données en batch et leurs cas d'utilisation
  • Traitement et défis courants
Activités

Quiz

Objectifs
  • Concevoir des pipelines de données en batch évolutifs pour l'ingestion et la transformation de données à haut volume.
  • Optimiser les jobs en batch pour un haut débit et une efficacité des coûts en utilisant diverses techniques de gestion des ressources et d'ajustement des performances.
Sujets abordés
  • Concevoir des pipelines en batch
  • Transformations de données à grande échelle
  • Dataflow et Serverless pour Apache Spark
  • Connexions de données et orchestration
  • Exécuter un pipeline Apache Spark
  • Optimiser les performances des pipelines en batch
Activités

Quiz

Lab : Construire un pipeline de données en batch simple avec Serverless pour Apache Spark (optionnel)

Lab : Construire un pipeline de données en batch simple avec l'interface Dataflow Job Builder (optionnel)

Objectifs
  • Développer des règles de validation des données et une logique de nettoyage pour assurer la qualité des données dans les pipelines en batch.
  • Implémenter des stratégies pour gérer l'évolution des schémas et effectuer la déduplication des données dans les grands jeux de données.
Sujets abordés
  • Validation et nettoyage des données en batch
  • Journaliser et analyser les erreurs
  • Évolution des schémas pour les pipelines en batch
  • Intégrité des données et duplication
  • Déduplication avec Serverless pour Apache Spark
  • Déduplication avec Dataflow
Activités

Lab : Valider la qualité des données dans un pipeline en batch avec Serverless pour Apache Spark (optionnel)

Quiz

Objectifs
  • Orchestrer des workflows de pipelines de données en batch complexes pour une planification efficace et un suivi de lignage.
  • Implémenter une gestion robuste des erreurs, une surveillance et une observabilité pour les pipelines de données en batch.
Sujets abordés
  • Orchestration pour le traitement en batch
  • Cloud Composer
  • Observabilité unifiée
  • Alertes et dépannage
  • Gestion visuelle des pipelines
Activités

Lab : Construire des pipelines en batch dans Cloud Data Fusion

Quiz

Cours 4 : Construire des pipelines de données en streaming sur Google Cloud

Objectifs
  • Introduire les objectifs d'apprentissage du cours et le scénario qui sera utilisé pour apporter un apprentissage pratique à la construction de pipelines de données en streaming.
  • Décrire le concept de pipelines de données en streaming, les défis associes et le rôle de ces pipelines dans le processus d'ingénierie des données.
Sujets abordés
  • Objectifs d'apprentissage du cours
  • Prérequis du cours
  • Le cas d'utilisation
  • À propos de l'entreprise
  • Le défi
  • La mission
Objectifs
  • Comprendre les différents cas d'utilisation du streaming et leurs applications, y compris le Streaming ETL, le Streaming IA/ML, les applications de streaming et le Reverse ETL.
  • Identifier et décrire les architectures types courantes pour les données en streaming, y compris le Streaming ETL, le Streaming IA/ML, les applications de streaming et le Reverse ETL.
Sujets abordés
  • Introduction aux pipelines de données en streaming sur Google Cloud
  • Streaming ETL
  • Streaming IA/ML
  • Applications de streaming
  • Reverse ETL
Activités

Quiz

Objectifs
  • Pub/Sub et Managed Service for Apache Kafka : Définir les concepts de messagerie, savoir quand utiliser Pub/Sub ou Managed Service for Apache Kafka.
  • Dataflow : Décrire le service et les défis avec les données en streaming, construire et déployer un pipeline de streaming.
  • BigQuery : Explorer les différentes méthodes d'ingestion de données, utiliser les requêtes continues BigQuery, BigQuery ETL et le reverse ETL, configurer le streaming Pub/Sub vers BigQuery, architecturer les pipelines de streaming BigQuery.
  • Bigtable : Décrire la vue d'ensemble du mouvement et de l'interaction des données, établir un pipeline de streaming de Dataflow vers Bigtable, analyser le flux de données continu Bigtable pour les tendances avec BigQuery, synchroniser l'analyse des tendances dans l'application utilisateur.
Sujets abordés
  • Comprendre les produits
  • Considérations architecturales pour Pub/Sub et Managed Service for Apache Kafka
  • Dataflow : Le moteur de traitement puissant
  • BigQuery : Le moteur analytique
  • Bigtable : La solution pour les données opérationnelles
Activités

Lab : Streamer des données avec des pipelines - Cas d'utilisation Esports (optionnel)

Quiz

Lab : Utiliser Apache Beam et Bigtable pour enrichir les données de contenu téléchargeables (DLC) esports

Quiz

Lab : Streamer des données e-sports avec Pub/Sub et BigQuery

Quiz

Lab : Surveiller le chat e-sports avec Streamlit

Quiz

Sujets abordés
  • Ce que vous avez accompli
  • Prochaines étapes

Formations associées

Google Cloud

Laboratoire de Solutions de Données

Le Laboratoire de Solutions d'Ingénierie des Données (DSL) est une expérience d'apprentissage immersive et ciblée de 10 jours qui améliore rapidement les compétences de votre équipe sur les principes et les meilleures pratiques de l'ingénierie des données de Google Cloud. Le programme combine cinq jours de sessions de formation dirigées par des experts sur des concepts clés de l'ingénierie des données (par exemple, l'entreposage de données, les pipelines, la qualité des données) avec des laboratoires pratiques et un projet final collaboratif de cinq jours. Le projet final met les participants au défi de résoudre un cas d'utilisation du monde réel en utilisant les outils de Google Cloud.

10 j
Avancé
Google Cloud

Introduction à l'Analyse de Données sur Google Cloud

Ce cours est une introduction à l'analyse de données sur Google Cloud. Il est conçu pour les apprenants qui n'ont aucune expérience préalable de l'analyse de données ou de Google Cloud. Le cours couvre les bases de l'analyse de données, y compris la collecte, le stockage, l'exploration, la visualisation et le partage. Il présente également aux apprenants les outils et services d'analyse de données de Google Cloud. À travers des conférences vidéo, des démos, des quiz et des travaux pratiques, le cours montre comment passer des données brutes à des visualisations et des tableaux de bord percutants.

1 j
Fondamental

Prochaines sessions

29 juin 2026
Distanciel • Français
S'inscrire
31 août 2026
Distanciel • Français
S'inscrire
26 octobre 2026
Distanciel • Français
S'inscrire
14 décembre 2026
Distanciel • Français
S'inscrire

Processus Qualité

L'engagement de SFEIR Institute : une démarche d'excellence pour garantir la qualité et la réussite de toutes nos formations. En savoir plus sur notre démarche qualité

Méthodes pédagogiques mobilisées
  • Lectures / Apports théoriques (Slides)Présentation de concepts via des supports visuels (PowerPoint, PDF).
  • Démonstration technique (Démos)Le formateur réalise une manipulation ou une procédure devant les apprenants.
  • Laboratoires dirigés (Labs)Mise en pratique guidée sur logiciel, machine ou environnement technique.
  • Quiz / QCMTest rapide de connaissances (format papier ou numérique type Kahoot/Klaxoon).
Dispositif d'évaluation et de suivi

L'atteinte des objectifs de la formation est évaluée à plusieurs niveaux pour garantir la qualité de la prestation :

  • Évaluation continue des acquis : Vérification des connaissances tout au long de la formation via des méthodes participatives (en fonction de la formation: quiz, exercices pratiques, mises en situation) sous la supervision du formateur.
  • Mesure de la progression : Dispositif d'auto-évaluation comparatif comprenant un diagnostic initial pour situer le niveau de départ, suivi d'une évaluation finale pour valider l'évolution des compétences.
  • Évaluation de la qualité : Questionnaire de satisfaction en fin de session pour mesurer la pertinence et l'efficacité de la formation ressentie par les participants.

3 160€ HT

par apprenant