Ingénierie des données sur Google Cloud

Ce cours d'ingénierie des données sur Google Cloud Ce cours de 4 jours offre une formation complète sur la conception, la construction et l'exploitation des systèmes de traitement de données. Google Cloud Plateforme (GCP)Les participants travailleront avec les principaux services d'ingénierie des données tels que BigQuery, Dataflow, Dataproc, Pub/Sub, Dataplex et Cloud Stockage : exploration des concepts modernes d’ingestion, de stockage, de transformation, d’analyse et d’orchestration des données.

La formation comprend des démonstrations, des ateliers pratiques et des scénarios concrets, guidant les participants dans la construction de pipelines évolutifs, l'optimisation des performances et la mise en œuvre d'architectures de données robustes. cloud.

A qui s'adresse-t-il ?

Cours d'ingénierie des données sur Google Cloud Il est recommandé pour :
• les ingénieurs de données qui construisent ou gèrent des pipelines dans cloud
• spécialistes Big Data migration vers l'écosystème Google Cloud
• administrateurs de bases de données et spécialistes ETL
• Ingénieurs analystes travaillant avec BigQuery
• les professionnels se préparant à la certification Ingénieur de données, sur l'itinéraire officiel de Google Cloud

Qu'allez-vous apprendre ?

À la fin du cours Data Engineering on Google Cloud, les participants pourront :
• Concevoir des systèmes de traitement de données évolutifs dans GCP
• Créer des pipelines de traitement par lots et en continu à l'aide des services Google Cloud
• Mettre en œuvre des modèles de données et des flux de bout en bout
• Exploiter les systèmes de données en mettant l'accent sur la fiabilité, la sécurité et le coût
• Appliquer les meilleures pratiques en matière d'automatisation, d'orchestration et d'optimisation

Conditions préalables:

  • connaissances de base en SQL
  • recommandé : expérience dans un langage de programmation (Python, Java, etc.)
  • comprendre les concepts fondamentaux de cloud

Calendrier des cours :

Les supports de cours sont en anglais. L'enseignement se fait en roumain.

Module 01 – Tâches et composants d'ingénierie des données

  • le rôle d'un ingénieur de données
    • Sources de données vs. récepteurs de données
    • formats de données
    • Options de stockage Google Cloud
    • Gestion des métadonnées
    • partage des ensembles de données avec Analytics Hub
    Lab: Chargement des données dans BigQuery

Module 02 – Réplication et migration des données

  • architecture de réplication et de migration
    • gcloud CLI
    • déplacer des ensembles de données
    • Flux de données et cas d'utilisation
    Lab: Réplication PostgreSQL → BigQuery avec Datastream

Module 03 – Modèle de pipeline d'extraction et de chargement (EL)

  • Architecture EL
    • bq CLI
    • Service de transfert de données BigQuery
    • BigLake comme alternative à EL
    Lab: Démarrage rapide de Big Lake

Module 04 – Modèle d'extraction, de chargement et de transformation (ELT)

  • Architecture ELT
    • Scripting et planification SQL dans BigQuery
    • Formulaire de données
    Lab: Créer et exécuter un flux de travail SQL dans Dataform

Module 05 – Modèle d'extraction, de transformation et de chargement (ETL)

  • architecture ETL
    • Outils d'interface graphique dans Google Cloud
    • Traitement par lots avec Dataproc
    • Traitement en flux continu – options
    • Bigtable dans les pipelines de données
    Des laboratoires:
    • Dataproc Serverless pour Spark → Charger BigQuery
    • Tableau de bord Dataflow en temps réel Pipeline

Module 06 – Techniques d'automatisation

  • modèles d'automatisation
    • Cloud Planificateur et flux de travail
    • Cloud Compositeur
    • Cloud Fonctions d'exécution
    • Eventarc
    Lab: Cloud Exécuter les fonctions → Charger BigQuery

Module 07 – Introduction à l'ingénierie des données

  • le rôle de l'ingénieur de données
    • Défis liés à l'ingénierie des données
    • Introduction à BigQuery
    • lacs de données vs. entrepôts de données
    • gouvernance, accès et collaboration
    • étude de cas
    Lab: Utilisation de BigQuery pour l'analyse

Module 08 – Créer un lac de données

  • architecture du lac de données
    • options de stockage et d'ETL
    • Cloud Le stockage comme lac de données principal
    • sécurité Cloud Stockage
    • utiliser Cloud SQL
    Lab: Chargement des données de taxi dans Cloud SQL

Module 09 – Créer un entrepôt de données

  • architecture moderne d'entrepôt de données
    • BigQuery – concepts, chargement des données
    • explorer les schémas
    • champs imbriqués et répétés
    • partitionnement et clustering
    Des laboratoires:
    • Gestion des données JSON et des tableaux dans BigQuery
    • Tables partitionnées dans BigQuery

Module 10 – Introduction à la construction de pipelines par lots

  • EL / ELT / ETL
    • qualité des données
    • Exécution d'opérations dans BigQuery
    Démo: ELT pour améliorer la qualité des données

Module 11 – Exécuter Spark sur Dataproc

  • L'écosystème Hadoop
    • Exécution de charges de travail sur Dataproc
    • utiliser Cloud Stockage au lieu de HDFS
    • Optimisation des processus de données
    Lab: Exécution de tâches Spark sur Dataproc

Module 12 – Traitement des données sans serveur avec Dataflow

  • Introduction au flux de données
    • agrégations, entrées auxiliaires, fenêtrage
    • Flux de données et modèles SQL
    Des laboratoires:
    • Flux de données simple Pipeline
    • MapReduce dans Beam
    • Entrées latérales

Module 13 – Gérer les pipelines avec Cloud Fusion de données et Cloud Compositeur

  • Création de pipelines visuels avec Data Fusion
    • Wrangler – exploration et transformation des données
    • orchestration avec Cloud Compositeur
    • Flux d'air : DAG, opérateurs, flux de travail
    Des laboratoires:
    • Élaborer et exécuter Pipeline fusion de données
    • Introduction à Cloud Compositeur

Module 14 – Introduction au traitement des données en flux continu

  • concepts de streaming
    • Outils GCP pour le streaming

Module 15 – Messagerie sans serveur avec Pub/Sub

  • Pub/Sub push vs pull
    • Publication par code
    Lab: Publier les données en flux continu dans Pub/Sub

Module 16 – Fonctionnalités de flux de données

  • défis de streaming
    • fenêtrage, latence, déclencheurs
    Lab: Données en continu Pipelines

Module 17 – Streaming à haut débit BigQuery et Bigtable

  • diffusion en continu dans BigQuery + tableaux de bord
    • Ingestion à haut débit dans Bigtable
    • Optimisation de Bigtable
    Des laboratoires:
    • Analyses de flux et tableaux de bord
    • Diffusion en continu sur Bigtable

Module 18 – Fonctionnalités et performances avancées de BigQuery

  • fonctions de fenêtre analytiques
    • Fonctions SIG
    • Optimisation BigQuery
    Lab: Optimisation des requêtes BigQuery

Nonă : Le programme peut être modifié en fonction du formateur désigné. Pour obtenir la version finale, veuillez contacter l'équipe. Bittnet Training.

Nous vous recommandons de continuer avec :

Ces cours étendent la formation d'un ingénieur de données aux domaines de l'apprentissage automatique et de l'IA, pertinents pour les projets avancés basés sur BigQuery ML, Dataflow ML et les modèles personnalisés.

Programmes de certification

Ce cours fait partie du parcours officiel de certification Professional Data Engineer et constitue le socle de connaissances recommandé par Google. Cloud pour ce rôle.

FAQ du cours Data Engineering sur Google Cloud

En quoi un cours intitulé « Ingénierie des données chez Google » contribue-t-il ? Cloud« pour augmenter le retour sur investissement dans une organisation ? »

Ingénieurs de données en formation chez Google Cloud Cette solution optimise la gestion des flux de données volumineux, automatise leur traitement et en extrait des informations précieuses. Elle réduit ainsi les coûts liés aux erreurs manuelles, accélère la réalisation des projets analytiques et favorise la prise de décisions commerciales fondées sur les données, ce qui se traduit par un retour sur investissement significatif grâce à une efficacité opérationnelle accrue et à des décisions stratégiques plus rapides.

Pourquoi la formation BigQuery est-elle essentielle pour les entreprises axées sur les données ?

BigQuery offre un stockage et des analyses à l'échelle du pétaoctet à des coûts prévisibles. Les entreprises qui maîtrisent BigQuery peuvent transformer de grands volumes de données en informations exploitables sans investissements massifs dans l'infrastructure, réduisant ainsi le coût total de possession et maximisant le retour sur investissement en matière d'analyse.

Comment Google optimise Cloud PipelineLes données et leur impact sur les coûts ?

Pipeline-données gérées dans Google Cloud L'automatisation permet un traitement des données automatisé et évolutif. Elle élimine les tâches répétitives et les erreurs associées, réduisant ainsi les coûts d'exploitation et les délais de développement, ce qui engendre des avantages financiers directs.

Quel est le rôle de Dataflow dans la transformation et l'intégration des données, et quel est son impact sur le retour sur investissement ?

Dataflow propose un traitement unifié pour le flux continu et le traitement par lots, avec une mise à l'échelle automatique. Cela réduit la complexité architecturale et le besoin de coordination entre différents outils, ce qui permet de diminuer les coûts d'exploitation et d'accélérer les délais de réponse des projets de données.

Comment ce cours favorise l'adoption pratique de l'ETL/ELT chez Google Cloud?

Ce cours est axé sur les techniques d'extraction, de transformation et de chargement des données à l'aide d'outils natifs tels que Dataflow et Dataprep, ce qui permet aux équipes de construire des pipelines rentables et évolutifs, d'éliminer les silos de données et d'accroître la valeur des données pour l'entreprise.

Comment cela réduit-il ? Cloud Coûts de stockage des données à grande échelle ?

Cloud Le stockage offre une solution durable et évolutive, avec un coût à l'usage. Cette flexibilité permet aux organisations d'optimiser leurs budgets pour les données inactives ou rarement consultées grâce à des politiques d'archivage efficaces, réduisant ainsi le coût total de possession et maximisant l'utilisation des ressources.

Quels sont les avantages de l'intégration Dataproc pour le traitement Hadoop/Spark et quel est son impact sur l'efficacité ?

Dataproc permet d'exécuter des clusters Hadoop et Spark à la demande, à moindre coût et avec une mise à l'échelle rapide. Vous n'avez plus besoin de gérer les clusters en permanence et les coûts d'infrastructure traditionnels sont minimisés, ce qui représente des économies considérables et une flexibilité accrue pour vos opérations. big data.

Comment les connaissances en matière de sécurité et de gouvernance contribuent à l'ingénierie des données chez Google Cloud?

La mise en œuvre de bonnes pratiques de sécurité et de gouvernance garantit la protection des données sensibles et la conformité réglementaire. Elle réduit ainsi les risques d'amendes, d'atteinte à la réputation et d'incidents coûteux, préservant le chiffre d'affaires et assurant la continuité des activités de manière rentable.

Pourquoi est-il important, dans les projets de données, de pouvoir optimiser les coûts de traitement et de stockage ?

L'optimisation des coûts de traitement et de stockage est essentielle à la gestion des budgets informatiques. Des équipes bien préparées peuvent mettre en œuvre des politiques d'optimisation permettant de réduire les dépenses mensuelles sans compromettre les performances, ce qui accroît la rentabilité et le retour sur investissement à long terme.

Comment la formation en ingénierie des données chez Google peut-elle être utile ? Cloud accélérer l'innovation au sein de l'organisation ?

Les compétences en ingénierie des données permettent aux organisations d'exploiter stratégiquement leurs données, de générer des analyses prédictives, d'optimiser leurs opérations et de créer des produits numériques innovants. Cette capacité à produire des informations concurrentielles se traduit par une augmentation du chiffre d'affaires et un avantage concurrentiel durable.

Pourquoi cette page m'est-elle présentée ?

Cette page s'affiche suite à vos recherches incluant des termes tels que : « ingénierie des données » sur Google. cloud, ingénieur de données professionnel certifié Google, ingénieur de données GCP, Google cloud Ingénieur de données, Google cloud Ingénieur de données professionnel, Google cloud Ingénieur de données professionnel certifié, ingénieur de données professionnel Google, ingénieur de données Google, ingénieur de données certifié Google, ingénieur de données professionnel, ingénieur de données professionnel GCP, ingénieur de données Google, Google cloud Ingénieur de données certifié, ingénieur de données professionnel Google, ingénieur de données GCP, Google cloud database ingénieur, ingénierie des données sur Google cloud plateforme, gcp cloud Ingénieur de données, ingénieur de données professionnel certifié, Google cloud Ingénieur de données de plateforme, ingénieur de données chez Google, ingénierie des données avec Google cloudingénieur de données professionnel chez Google cloudIngénieur GCP, ingénieur de données certifié GCP, GCP pour ingénieur de données, ingénierie des données avec Google cloud plateforme, ingénieur de données professionnel gcp, ingénierie des données sur Google cloud spécialisation plateforme, ingénieur de données chez Google cloud, cloud Ingénieur de données GCP, ingénieur de données professionnel certifié GCP, ingénierie des données avec GCP, ingénieur en apprentissage automatique chez Google, Google database ingénieur, ingénieur de données professionnel sur Google cloud plateforme, ingénierie des données dans GCP, Google officiel cloud ingénieur de données professionnel certifié, cloud Ingénieur de données chez Google, ingénieur de données chez Google cloudingénierie des données Google cloud Plate-forme, big data Ingénieur chez Google ou autres.

Ingénierie des données sur Google Cloud

Offres personnalisées pour les groupes d'au moins 2 personnes

Détails du cours

Durée :

4
jours

Pré :

Sur demande

Livraison:

Enseignement en classe, classe hybride, classe virtuelle

Niveau:

2. Intermédiaire

Les rôles:

analystes de données, Cloud Ingénieur, Ingénieur de données, Database Connaissances