Ingeniería de datos en Google Cloud

Este curso de Ingeniería de Datos en Google Cloud El curso de 4 días proporciona una formación completa para el diseño, construcción y operación de sistemas de procesamiento de datos en Google Cloud Platform (GCP)Los participantes trabajarán con los principales servicios de ingeniería de datos como BigQuery, Dataflow, Dataproc, Pub/Sub, Dataplex y Cloud Almacenamiento, explorando conceptos modernos de ingesta, almacenamiento, transformación, análisis y orquestación de datos.

La capacitación incluye demostraciones, laboratorios prácticos y escenarios del mundo real, que guían a los participantes a construir canales escalables, optimizar el rendimiento e implementar arquitecturas de datos sólidas en cloud.

¿A quién está dirigido?

Curso de Ingeniería de Datos en Google Cloud Se recomienda para:
• ingenieros de datos que construyen o gestionan pipelines en cloud
• especialistas Big Data migrando al ecosistema de Google Cloud
• administradores de bases de datos y especialistas en ETL
• ingenieros analíticos que trabajan con BigQuery
• profesionales que se preparan para la certificación Ingeniero de datos, dentro de la ruta oficial de Google Cloud

¿Que aprenderás?

Al finalizar el curso de Ingeniería de Datos en Google CloudLos participantes podrán:
• diseñar sistemas de procesamiento de datos escalables en GCP
• crear canalizaciones de procesamiento por lotes y de transmisión mediante los servicios de Google Cloud
• Implementar modelos de datos y flujos de extremo a extremo
• operar sistemas de datos con un enfoque en la confiabilidad, seguridad y costos
• aplicar las mejores prácticas para la automatización, orquestación y optimización

requisitos previos:

  • conocimientos básicos de SQL
  • Recomendado: experiencia en algún lenguaje de programación (Python, Java, etc.)
  • comprender los conceptos fundamentales de cloud

Calendario de cursos:

Los materiales del curso están en inglés. La enseñanza se realiza en rumano.

Módulo 01 – Tareas y componentes de ingeniería de datos

  • El papel de un ingeniero de datos
    • fuentes de datos vs. sumideros de datos
    • formatos de datos
    • Opciones de almacenamiento de Google Cloud
    • gestión de metadatos
    • compartir conjuntos de datos con Analytics Hub
    Laboratorio: Carga de datos en BigQuery

Módulo 02 – Replicación y migración de datos

  • arquitectura de replicación y migración
    • gcloud CLI
    • mover conjuntos de datos
    • Flujo de datos y casos de uso
    Laboratorio: Replicación de PostgreSQL → BigQuery con Datastream

Módulo 03 – Extraer y cargar patrón de canalización (EL)

  • Arquitectura EL
    • CLI de bq
    • Servicio de transferencia de datos de BigQuery
    • BigLake como alternativa a EL
    Laboratorio: Inicio rápido de BigLake

Módulo 04 – Extraer, cargar y transformar patrones (ELT)

  • Arquitectura ELT
    • Scripting y programación SQL en BigQuery
    • Formulario de datos
    Laboratorio: Crear y ejecutar un flujo de trabajo SQL en Dataform

Módulo 05 – Extracción, transformación y carga de patrones (ETL)

  • Arquitectura ETL
    • Herramientas GUI en Google Cloud
    • procesamiento por lotes con Dataproc
    • Procesamiento de streaming: opciones
    • Bigtable en canalizaciones de datos
    Laboratorios:
    • Dataproc Serverless para Spark → Cargar BigQuery
    • Panel de control de flujo de datos en tiempo real Pipeline

Módulo 06 – Técnicas de automatización

  • patrones de automatización
    • Cloud Programador y flujos de trabajo
    • Cloud Compositor
    • Cloud Ejecutar funciones
    • Eventarc
    Laboratorio: Cloud Ejecutar funciones → Cargar BigQuery

Módulo 07 – Introducción a la ingeniería de datos

  • El papel del ingeniero de datos
    • desafíos de ingeniería de datos
    • Introducción a BigQuery
    • lagos de datos vs. almacenes de datos
    • gobernanza, acceso y colaboración
    • estudio de caso
    Laboratorio: Uso de BigQuery para análisis

Módulo 08 – Construir un lago de datos

  • arquitectura del lago de datos
    • opciones de almacenamiento y ETL
    • Cloud El almacenamiento como principal lago de datos
    • seguridad Cloud Almacenaje
    • usar Cloud SQL
    Laboratorio: Cargando datos de taxi en Cloud SQL

Módulo 09 – Construir un almacén de datos

  • arquitectura moderna de almacenamiento de datos
    • BigQuery: conceptos, carga de datos
    • explorar esquemas
    • campos anidados y repetidos
    • particionamiento y agrupamiento
    Laboratorios:
    • Manejo de JSON y matrices en BigQuery
    • Tablas particionadas en BigQuery

Módulo 10: Introducción a la construcción de tuberías por lotes

  • EL / ELT / ETL
    • calidad de los datos
    • ejecutar operaciones en BigQuery
    Demostración: ELT para mejorar la calidad de los datos

Módulo 11 – Ejecutar Spark en Dataproc

  • Ecosistema Hadoop
    • ejecutar cargas de trabajo en Dataproc
    • usar Cloud Almacenamiento en lugar de HDFS
    • Optimización de Dataproc
    Laboratorio: Ejecución de trabajos de Spark en Dataproc

Módulo 12 – Procesamiento de datos sin servidor con Dataflow

  • Introducción a Dataflow
    • agregaciones, entradas laterales, ventanas
    • Flujo de datos y plantillas SQL
    Laboratorios:
    • Flujo de datos simple Pipeline
    • MapReduce en Beam
    • Entradas laterales

Módulo 13 – Gestionar pipelines con Cloud Fusión de datos y Cloud Compositor

  • Creación de pipelines visuales con Data Fusion
    • Wrangler: exploración y transformación de datos
    • orquestación con Cloud Compositor
    • Flujo de aire: DAG, operadores, flujos de trabajo
    Laboratorios:
    • Construir y ejecutar Pipeline en Fusión de Datos
    • Introducción a Cloud Compositor

Módulo 14 – Introducción al procesamiento de datos en streaming

  • conceptos de streaming
    • Herramientas de GCP para streaming

Módulo 15 – Mensajería sin servidor con Pub/Sub

  • Pub/Sub push vs pull
    • publicación por código
    Laboratorio: Publicar datos de transmisión en Pub/Sub

Módulo 16 – Funciones de transmisión de flujo de datos

  • desafíos de streaming
    • ventanas, latencia, activadores
    Laboratorio: Transmisión de datos Pipelines

Módulo 17: Transmisión de alto rendimiento de BigQuery y Bigtable

  • Transmisión en BigQuery + paneles
    • ingesta de alto rendimiento en Bigtable
    • Optimización de Bigtable
    Laboratorios:
    • Análisis de streaming y paneles de control
    • Transmisión a Bigtable

Módulo 18: Funcionalidad y rendimiento avanzados de BigQuery

  • funciones de ventana analítica
    • Funciones SIG
    • Optimización de BigQuery
    Laboratorio: Optimización de consultas de BigQuery

Nota: La agenda puede ajustarse según el instructor asignado. Para obtener la versión final, contacte con el equipo. Bittnet Training.

Recomendamos continuar con:

Estos cursos amplían la formación de un ingeniero de datos a los campos del aprendizaje automático y la IA, relevantes para proyectos avanzados basados ​​en BigQuery ML, Dataflow ML y modelos personalizados.

Programas de certificación

El curso está incluido en la ruta oficial para la certificación Professional Data Engineer, representando la base de aprendizaje recomendada por Google. Cloud para este rol.

Preguntas frecuentes del curso de Ingeniería de Datos en Google Cloud

¿Cómo contribuye un curso de "Ingeniería de Datos en Google"? Cloud" para aumentar el ROI en una organización?

Formación de ingenieros de datos en Google Cloud Optimiza la gestión de grandes flujos de datos, automatiza el procesamiento y extrae información valiosa. Esto reduce el coste de los errores manuales, acelera la entrega de proyectos analíticos y facilita la toma de decisiones empresariales basadas en datos, lo que se traduce en un importante retorno de la inversión (ROI) gracias a la eficiencia operativa y la toma de decisiones estratégicas más rápidas.

¿Por qué la capacitación en BigQuery es esencial para las empresas basadas en datos?

BigQuery ofrece almacenamiento y análisis a escala de petabytes a costos predecibles. Las empresas que dominan BigQuery pueden transformar grandes volúmenes de datos en información útil sin grandes inversiones en infraestructura, lo que reduce el coste total de propiedad (TCO) y maximiza el retorno de la inversión en análisis.

Cómo optimiza Google Cloud Pipeline¿Qué datos y qué impacto tienen en los costos?

Pipeline-datos gestionados en Google Cloud Permiten el procesamiento automatizado y escalable de datos. Esta automatización elimina las tareas repetitivas y los errores asociados, reduciendo los costos operativos y el tiempo de desarrollo, lo que genera beneficios financieros directos.

¿Qué papel desempeña Dataflow en la transformación e integración de datos y cómo impacta en el ROI?

Dataflow ofrece procesamiento unificado tanto para streaming como para lotes, con escalado automático. Esto reduce la complejidad arquitectónica y la necesidad de coordinación entre herramientas dispares, lo que se traduce en menores costos operativos y tiempos de respuesta más rápidos para los proyectos de datos.

Cómo el curso apoya la adopción práctica de ETL/ELT en Google Cloud?

El curso se centra en técnicas de extracción, transformación y carga de datos utilizando herramientas nativas como Dataflow y Dataprep, lo que permite a los equipos construir pipelines rentables y escalables, eliminando silos de datos y aumentando el valor de los datos para el negocio.

¿Cómo se reduce? Cloud ¿Costos de almacenamiento del almacenamiento de datos a gran escala?

Cloud El almacenamiento ofrece almacenamiento duradero y escalable, además de un buen costo por uso. Esta flexibilidad permite a las organizaciones optimizar los presupuestos para datos inactivos o de acceso poco frecuente mediante políticas de archivado eficaces, lo que reduce el costo total de propiedad (TCO) y maximiza el uso de recursos.

¿Qué beneficios aporta la integración de Dataproc al procesamiento de Hadoop/Spark y cómo impacta en la eficiencia?

Dataproc permite que los clústeres de Hadoop y Spark se ejecuten bajo demanda con bajo coste y un escalamiento rápido. Esto elimina la necesidad de una gestión continua de clústeres y minimiza los costes de infraestructura tradicionales, lo que proporciona un ahorro significativo y flexibilidad en sus operaciones. big data.

Cómo el conocimiento sobre seguridad y gobernanza ayuda a la ingeniería de datos en Google Cloud?

Implementar buenas prácticas de seguridad y gobernanza garantiza la protección de datos confidenciales y el cumplimiento normativo. Esto reduce el riesgo de multas, daños a la reputación e incidentes costosos, protegiendo los ingresos y garantizando la continuidad del negocio de forma rentable.

¿Por qué es importante la capacidad de optimizar los costos de procesamiento y almacenamiento en proyectos de datos?

Optimizar los costos de procesamiento y almacenamiento es esencial para gestionar los presupuestos de TI. Los equipos bien preparados pueden implementar políticas de optimización que reduzcan los gastos mensuales sin comprometer el rendimiento, lo que aumenta la rentabilidad y el retorno de la inversión (ROI) a largo plazo.

¿Cómo puede la formación en Ingeniería de Datos en Google? Cloud ¿Cómo acelerar la innovación en la organización?

Las habilidades de ingeniería de datos permiten a las organizaciones explotar estratégicamente los datos, generando análisis predictivos, optimizaciones operativas y productos digitales innovadores. Esta agilidad para generar conocimiento competitivo se traduce en mayores ingresos y una ventaja competitiva sostenible.

¿Por qué me muestran esta página?

Esta página se devuelve debido a sus búsquedas que incluyen términos como: ingeniería de datos en Google cloudIngeniero de datos profesional certificado por Google, ingeniero de datos de GCP, Google cloud ingeniero de datos, Google cloud ingeniero de datos profesional, google cloud Ingeniero de datos profesional certificado, ingeniero de datos profesional de Google, ingeniero de datos de Google, ingeniero de datos certificado por Google, ingeniero de datos profesional, ingeniero de datos profesional de GCP, ingeniero de datos de Google, Google cloud Ingeniero de datos certificado, ingeniero de datos profesional de Google, ingeniero de datos GCP, Google cloud database ingeniero, ingeniería de datos en google cloud plataforma, gcp cloud Ingeniero de datos, ingeniero de datos profesional certificado, Google cloud Ingeniero de datos de plataforma, ingeniero de datos en Google, ingeniería de datos con Google cloud, ingeniero de datos profesional de Google cloudIngeniero de GCP, ingeniero de datos certificado por GCP, GCP para ingenieros de datos, ingeniería de datos con Google cloud Plataforma, ingeniero de datos profesional gcp, ingeniería de datos en Google cloud Especialización en plataformas, ingeniero de datos de Google cloud, cloud Ingeniero de datos GCP, ingeniero de datos profesional certificado por GCP, ingeniería de datos con GCP, ingeniero de aprendizaje automático de datos de Google, Google database Ingeniero, ingeniero de datos profesional en Google cloud Plataforma, ingeniería de datos en GCP, Google oficial cloud Ingeniero de datos profesional certificado, cloud Ingeniero de datos de Google, ingeniero de datos de Google cloud, ingeniería de datos de Google cloud plataforma, big data Ingeniero de Google u otros.

Ingeniería de datos en Google Cloud

Ofertas personalizadas para grupos de al menos 2 personas.

Detalles del curso

Duración:

4
días

Precio:

Bajo demanda

Entrega:

Docencia Presencial, Aula Híbrida, Aula Virtual

Nivel:

2. intermedio

Funciones:

Analistas de datos, Cloud Ingeniero, Ingeniero de Datos, Database Somos