Инженеринг на данни в Google Cloud

Този курс по инженерство на данни в Google Cloud 4-дневният курс осигурява пълно обучение за проектиране, изграждане и експлоатация на системи за обработка на данни. Google Cloud Платформа (GCP)Участниците ще работят с основни услуги за инженерство на данни, като BigQuery, Dataflow, Dataproc, Pub/Sub, Dataplex и Cloud Съхранение, изследване на съвременни концепции за приемане, съхранение, трансформация, анализ и оркестрация на данни.

Обучението включва демонстрации, практически упражнения и реални сценарии, като насочва участниците към изграждане на мащабируеми тръбопроводи, оптимизиране на производителността и внедряване на стабилни архитектури на данни. cloud.

Към кого е адресирано?

Курс по инженерство на данни в Google Cloud Препоръчва се за:
• инженери на данни, които изграждат или управляват тръбопроводи в cloud
• специалисти Big Data мигриране към екосистемата на Google Cloud
• администратори на бази данни и ETL специалисти
• аналитични инженери, работещи с BigQuery
• професионалисти, подготвящи се за сертифициране Инженер по данни, в рамките на официалния маршрут на Google Cloud

Какво ще научите?

В края на курса „Инженерство на данни в Google“ Cloud, участниците ще могат да:
• проектиране на мащабируеми системи за обработка на данни в GCP
• изграждайте пакетни и стрийминг конвейери, използвайки услугите на Google Cloud
• внедряване на модели на данни и потоци от край до край
• управлявайте системи за данни с фокус върху надеждността, сигурността и разходите
• прилагайте най-добрите практики за автоматизация, оркестрация и оптимизация

Предпоставки:

  • основни познания по SQL
  • препоръчително: опит с език за програмиране (Python, Java и др.)
  • разбиране на основните понятия на cloud

График на курса:

Материалите на курса са на английски език. Обучението се води на румънски език.

Модул 01 – Задачи и компоненти на инженерството на данни

  • ролята на инженер по данни
    • източници на данни срещу приемници на данни
    • формати на данни
    • Опции за съхранение в Google Cloud
    • управление на метаданни
    • споделяне на набори от данни с Analytics Hub
    Lab: Зареждане на данни в BigQuery

Модул 02 – Репликация и миграция на данни

  • архитектура на репликация и миграция
    • гcloud CLI
    • преместване на набори от данни
    • Поток от данни и случаи на употреба
    Lab: PostgreSQL → BigQuery репликация с поток от данни

Модул 03 – Извличане и зареждане на модел на тръбопровод (EL)

  • EL архитектура
    • bq CLI
    • Услуга за трансфер на данни BigQuery
    • BigLake като алтернатива на EL
    Lab: Старт на BigLake Qwik

Модул 04 – Извличане, зареждане и трансформиране на шаблон (ELT)

  • ELT архитектура
    • SQL скриптове и планиране в BigQuery
    • Формуляр за данни
    Lab: Създаване и изпълнение на SQL работен поток в Dataform

Модул 05 – Извличане, трансформиране и зареждане на шаблон (ETL)

  • ETL архитектура
    • Инструменти с графичен потребителски интерфейс в Google Cloud
    • пакетна обработка с Dataproc
    • стрийминг обработка – опции
    • Bigtable в канали за данни
    Лаборатории:
    • Dataproc Serverless за Spark → Зареждане на BigQuery
    • Табло за управление на потока от данни в реално време Pipeline

Модул 06 – Техники за автоматизация

  • модели на автоматизация
    • Cloud Планировчик и работни процеси
    • Cloud композирам
    • Cloud Изпълняване на функции
    • Eventarc
    Lab: Cloud Изпълнение на функции → Зареждане на BigQuery

Модул 07 – Въведение в инженерството на данни

  • ролята на инженера по данни
    • предизвикателства, свързани с инженерството на данни,
    • въведение в BigQuery
    • езера от данни срещу хранилища за данни
    • управление, достъп и сътрудничество
    • казус
    Lab: Използване на BigQuery за анализ

Модул 08 – Изграждане на езеро с данни

  • архитектура на езерото с данни
    • опции за съхранение и ETL
    • Cloud Съхранението като основно езеро с данни
    • сигурност Cloud Съхранение
    • използвайте Cloud SQL
    Lab: Зареждане на данни за таксита в Cloud SQL

Модул 09 – Изграждане на хранилище за данни

  • съвременна архитектура на хранилището за данни
    • BigQuery – концепции, зареждане на данни
    • проучване на схеми
    • вложени и повтарящи се полета
    • разделяне и клъстеризиране
    Лаборатории:
    • JSON и обработка на масиви в BigQuery
    • Разделени таблици в BigQuery

Модул 10 – Въведение в изграждането на пакетни тръбопроводи

  • ЕЛ / ЕЛ / ЕТЛ
    • качество на данните
    • изпълнение на операции в BigQuery
    Демонстрация: ELT за подобряване на качеството на данните

Модул 11 – Изпълнение на Spark върху Dataproc

  • Екосистема на Hadoop
    • изпълнение на натоварвания на Dataproc
    • използвайте Cloud Съхранение вместо HDFS
    • Оптимизация на Dataproc
    Lab: Изпълнение на Spark Jobs в Dataproc

Модул 12 – Безсървърна обработка на данни с Dataflow

  • въведение в потока от данни
    • агрегации, странични входове, прозорци
    • SQL поток от данни и шаблони
    Лаборатории:
    • Опростен поток от данни Pipeline
    • MapReduce в Beam
    • Странични входове

Модул 13 – Управление на тръбопроводи с Cloud Сливане на данни & Cloud композирам

  • създаване на визуални канали с Data Fusion
    • Wrangler – проучване и трансформация на данни
    • оркестрация с Cloud композирам
    • Въздушен поток: DAGs, оператори, работни процеси
    Лаборатории:
    • Изграждане и изпълнение Pipeline в сливането на данни
    • Представяне на Cloud композирам

Модул 14 – Въведение в обработката на поточни данни

  • концепции за стрийминг
    • GCP инструменти за стрийминг

Модул 15 – Безсървърни съобщения с Pub/Sub

  • Push/Sub - тласък срещу дърпане
    • публикуване чрез код
    Lab: Публикуване на стрийминг данни в Pub/Sub

Модул 16 – Функции за стрийминг на данни

  • предизвикателства при стрийминга
    • прозорци, латентност, тригери
    Lab: Стрийминг на данни Pipelines

Модул 17 – Високопроизводително стриймване на BigQuery и Bigtable

  • стрийминг в BigQuery + табла за управление
    • високопроизводително приемане в Bigtable
    • Оптимизация на Bigtable
    Лаборатории:
    • Стрийминг анализи и табла за управление
    • Стрийминг в Bigtable

Модул 18 – Разширена функционалност и производителност на BigQuery

  • аналитични прозоречни функции
    • ГИС функции
    • Оптимизация на BigQuery
    Lab: Оптимизиране на заявките в BigQuery

Забележка: Дневният ред може да бъде коригиран в зависимост от назначения обучител. За окончателната версия, моля, свържете се с екипа. Bittnet Training.

Препоръчваме да продължите с:

Тези курсове разширяват обучението на Data Engineer в областите на машинното обучение и изкуствения интелект, подходящи за напреднали проекти, базирани на BigQuery ML, Dataflow ML и персонализирани модели.

Сертификационни програми

Курсът е включен в официалния път за сертифициране като професионален инженер по данни, представляващ учебната база, препоръчана от Google. Cloud за тази роля.

Често задавани въпроси за курса „Инженерство на данни в Google“ Cloud

Как допринася курсът „Инженерство на данни в Google“ Cloud„до увеличаване на възвръщаемостта на инвестициите в една организация?“

Обучение на инженери по данни в Google Cloud оптимизира управлението на големи потоци от данни, автоматизира обработката и извлича ценни анализи. Това намалява разходите за ръчни грешки, ускорява изпълнението на аналитични проекти и подкрепя бизнес решения, основани на данни, което се превръща в значителна възвръщаемост на инвестициите чрез оперативна ефективност и по-бързи стратегически решения.

Защо обучението по BigQuery е от съществено значение за компании, ориентирани към данни?

BigQuery предлага съхранение и анализи в петабайтов мащаб на предвидими цени. Компаниите, които владеят BigQuery, могат да трансформират големи обеми от данни в практически прозрения без масивни инвестиции в инфраструктура, намалявайки общите разходи за притежание (TCO) и увеличавайки максимално възвръщаемостта на инвестициите в анализи.

Как Google оптимизира Cloud Pipelineданни и какво влияние оказват те върху разходите?

Pipeline-данни, управлявани в Google Cloud позволяват автоматизирана и мащабируема обработка на данни. Тази автоматизация елиминира повтарящите се задачи и свързаните с тях грешки, намалявайки оперативните разходи и времето за разработка, което носи директни финансови ползи.

Каква роля играе Dataflow в трансформацията и интеграцията на данни и как влияе върху възвръщаемостта на инвестициите?

Dataflow предлага унифицирана обработка както за стрийминг, така и за пакетна обработка, с автоматично мащабиране. Това намалява архитектурната сложност и необходимостта от координация между различни инструменти, което води до по-ниски оперативни разходи и по-бързо време за реакция за проекти с данни.

Как курсът подпомага практическото внедряване на ETL/ELT в Google Cloud?

Курсът се фокусира върху техниките за извличане, трансформация и зареждане на данни, използвайки вградени инструменти като Dataflow и Dataprep, което позволява на екипите да изграждат рентабилни и мащабируеми канали за обработка, елиминирайки изолираните хранилища за данни и увеличавайки стойността на данните за бизнеса.

Как намалява Cloud Разходи за съхранение на големи масиви от данни?

Cloud Съхранението предлага издръжливо, мащабируемо съхранение и цена на ползване. Тази гъвкавост позволява на организациите да оптимизират бюджетите за неактивни или рядко достъпвани данни чрез ефективни политики за архивиране, намалявайки общата цена на притежание и максимизирайки използването на ресурсите.

Какви ползи носи интеграцията на Dataproc за обработката на Hadoop/Spark и как това влияе върху ефективността?

Dataproc позволява на клъстерите Hadoop и Spark да работят при поискване с ниска цена и бързо мащабиране. Това елиминира необходимостта от непрекъснато управление на клъстера и минимизира традиционните разходи за инфраструктура, осигурявайки значителни спестявания и гъвкавост във вашите операции. big data.

Как знанията за сигурност и управление помагат в инженерството на данни в Google Cloud?

Прилагането на добри практики за сигурност и управление гарантира защитата на чувствителни данни и съответствие с регулаторните изисквания. Това намалява риска от глоби, увреждане на репутацията и скъпоструващи инциденти, защитавайки приходите и осигурявайки непрекъснатост на бизнеса по икономически ефективен начин.

Защо е важна способността за оптимизиране на разходите за обработка и съхранение в проектите за данни?

Оптимизирането на разходите за обработка и съхранение е от съществено значение за управлението на ИТ бюджетите. Добре подготвените екипи могат да внедрят политики за оптимизация, които намаляват месечните разходи, без да се прави компромис с производителността, което увеличава рентабилността и дългосрочната възвръщаемост на инвестициите.

Как може обучението по инженерство на данни в Google Cloud да се ускорят иновациите в организацията?

Уменията в областта на инженерството на данни позволяват на организациите стратегически да използват данни, генерирайки прогнозни анализи, оперативни оптимизации и иновативни дигитални продукти. Тази гъвкавост при генерирането на конкурентни прозрения се превръща в увеличени приходи и устойчиво конкурентно предимство.

Защо ми се показва тази страница?

Тази страница се връща поради вашите търсения, които включват термини като: инженерство на данни в Google cloud, сертифициран от Google професионален инженер на данни, GCP инженер на данни, Google cloud инженер по данни, Google cloud професионален инженер по данни, Google cloud сертифициран професионален инженер на данни, професионален инженер на данни от Google, инженер на данни от Google, сертифициран инженер на данни от Google, професионален инженер на данни, професионален инженер на данни от GCP, инженер на данни от Google, Google cloud сертифициран инженер на данни, професионален инженер на данни в Google, инженер на данни в Google (GCP), Google cloud database инженер, инженерство на данни в Google cloud платформа, gcp cloud инженер на данни, сертифициран професионален инженер на данни, Google cloud инженер на данни за платформа, инженер на данни в Google, инженерство на данни с Google cloud, професионален инженер по данни в Google cloud, gcp инженер, gcp сертифициран инженер на данни, gcp за инженер на данни, инженерство на данни с Google cloud платформа, професионален инженер на данни (gcp), инженерство на данни в Google cloud платформена специализация, инженер на данни в Google cloud, cloud инженер на данни gcp, сертифициран професионален инженер на данни по gcp, инженерство на данни с gcp, инженер за машинно обучение на данни на Google, google database инженер, професионален инженер по данни в Google cloud платформа, инженерство на данни в GCP, официален Google cloud сертифициран професионален инженер по данни, cloud Инженер на данни на Google, инженер на данни на Google cloud, инженерство на данни в Google cloud платформа, big data Инженер на Google или други.

Инженеринг на данни в Google Cloud

Персонализирани оферти за групи от минимум 2 човека

Подробности за курса

Продължителност:

4
дни

Цена:

При поискване

Доставка:

Преподаване в класна стая, хибридна класна стая, виртуална класна стая

Ниво:

2. Средно

Роли:

Анализатори на данни, Cloud Инженер, Инженер по данни, Database специалист