В современных компаниях накапливается большой объём данных, из которых можно извлекать важную аналитику, строить гипотезы и модели прогнозирования. Data Engineer — специалист, который собирает данные из разных источников, очищает их и передаёт аналитикам в удобном виде для принятия бизнес-решений.
Аналитикам данных важно знать, как работает хранилище данных, в каком виде в нём хранятся данные, как они обрабатываются и как их можно получить для анализа.
Курс ориентирован на практику и работу с основными инструментами. Он подходит тем, кто имеет базовые знания языка Python. За два месяца вы освоите все важные этапы Data Engineering.
Программа курса
- Введение, практический Linux
- Кто такой Data Engineer и зачем ему Linux?
- Современные хранилища данных
- Разнообразие баз данных и их особенности.
- Экосистема Hadoop
- Что такое Hadoop, что он умеет и как им пользоваться.
- Источники данных и работа с ними
- Файлы как источники данных, JDBC для работы со структурированными данными, SQL для выгрузки данных.
- Apache Spark и обработка данных
- Зачем нужен Apache Spark и как с ним работать.
- Hadoop как хранилище данных
- Особенности и нюансы HDFS.
- Apache Airflow для оркестрации конвейеров
- Настройка data pipelines.
- Обзор облачных хранилищ
- Особенности и нюансы работы с облачными хранилищами Google, Amazon и Azure.









