Ежедневно, с 8:30 до 22:30
Предзаказ
1975

Data Engineering Fast‑Track: Kafka → Airflow → Spark

Средняя оценка 0.0 из 5 на основании 0 голосов (0)
1 0
0
1500 ₽
8990 ₽
-83%
Кэшбэк: 5% (75 ₽)
Курс будет выдан в течение 1-3 часов после оплаты.

Практический fast-track по data engineering: за 4–6 недель собираем рабочий конвейер Kafka → Spark → Lakehouse под управлением Airflow. Разберём batch и streaming, окна и watermark, схемы и контракты. Мини‑проекты, Docker Compose, шаблоны DAG и пайплайнов.

Этот курс — быстрый и практичный вход в инженерию данных. Вместо длинной теории вы сразу собираете рабочий конвейер: источники шлют события в Kafka, Spark их очищает и агрегирует (batch и streaming), результаты складываются в Parquet/Delta/Iceberg, а Airflow следит за расписанием, зависимостями и SLA.

Мы разбираем, как выбирать ключи и партиции в Kafka, как настроить окна и watermark в стриминге, как не утонуть в shuffle и перекосе ключей в Spark, и как избежать «мелких файлов» в озере. В конце у вас будет шаблон проекта: Docker-компоуз, минимальный DAG, стрим из Kafka в таблицу, проверки свежести и сценарий backfill.

Формат: короткая теория → пошаговая инструкция → мини-практика. Всё можно повторить локально: репозиторий с compose-файлами и кодом прилагается.

Курс подойдёт инженерам, аналитикам и тем, кто хочет освоить современные пайплайны данных с уверенным Python.

Чему вы научитесь:

  • Проектировать конвейер данных Kafka → Spark → Lakehouse под управлением Airflow.
  • Поднимать локальное окружение через Docker Compose и воспроизводимо деплоить пайплайны.
  • Делать batch и streaming в Spark, настраивать окна и watermark.
  • Читать/писать данные в Parquet и табличные форматы Delta/Iceberg, избегать «small files».
  • Настраивать DAG: расписания, retries, SLA, catchup, datasets.
  • Подключать источники/приёмники через Kafka Connect/Schema Registry, понимать EOS/idempotency.
  • Писать базовые тесты качества данных (freshness/completeness) и алерты по свежести.
  • Выполнять backfill и разруливать инциденты (сломалась схема, отставание потребителей).

Что вы получаете:

  • Рабочий конвейер Kafka → Spark → Lakehouse под управлением Airflow, который разворачивается из Docker Compose
  • Репозиторий курса: docker-compose, примеры кода, готовые DAG, конфиги Kafka/Schema Registry/Kafka Connect
  • Мини-проект в портфолио: поток из Kafka в Delta/Iceberg + batch-пересчёт (backfill) + SLA/алерты
  • Чек-листы продакшена: ключи/партиции, окна и watermark, small files/компакции, мониторинг lag и задержек
  • Шаблоны: Airflow-DAG для ETL/ELT, Spark-jobs (batch/stream), базовые проверки качества данных (freshness/completeness)
  • Шпаргалки и схемы по Kafka, Airflow, Spark и табличным форматам (Delta/Iceberg)
  • Задачи и самопроверки двух уровней сложности (Starter/Pro)
  • Подготовительный мини-модуль для самоучек: краткий recap Python/SQL/Git/Bash/Docker (4–6 часов)
  • Пошаговые инструкции с разбором типичных ошибок и анти-паттернов

Программа курса

Введение в Data Engineering

  1. Введение в курс
  2. Роль инженера данных
  3. Обзор инструментов: Kafka, Airflow, Spark
  4. Среда разработки и инструменты

Apache Kafka — основы

  1. Архитектура и ключевые понятия Kafka
  2. Развёртывание и конфигурация Kafka
  3. Управление топиками и партициями
  4. Продюсеры и консюмеры

Apache Kafka — продвинутые темы

  1. Модели доставки и группы консюмеров
  2. Streams API
  3. Connect API
  4. Тюнинг и масштабирование Kafka

Apache Airflow — основы

  1. Концепция DAG и организация кодовой базы
  2. Операторы и сенсоры
  3. Планирование и параметры DAG
  4. Переменные, подключения и XCom

Apache Airflow — продвинутые возможности

  1. Управление зависимостями и надёжность
  2. Пользовательские операторы, сенсоры и плагины в Airflow
  3. Интеграция Airflow с внешними сервисами
  4. Мониторинг, интерфейс Airflow и best practices

Apache Spark — основы

  1. Архитектура Apache Spark и RDD
  2. Spark SQL, DataFrame и Dataset
  3. Join’ы и перекос данных: производительность без магии
  4. Lakehouse с Delta/Iceberg: upsert, compaction, time-travel

Apache Spark — потоковая обработка и интеграция с Kafk

  1. Введение в Structured Streaming
  2. Чтение и запись данных из Kafka
  3. Оконные операции и управление временем
  4. Stateful-операции и stream-static join

Проектный модуль: end‑to‑end пайплайн

Автор Алексей Малышкин:

  • Аналитик-разработчик с опытом работы в крупных компаниях.
  • Победитель олимпиад по математике, программированию и анализу данных.
    Характеристики
    Наличие Предзаказ Тип Видео Размещение на сайте 02.10.2025 Артикул 1975

    Об авторах

    Фото: Алексей Малышкин
    0.0
    Алексей Малышкин
    Автор курсов по Python, анализу данных и LLM-инженерии. Учит проверке гипотез, data engineering на Kafka, Airflow и Spark и разработке на LangChain.

    Отзывы и комментарии

    Отзывов ещё нет, будьте первыми

    Написать отзыв
    Нажимая "Отправить" Вы соглашаетесь с правилами публикации и даёте согласие на обработку персональных данных. Администрация не несёт ответственности за содержание отзывов.

    Похожие товары:

    Постер товара: Data Engineer 14.0
    Скидка 90%
    Предзаказ
    Средняя оценка 0.0 из 5 на основании 0 голосов
    Data Engineer 14.0
    ETL и Apache Airflow
    Постер товара: Apache Kafka для разработки и архитектуры
    Скидка 90%
    Предзаказ
    Средняя оценка 5.0 из 5 на основании 1 голосов
    Apache Kafka для разработки и архитектуры
    Микросервисы и DDD
    Постер товара: Data Engineering
    Скидка 81%
    Предзаказ
    Средняя оценка 5.0 из 5 на основании 1 голосов
    Data Engineering
    ETL и Apache Airflow
    Постер товара: BI аналитика. Data engineer экспресс-курс
    Скидка 80%
    Предзаказ
    Средняя оценка 0.0 из 5 на основании 0 голосов
    BI аналитика. Data engineer экспресс-курс
    BI-инструменты
    Постер товара: Практический курс по Big Data
    Скидка 90%
    Предзаказ
    Средняя оценка 0.0 из 5 на основании 0 голосов
    Практический курс по Big Data
    Kafka, Spark и Hadoop
    Постер товара: Apache Kafka
    Скидка 92%
    Предзаказ
    Средняя оценка 0.0 из 5 на основании 0 голосов
    Apache Kafka
    Event-Driven и CQRS
    Постер товара: Разработка и оркестрация ETL процессов в Airflow
    Скидка 84%
    Предзаказ
    Средняя оценка 0.0 из 5 на основании 0 голосов
    Разработка и оркестрация ETL процессов в Airflow
    ETL и Apache Airflow
    Постер товара: Data Warehouse Analyst
    Скидка 90%
    Предзаказ
    Средняя оценка 0.0 из 5 на основании 0 голосов
    Data Warehouse Analyst
    Хранилища данных (DWH)