Наиболее полный курс по анализу данных и визуализации на Python. 350 Упражнений, 800 страниц текста, множество проектов и их решений.
Что вы получите:
- 70+ Jupyter Notebook, где вы можете читать текст, выполнять упражнения и добавлять заметки
- 800+ страниц PDF-файла с текстом, позволяющим искать конкретный контент или читать, когда вы не в сети
- 240+ страниц PDF с подробными решениями всех упражнений
- 13 часов видео подробных и понятных объяснений текста и решений упражнений
Содержание курса
1. Введение в pandas
В Python pandas — популярная и мощная библиотека для изучения, анализа и визуализации данных. Вы познакомитесь с DataFrame и Series — двумя основными контейнерами данных в pandas. Вы узнаете, из каких компонентов состоят эти объекты, и освоите несколько базовых операций.
Введение в pandas доступно бесплатно и входит в комплект со следующей частью — «Выбор подмножеств данных».
2. Выбор подмножеств данных
Одна из наиболее распространённых задач при анализе данных — выбор определённого подмножества данных. В pandas можно выбирать данные по меткам строк и столбцов или по целочисленным индексам, а также использовать условную логику, применяемую к значениям. Хотя эта задача кажется достаточно простой, pandas предлагает несколько способов её выполнения, что часто вызывает путаницу у начинающих пользователей.
В этой части вы получите подробные инструкции о лучших практиках выбора подмножеств данных. Также вы узнаете, каких методов выбора следует избегать.
3. Основные команды Series
В этой части вы начнёте выполнять вычисления над данными. Сначала вы научитесь работать с одним столбцом данных — объектом Series в pandas. Вы узнаете разницу между методами, которые выполняют агрегацию и возвращают одно значение, и методами, которые этого не делают. Также вы научитесь использовать операции для обработки строковых и временных данных.
4. Основные команды DataFrame
После изучения работы с одним столбцом данных вы научитесь работать одновременно с несколькими столбцами, вызывая методы объекта DataFrame. Вы узнаете, как изменять направление выполнения операций с вертикального на горизонтальное.
5. Типы данных
Для DataFrame доступно большое количество типов данных. В этой части вы подробно разберёте определения каждого типа данных и научитесь преобразовывать данные из одного типа в другой.
Также вы познакомитесь с категориальным типом данных, который является особенностью pandas и позволяет значительно экономить память.
6. Группировка данных
До этого момента все операции применялись ко всему набору данных. Вы научитесь применять операции к отдельным группам внутри данных, а не ко всему набору целиком.
Также вы узнаете, как представлять результаты группировки в более понятном для человека виде с помощью сводных таблиц.
Группировка данных в pandas может быть сложной и потенциально является одной из самых медленных операций. Вы изучите лучшие практики оптимизации производительности, а также познакомитесь с современным синтаксисом.
7. Временные ряды
Временной ряд — это последовательность данных, наблюдаемых в течение определённого периода времени. Весь набор наблюдений упорядочен по времени. Вы научитесь выбирать данные временных рядов через равные интервалы, выполнять операции по скользящему временному окну и группировать данные по любому необходимому периоду времени.
8. Регулярные выражения
Регулярные выражения представляют собой небольшой самостоятельный язык программирования, который помогает находить определённые шаблоны в тексте. Они могут быть чрезвычайно полезны в сочетании со строковыми методами pandas для обработки и анализа строк практически любым необходимым способом.
9. Структурированные данные (Tidy Data)
Tidy Data — это структура данных, которая упрощает их анализ. Часто необходимо перестроить, преобразовать и извлечь данные таким образом, чтобы они соответствовали принципам Tidy Data. Вы научитесь приводить различные наборы «неструктурированных» данных к удобному для анализа виду с помощью инструментов pandas.
10. Объединение данных
В этой части вы научитесь работать одновременно с несколькими наборами данных. Вы узнаете, как pandas автоматически использует выравнивание индексов при объединении наборов данных, что может вызывать проблемы у начинающих пользователей. Также вы научитесь выполнять объединения, аналогичные SQL JOIN, взаимодействуя с реляционной базой данных.
11. Визуализация с помощью Matplotlib
Хорошая визуализация помогает лучше понимать данные и принимать решения. В этой части вы изучите простой и понятный подход к работе с мощной, но достаточно сложной библиотекой Matplotlib.
12. Визуализация с помощью pandas и Seaborn
Вы научитесь строить графики с помощью pandas, а затем упростите этот процесс с использованием библиотеки Seaborn.
Курс на английском языке.







