🐍 Python и pandas на собеседовании
Python на собеседовании аналитика редко про алгоритмы и почти всегда про pandas и базовые структуры данных. Здесь — то, что спрашивают на практике.
94 материалов · страница 1 из 2
Отличие merge от concat в pandas
Отличие merge от concat в pandas: concat склеивает DataFrame, merge соединяет по ключу. Когда что использовать — примеры и вопросы с собеседования.
crosstab в Pandas — кросс-таблицы
pd.crosstab в Pandas: таблица сопряжённости двух категорий, normalize для долей, margins для итогов, values и aggfunc. Отличия от pivot_table и groupby.
pandas groupby — группировка и агрегация
pandas groupby: группировка, агрегация, agg, transform, apply. Принцип split-apply-combine. Примеры и вопросы с собеседования аналитика данных.
В чём разница между loc и iloc в Pandas
Разница между loc и iloc в Pandas: loc — индексация по меткам, iloc — по позициям. Срезы, булева фильтрация, присваивание, at/iat и частые ошибки.
pandas merge — объединение таблиц по ключу
pandas merge (pd.merge) — объединение таблиц по ключу: inner, left, right, outer join, аналог SQL JOIN. Примеры и вопросы с собеседования аналитика.
Шпаргалка по pandas для аналитика
Шпаргалка по pandas для аналитика данных: фильтрация, groupby, merge, pivot, даты. Основные операции с примерами и задачи с собеседования аналитика.
NumPy и Pandas: в чём разница и когда что использовать
Разница между NumPy и Pandas в Python простыми словами: ndarray против DataFrame, типы данных, скорость, NaN и когда что использовать в анализе данных.
sort_values() в Pandas — сортировка данных
sort_values в pandas: сортировка DataFrame по одному и нескольким столбцам, ascending, na_position, key, ignore_index, отличие от sort_index. Примеры кода.
value_counts() в pandas — частоты, доли и распределения
value_counts() в pandas: частота уникальных значений, normalize для долей, bins, dropna и NaN. Сравнение с groupby и SQL GROUP BY. Примеры для аналитика данных.
Генераторы и итераторы в Python для Data Engineer
Генераторы Python для DE: yield, itertools, обработка больших файлов чанками, memory-efficient ETL.
Нужен ли Python продакт-менеджеру
Нужен ли продакт-менеджеру Python: где реально пригодится, что спрашивают на собесе и стоит ли учить, если SQL уже есть.
Визуализация в Python: matplotlib vs seaborn vs plotly
Сравнение библиотек визуализации: matplotlib, seaborn, plotly. Какая когда.
Excel для аналитика с нуля
Excel базово для аналитика: формулы, pivot tables, charts. Для beginners и собесов.
Pandas: оптимизация производительности
Как ускорить pandas: векторизация, категории, dtypes, alternatives (polars, DuckDB).
Шпаргалка Python для аналитика
Полная шпаргалка Python для аналитика данных: pandas, numpy, matplotlib, seaborn, scipy. Готовые сниппеты под ежедневные задачи.
Как прочитать JSON в pandas
Как прочитать JSON в pandas: read_json, json_normalize для вложенных. Примеры и частые проблемы.
Как построить гистограмму в pandas
Как построить гистограмму в pandas: hist(), plot.hist(), кастомизация, bins, несколько распределений.
Как построить scatter plot в pandas
Как построить scatter plot в pandas: plot.scatter, с цветами, размерами, сегментами. Примеры.
Как применить функцию к колонке в pandas
Как применить функцию к колонке DataFrame в pandas: apply, map, vectorized. Когда что использовать, performance.
Как работать с time series в pandas
Как работать с time series в pandas: resample, rolling, shift, seasonal decomposition.
Как сохранить DataFrame в Excel
Как сохранить DataFrame в Excel в pandas: to_excel, несколько листов, форматирование, openpyxl.
Задачи на агрегацию в pandas
12 задач на groupby, agg, transform и pivot в pandas с решениями. Типовые вопросы на собесах по Python для аналитика.
Counter и defaultdict в Python: шпаргалка
Шпаргалка по collections.Counter и defaultdict в Python: подсчёт частот, группировка, примеры для аналитика.
enumerate и zip в Python: шпаргалка
Шпаргалка по enumerate и zip в Python: итерирование с индексом, параллельный проход по спискам.
F-string в Python: шпаргалка
Шпаргалка по f-строкам Python: форматирование, округление, даты, ведущие нули, отладка. Примеры для аналитика.
isnull / dropna / fillna в pandas: шпаргалка
Шпаргалка по работе с пропусками в pandas: isnull, notnull, dropna, fillna, isna. Примеры, частые ошибки.
Как фильтровать DataFrame в pandas
Как фильтровать DataFrame в pandas: по условию, нескольким условиям, isin, between, query, примеры.
Как группировать данные в pandas
Как использовать groupby в pandas: агрегации, несколько колонок, apply, transform, примеры.
Как объединить DataFrame в pandas
Как объединить DataFrame в pandas: merge, concat, join. Примеры inner/left/right/outer. Частые ошибки.
Как обработать даты в pandas
Как работать с датами в pandas: to_datetime, dt accessor, resample, арифметика дат. Примеры.
Как сортировать DataFrame в pandas
Как сортировать DataFrame в pandas: sort_values по одной и нескольким колонкам, ascending/descending, NaN, индекс.
Как создать DataFrame в pandas
Как создать DataFrame в pandas: из словаря, списка, CSV, SQL, numpy. Примеры и частые паттерны.
Как сохранить DataFrame в CSV в pandas
Как сохранить DataFrame в CSV: to_csv, кодировки, разделители, без индекса, русские буквы.
Lambda в Python: шпаргалка для аналитика
Шпаргалка по lambda-функциям в Python: синтаксис, применение в map/filter/sorted/apply, частые ошибки.
Regex в Python: шпаргалка
Шпаргалка по регулярным выражениям в Python: re.search, re.findall, re.sub, метасимволы, группы, примеры.
Строки в Python: шпаргалка
Шпаргалка по строкам Python: методы, форматирование, slice, split/join, поиск, замена. Примеры для аналитика.
try/except в Python: шпаргалка
Шпаргалка по try/except в Python: синтаксис, finally, else, raise, частые ошибки, примеры для аналитика.
Async Python для аналитика: параллельные запросы и ETL
asyncio в Python: ускорение API-запросов и ETL-пайплайнов. Практические примеры для аналитика.
Feature engineering в pandas: практика для ML и аналитики
Создание фичей в pandas: дата, категории, тексты, агрегаты. Практические приёмы для churn prediction и прочих моделей.
Логирование в Python: практика для аналитика
Модуль logging в Python: уровни, форматы, отправка в файл и Slack. Практика для аналитических пайплайнов.
Оптимизация памяти в pandas: практические приёмы
Как уменьшить memory footprint в pandas: dtypes, categorical, chunksize, parquet. Для работы с большими датасетами.
Polars vs Pandas: подробное сравнение для аналитика
Polars против pandas: скорость, синтаксис, когда что выбрать. Практический гайд по миграции для аналитика.
apply vs map vs applymap в Pandas: шпаргалка
apply, map, applymap в pandas: отличия, когда использовать, производительность. Шпаргалка с собесов аналитика.
Datetime в Pandas: шпаргалка для собеседования
Datetime в pandas: to_datetime, dt-аксессор, resample, rolling, timezone. Шпаргалка + задачи с собеседования аналитика.
Словари (dict) в Python: шпаргалка
Словари Python: создание, операции, методы, collections.Counter, defaultdict. Шпаргалка и задачи с собеседования.
Пропуски в Pandas: шпаргалка для собеседования
Работа с пропусками в pandas: isna, fillna, dropna, interpolate. Шпаргалка + задачи с собеседования аналитика.
Groupby в Pandas: шпаргалка для собеседования
Groupby в pandas: agg, transform, filter, apply, multiindex. Шпаргалка + задачи с собеседования аналитика.
Как очистить данные в Pandas
Как очистить данные в Pandas: пропуски, дубликаты, типы, строки, выбросы. Практическое руководство.