🛠 Data Engineer на собеседовании — страница 2

Технический блок собеседования дата-инженера: инструменты, архитектура пайплайнов и вопросы, которые задают на системном дизайне данных.

112 материалов · страница 2 из 3

Greenplum на собеседовании Data Engineer
Greenplum на собесе DE: distribution keys, motion-операторы, MPP, скос данных, частые ошибки.
HDFS на собеседовании Data Engineer
HDFS на собесе DE: blocks, NameNode, DataNode, replication, federation.
Hive Metastore на собеседовании Data Engineer
Hive Metastore на собесе DE: что это, как работает с Spark / Trino / Iceberg, AWS Glue Catalog.
Apache Hive на собеседовании Data Engineer
Hive на собесе DE: HiveQL, partitioning, bucketing, file formats, Tez vs MR.
Apache Iceberg deep dive на собеседовании Data Engineer
Apache Iceberg detailed на собесе DE: snapshots, manifests, partition evolution, time travel.
Iceberg time travel на собеседовании Data Engineer
Iceberg time travel на собесе DE: snapshots, запросы к прошлым версиям, branches и tags, откат таблицы, применения в аудите и ML. Механика и частые ошибки.
Индексы БД на собеседовании Data Engineer
Индексы БД на собесе DE: B-tree, hash, bitmap, partial, covering, когда работают, когда мешают.
Inmon vs Kimball на собеседовании Data Engineer
Inmon и Kimball на собесе DE: подходы к DWH, top-down vs bottom-up, нормализация, data marts.
Kafka Connect на собеседовании Data Engineer
Kafka Connect на собесе DE: source- и sink-коннекторы, distributed mode, задачи, конвертеры и Single Message Transforms.
Kafka consumer groups на собеседовании Data Engineer
Consumer groups в Kafka на собесе DE: offsets, rebalance, partition assignment, at-least-once vs exactly-once.
Apache Kafka на собеседовании Data Engineer
Apache Kafka на собесе Data Engineer: топики, партиции, репликация, offsets, exactly-once, schema registry.
Kafka rebalance на собеседовании Data Engineer
Kafka rebalance на собесе DE: причины, stop-the-world, static membership, cooperative.
Kafka Streams на собеседовании Data Engineer
Kafka Streams на собесе DE: stream processing, KStream / KTable, joins, windowing, exactly-once.
LAG и LEAD на собеседовании Data Engineer
LAG и LEAD на собесе DE: синтаксис, default, сравнение с прошлым, gap detection, частые задачи.
Lakehouse и Iceberg vs Delta для Data Engineer
Lakehouse, Apache Iceberg, Delta Lake, Hudi: гайд для собеса DE с архитектурой, ACID, time travel.
Lambda и Kappa архитектура на собеседовании Data Engineer
Lambda vs Kappa на собесе DE: batch + speed layer, простой Kappa, когда что выбирать.
Materialized views на собеседовании Data Engineer
Materialized views на собесе DE: Postgres, ClickHouse, refresh-стратегии, инкрементальный update.
Медальон-архитектура на собеседовании Data Engineer
Медальон-архитектура на собесе DE: bronze, silver, gold layers, контракты, тесты на каждом уровне.
MERGE и UPSERT на собеседовании Data Engineer
MERGE и UPSERT на собесе DE: ON CONFLICT в Postgres, MERGE в стандарте SQL, идемпотентные пайплайны.
Apache NiFi на собеседовании Data Engineer
NiFi на собесе DE: visual flow, processors, FlowFiles, vs Airflow.
Типы NoSQL баз данных на собеседовании Data Engineer
NoSQL на собесе DE: KV (Redis), document (Mongo), wide-column (Cassandra), graph (Neo4j) — когда что.
Оконные функции на собесе Data Engineer
Продвинутые оконные функции для DE: ROWS vs RANGE, lag/lead, percentiles, dedup, running totals, типичные задачи.
OpenLineage на собеседовании Data Engineer
OpenLineage на собесе Data Engineer: зачем нужен data lineage, модель событий (run, job, dataset), Marquez, интеграции с Airflow, dbt, Spark и частые ошибки.
Parquet internals на собеседовании Data Engineer
Parquet deep на собесе DE: row groups, column chunks, page, encoding, predicate pushdown.
Партиционирование таблиц на собеседовании Data Engineer
Партиционирование на собесе DE: range/list/hash, partition pruning, partition-wise join, ошибки и грабли.
Postgres VACUUM и bloat на собеседовании Data Engineer
VACUUM и bloat в Postgres на собесе DE: MVCC и мёртвые кортежи, autovacuum, VACUUM FULL против pg_repack, измерение раздувания и частые ошибки.
Apache Pulsar на собеседовании Data Engineer
Pulsar на собесе DE: tiered storage, multi-tenancy, geo-replication, vs Kafka.
Pydantic для валидации данных на собеседовании Data Engineer
Pydantic на собесе DE: модели, приведение типов, кастомные валидаторы, strict-режим и отличия v1 от v2. Как отвечать и на что смотрит интервьюер.
PySpark vs pandas на собеседовании Data Engineer
PySpark vs pandas на собесе DE: масштаб, ленивые вычисления, разница в API, pandas API on Spark, Polars и DuckDB — когда что выбирать.
Оптимизация запросов на собеседовании Data Engineer
Оптимизация SQL-запросов на собесе DE: статистика и ANALYZE, переписывание запросов, индексы и хинты, materialized views, частые ошибки и FAQ.
RBAC в БД на собеседовании Data Engineer
RBAC в БД на собесе DE: roles, GRANT/REVOKE, row-level security, schemas, безопасный доступ.
Recursive CTE на собеседовании Data Engineer
Recursive CTE на собесе DE: иерархии, графы, генерация рядов, синтаксис, типичные задачи.
AWS Redshift на собеседовании Data Engineer
Redshift на собесе DE: distribution keys, sort keys, RA3, Spectrum, vs Snowflake.
S3 и object storage на собеседовании Data Engineer
AWS S3 на собесе DE: storage classes, partitioning, lifecycle, alternatives (GCS, Azure Blob, MinIO).
SCD типы deep на собеседовании Data Engineer
SCD 0-6 на собесе DE: Type 0, 1, 2, 3, 4, 6, hybrid, какой выбирать.
Schema evolution на собеседовании Data Engineer
Schema evolution на собесе DE: backward / forward / full compatibility, Avro, Parquet, schema registry.
Schema Registry на собеседовании Data Engineer
Confluent Schema Registry на собесе DE: Avro, Protobuf, JSON, compatibility levels.
Diagnostics slow queries на собеседовании Data Engineer
Slow query debugging на собесе DE: pg_stat_statements, EXPLAIN, profilers.
Snowflake vs BigQuery на собеседовании Data Engineer
Snowflake и BigQuery на собесе DE: архитектура, цены, отличия от Redshift и ClickHouse, когда что.
Snowpipe на собеседовании Data Engineer
Snowpipe на собесе DE: непрерывная загрузка данных, auto-ingest через S3-события, REST API, Snowpipe Streaming, стоимость и частые ошибки.
Spark broadcast joins на собеседовании Data Engineer
Broadcast joins в Spark на собесе DE: когда применять, broadcast hint, threshold, ограничения.
Spark Catalog API на собеседовании Data Engineer
Spark Catalog на собесе DE: временные и постоянные таблицы, managed vs external, Hive Metastore, Glue, Unity Catalog, интеграция с Iceberg и Delta. Механика и частые ошибки.
Spark Catalyst и AQE на собеседовании Data Engineer
Catalyst и Adaptive Query Execution в Spark на собесе DE: оптимизатор, predicate pushdown, AQE, dynamic coalescing.
Spark + Iceberg на собеседовании Data Engineer
Spark и Apache Iceberg на собесе DE: каталог, ACID-транзакции, эволюция схемы, компакция и очистка снапшотов. Как отвечать и на что смотрит интервьюер.
Spark MLlib на собеседовании Data Engineer
Spark MLlib на собесе DE: распределённый ML, Pipeline API, ALS, градиентный бустинг, когда MLlib оправдан, а когда лучше XGBoost.
Spark на Kubernetes на собеседовании Data Engineer
Spark on k8s на собесе DE: архитектура драйвера и executor-подов, spark-submit, dynamic allocation, Spark Operator и сравнение с YARN.
Spark RDD vs DataFrame vs Dataset на собеседовании Data Engineer
RDD, DataFrame, Dataset на собесе DE: разница, lazy evaluation, transformations vs actions, когда что.
Spark shuffle и skew на собеседовании Data Engineer
Spark shuffle, partitioning, skew на собесе DE: как обнаружить, как решить, AQE, salting, broadcast.

Другие разделы блога

🏢 Компании🗄 SQL🧪 A/B-тесты и статистика📊 Продуктовая аналитика🐍 Python🤖 Data Science и ML🧩 Системный анализ🎯 Карьера и собеседования