🛠 Data Engineer на собеседовании — страница 3

Технический блок собеседования дата-инженера: инструменты, архитектура пайплайнов и вопросы, которые задают на системном дизайне данных.

112 материалов · страница 3 из 3

Spark Structured Streaming на собеседовании Data Engineer
Spark Structured Streaming на собесе DE: micro-batching, watermarks, late data, exactly-once.
Spark memory tuning на собеседовании Data Engineer
Spark memory tuning на собесе DE: executor memory, off-heap, OOM, GC tuning, partitioning.
Spark vs Flink на собеседовании Data Engineer
Spark и Flink на собесе DE: подробное сравнение, when to use, RDD vs DataStream.
SQL anti-patterns на собеседовании Data Engineer
SQL anti-patterns на собесе DE: SELECT *, функции на индексе, неявные приведения типов, N+1, OR против UNION. Почему тормозит и как переписать.
Streaming SQL на собеседовании Data Engineer
Streaming SQL на собесе DE: ksqlDB, Flink SQL, Materialize, окна, watermark, event-time vs processing-time и типичные вопросы интервьюера.
Транзакции и MVCC на собеседовании Data Engineer
Транзакции и MVCC на собесе DE: ACID, уровни изоляции (RC, RR, Serializable), аномалии, deadlocks, как реализовано в Postgres.
Trino federation queries на собеседовании Data Engineer
Федеративные запросы в Trino на собесе DE: catalog и connector, cross-source join, pushdown фильтров и агрегаций, когда federation работает плохо.
Trino и Presto на собеседовании Data Engineer
Trino / Presto на собесе DE: federated queries, MPP, connectors, отличие от Spark.
Time-series databases на собеседовании Data Engineer
TSDB на собесе DE: InfluxDB, TimescaleDB, Prometheus, ClickHouse для time series.
WAL и репликация на собеседовании Data Engineer
WAL и replication на собесе DE: streaming replication, logical, sync vs async.
Workload management в DWH на собеседовании Data Engineer
WLM на собесе DE: очереди запросов, приоритеты, лимиты конкурентности, изоляция ресурсов в Snowflake, Redshift и ClickHouse.
Yandex Cloud data services на собеседовании Data Engineer
Yandex Cloud для DE на собесе: DataSphere, Object Storage, Managed ClickHouse, Greenplum, DataTransfer.
Hadoop YARN на собеседовании Data Engineer
YARN на собесе DE: ResourceManager, NodeManager, queues, vs Kubernetes.
Apache Airflow на собеседовании Data Engineer
Apache Airflow на собеседовании Data Engineer: DAG, операторы, идемпотентность, XCom, частые задачи.
ClickHouse и DWH на собеседовании Data Engineer
Хранилища данных и ClickHouse на собеседовании Data Engineer: OLAP, MergeTree, моделирование, выбор технологии.
Apache Spark на собеседовании Data Engineer
Apache Spark на собеседовании Data Engineer: RDD, DataFrame, shuffle, partitioning, оптимизация.

Другие разделы блога

🏢 Компании🗄 SQL🧪 A/B-тесты и статистика📊 Продуктовая аналитика🐍 Python🤖 Data Science и ML🧩 Системный анализ🎯 Карьера и собеседования