🛠 Data Engineer на собеседовании
Технический блок собеседования дата-инженера: инструменты, архитектура пайплайнов и вопросы, которые задают на системном дизайне данных.
112 материалов · страница 1 из 3
Airbyte vs Fivetran на собеседовании Data Engineer
EL-инструменты на собесе DE: Airbyte, Fivetran, Stitch — отличия, когда что выбирать.
Airflow backfill и catchup на собеседовании Data Engineer
Backfill в Airflow на собесе DE: catchup, schedule_interval, depends_on_past, идемпотентность.
Airflow deployment на собеседовании Data Engineer
Airflow deployment на собесе DE: executors, scheduler HA, k8s, Cloud Composer.
Airflow Sensors на собеседовании Data Engineer
Sensors в Airflow на собесе DE: poke vs reschedule, ExternalTaskSensor, FileSensor, deferrable operators.
Airflow vs Prefect vs Dagster на собеседовании Data Engineer
Оркестраторы на собесе DE: Airflow, Prefect, Dagster — парадигмы, плюсы и минусы, когда что выбрать и как обосновать выбор интервьюеру.
Airflow XCom на собеседовании Data Engineer
XCom в Airflow на собесе DE: что можно/нельзя класть, лимиты, custom backends, антипаттерны.
Anti и semi joins на собеседовании Data Engineer
Anti / semi joins на собесе DE: EXISTS, NOT EXISTS, IN, NOT IN, JOIN — что выбрать на больших данных.
Apache Beam на собеседовании Data Engineer
Apache Beam на собесе DE: PCollection, PTransform, runners, windowing, unified batch/stream.
Apache Drill на собеседовании Data Engineer
Apache Drill на собесе DE: schema-free SQL, drillbits, распределённое выполнение и сравнение с Trino.
Apache Flink на собеседовании Data Engineer
Flink на собесе DE: true streaming, event time, watermarks, exactly-once, отличие от Spark.
AWS Athena на собеседовании Data Engineer
Athena на собесе DE: serverless SQL on S3, Presto under hood, partitioning, costs.
Apache Atlas на собеседовании Data Engineer
Apache Atlas на собесе Data Engineer: data governance, система типов, data lineage, классификация и PII-теги, интеграция с Hadoop и сравнение с DataHub.
BI tools для Data Engineer на собеседовании
BI tools на собесе DE: Tableau, DataLens, Superset, Metabase, Looker — interaction с DWH.
BigQuery на собеседовании Data Engineer
BigQuery на собесе DE: serverless, slots, partitioning, clustering, BQML.
Cassandra на собеседовании Data Engineer
Cassandra на собесе DE: архитектура ring, модель данных query-first, partition key, consistency levels, репликация и repair.
CDC и Debezium на собеседовании Data Engineer
Change Data Capture, Debezium, log-based vs query-based: гайд для собеса DE с примерами и граблями.
CDC vs batch loading на собеседовании Data Engineer
CDC vs batch на собесе DE: log-based vs query-based CDC, batch ETL, latency, выбор подхода.
ClickHouse MergeTree на собеседовании Data Engineer
MergeTree в ClickHouse на собесе DE: ORDER BY, primary key, partition, движки ReplacingMergeTree и AggregatingMergeTree.
ClickHouse projections на собеседовании Data Engineer
Projections в ClickHouse на собесе DE: vs MV, automatic optimization, use cases.
Connection pooling на собеседовании Data Engineer
Connection pooling на собесе DE: pgbouncer, HikariCP, transaction vs session pooling.
Cumulative DISTINCT в SQL на собеседовании Data Engineer
Cumulative DISTINCT count на собесе DE: HyperLogLog, approximate count, running unique users.
Data contracts на собеседовании Data Engineer
Data contracts на собесе DE: что входит в контракт (schema, SLA, ownership), breaking changes, enforcement и инструменты. Как это спрашивают и частые ошибки.
Data lineage на собеседовании Data Engineer
Data lineage на собесе DE: column-level lineage, DataHub, Amundsen, OpenLineage, зачем нужно.
Дизайн data mart на собеседовании Data Engineer
Data mart на собесе DE: business-oriented, materialization, refresh strategy, ownership.
Data Mesh на собеседовании Data Engineer
Data Mesh на собесе DE: 4 принципа, отличие от data lake, domain ownership, data products.
Измерения качества данных на собеседовании Data Engineer
DQ dimensions на собесе DE: completeness, accuracy, consistency, timeliness, uniqueness, validity.
Data tiering на собеседовании Data Engineer
Data tiering на собесе DE: горячий, тёплый и холодный слои хранения, жизненный цикл данных, оптимизация стоимости. S3 lifecycle, TTL в ClickHouse, частые ошибки.
Data Vault 2.0 deep dive на собеседовании Data Engineer
Продвинутый Data Vault 2.0 на собесе DE: три слоя (Raw/Business/Mart), hash-ключи и hashdiff, PIT-таблицы, bridge-таблицы, ghost-записи. Разбор и частые ошибки.
Data Vault 2.0 на собеседовании Data Engineer
Data Vault 2.0 на собесе DE: hub, link, satellite, raw vault vs business vault, когда применять.
Моделирование DWH на собеседовании Data Engineer
DWH modeling на собесе DE: fact / dimension types, conformed dimensions, junk dim, mini-dim.
Database sharding на собеседовании Data Engineer
Sharding на собесе DE: hash, range, geographic, resharding, hotspots.
Databricks на собеседовании Data Engineer
Databricks на собесе DE: Lakehouse, Unity Catalog, Delta Lake, Photon, notebooks. Что спрашивают и как отвечать.
dbt Elementary на собеседовании Data Engineer
Elementary data observability на собесе DE: обнаружение аномалий, мониторы, алерты, отчёт, интеграция с dbt-тестами.
dbt exposures на собеседовании Data Engineer
dbt exposures на собесе DE: отслеживание потребителей моделей, дашборды, ML-модели, lineage, impact-анализ, применение в CI.
dbt incremental models на собеседовании Data Engineer
Incremental models в dbt на собесе DE: merge, append, insert_overwrite, late-arriving data, idempotency.
dbt: структура проекта и слои на собеседовании Data Engineer
Структура dbt-проекта на собесе DE: слои staging / intermediate / marts, соглашения по именованию, где ставить тесты и как отвечать интервьюеру.
dbt на собеседовании Data Engineer
dbt на собесе Data Engineer: модели, materializations, инкрементальные стратегии, тесты, snapshots, ref/source.
dbt snapshots на собеседовании Data Engineer
dbt snapshots на собесе DE: SCD Type 2 в dbt, timestamp vs check strategy, valid_from / valid_to.
dbt sources и macros на собеседовании Data Engineer
dbt sources, macros, ref на собесе DE: lineage, freshness, Jinja, custom macros.
dbt tests на собеседовании Data Engineer
dbt tests на собесе DE: generic, singular и custom-тесты, severity, warn/error-пороги, store_failures. Как отвечать и что проверяет интервьюер.
Apache Druid на собеседовании Data Engineer
Druid на собесе DE: real-time analytics, segments, ingestion, queries.
DWH cost optimization на собеседовании Data Engineer
DWH cost optimization на собесе DE: scan reduction, partitioning, materialized views, pricing.
Стадии DWH на собеседовании Data Engineer
Слои DWH на собесе DE: staging, ODS, DDS, mart, semantic layer, разделение ответственности.
Типичные ETL ловушки на собеседовании Data Engineer
ETL pitfalls на собесе DE: timezone, NULL, encoding, idempotency, late-arriving, race conditions.
Cloud ETL tools на собеседовании Data Engineer
Cloud ETL на собесе DE: AWS Glue, GCP Dataflow, Azure Data Factory, Yandex DataTransfer.
ETL vs ELT на собеседовании Data Engineer
ETL и ELT на собесе DE: отличия, эволюция, медальон, когда что выбирать.
EXPLAIN и план запроса на собеседовании Data Engineer
EXPLAIN на собесе DE: как читать план Postgres, seq scan vs index scan, joins, оценка cost, типичные проблемы.
Great Expectations на собеседовании Data Engineer
Great Expectations на собесе DE: data quality testing, expectations suites, integration с Airflow / dbt.