Собеседование на Data Engineer в СберЗдоровье

Проверь себя · 1/3разбор после ответа
Нужно посчитать выручку как price * quantity, где quantity может быть NULL (поле не заполнили). По бизнес-правилу пропуск нужно трактовать как 1. Какое выражение корректнее?

Почему СберЗдоровье — особенный работодатель для DE

СберЗдоровье — медтех-сервис в экосистеме Сбера: телемедицина, запись к врачам, электронные рецепты, интеграции с клиниками и страховыми. Для Data Engineer это означает работу с одними из самых чувствительных данных, которые вообще бывают, — медицинскими. Через pipeline проходят записи телеконсультаций, назначения, рецепты, данные по ОМС и обезличенные выборки для ML-задач (например, анализ текстов жалоб пациентов).

Главная особенность роли — двойной уровень защиты данных. Медицинская информация — это и персональные данные (152-ФЗ), и врачебная тайна одновременно, поэтому требования к приватности строже, чем в обычном продукте. DE здесь не просто строит витрины: он проектирует так, чтобы персональные данные маскировались или обезличивались до попадания в аналитику, чтобы доступ к чувствительным полям логировался, а по логам можно было восстановить, кто и когда обращался к медданным. На собесе это выливается в вопросы про маскирование PII, разграничение доступа и аудит — наравне с классическим DE-стеком Spark и ClickHouse.

Актуальные вакансии и описание команд — на странице карьеры Сбера.

Информация в статье основана на публичных источниках и опыте кандидатов. Формат может отличаться по командам и грейдам. Уточняйте у рекрутера.

Этапы собеседования

Обычно 5–6 этапов. Технический костяк такой же, как у DE в других продуктах Сбера, но с сильным акцентом на приватность и работу с чувствительными данными.

1. Скрининг с рекрутером (30–45 минут)

Знакомство, проверка стека и мотивации идти в медтех. Полезно коротко описать один свой проект и отдельно упомянуть опыт с чувствительными данными, если он есть, — это здесь ценится.

2. SQL и Python (60–90 минут)

Практический SQL уровня middle-senior: оконные функции, CTE, дедупликация, оптимизация. Python — обработка данных и простые ETL-скрипты. Обычно live coding с проговариванием хода мысли.

3. Spark (60 минут)

Как устроены трансформации и action-и, борьба с data skew, broadcast join, чтение плана выполнения. Разобрать поможет Spark на собесе DE.

4. Хранилище и ClickHouse (45–60 минут)

Моделирование DWH и вопросы по ClickHouse: движки MergeTree, партиционирование, материализованные представления. Отдельно могут спросить, как разложить медицинские данные по слоям так, чтобы обезличенные витрины были отделены от сырых персональных данных.

5. Приватность и архитектура (60 минут)

Ключевая для этой компании секция. Проектирование pipeline с учётом защиты данных: где маскируются PII, как устроено разграничение доступа, как ведётся аудит обращений к медданным, как не утащить персональные данные в логи. Вопросы про 152-ФЗ и врачебную тайну — на уровне «как это влияет на архитектуру», а не юридических формулировок.

6. Поведенческое и финал (45 минут)

Командная работа, инциденты, ответственность при работе с чувствительными данными. Финал — с руководителем, обсуждение оффера.

Что СберЗдоровье ценит в DE

  • Spark. Уверенная обработка больших батчей: трансформации, шафлы, оптимизации — базовый инструмент для расчётов.
  • Защита данных. Понимание 152-ФЗ и врачебной тайны на уровне архитектуры: что можно хранить, где маскировать, как обезличивать до аналитики.
  • ClickHouse. Аналитическое хранение: движки MergeTree, партиционирование, материализованные представления.
  • DWH. Проектирование слоёв хранилища с чётким разделением сырых персональных данных и обезличенных витрин.
  • Аудит доступа. Умение спроектировать журналирование: кто, когда и к каким медданным обращался, чтобы это можно было проверить.

Типичные задачи и кейсы

  • «Pipeline телеконсультаций». Сбор и обработка данных о телемедицинских приёмах с сохранением приватности пациентов.
  • «Интеграция с ОМС». Приём и разбор данных в формате обмена с системой ОМС, приведение к своей модели.
  • «NLP-pipeline жалоб». Подготовка обезличенных текстов обращений пациентов для ML-модели: очистка, маскирование персональных данных.
  • «Маскирование PII в логах». Как гарантировать, что персональные данные не утекают в логи и трассировки сервисов.
  • «Аудит доступа к медданным». Проектирование журнала обращений к чувствительным данным для контроля и расследований.
Готовишься к собесу аналитика?
4000+ человек тренируются в Карьернике — 1700+ вопросов с реальных собеседований
Открыть Карьерник в Telegram

Как готовиться: план

  1. Spark. Разберите модель выполнения, шафлы, broadcast join, борьбу с data skew и чтение плана.
  2. Защита данных. Освежите базу по 152-ФЗ и врачебной тайне и продумайте, как это влияет на архитектуру: маскирование, обезличивание, разграничение доступа.
  3. ClickHouse. Повторите движки MergeTree, партиционирование и материализованные представления.
  4. DWH. Потренируйтесь проектировать слои хранилища с разделением сырых персональных данных и обезличенных витрин.
  5. SQL. Доведите до уверенного middle-senior: оконные функции, дедупликация, оптимизация.

Частые ошибки

  • Игнорировать защиту данных. Проектировать pipeline, не думая про маскирование PII и разграничение доступа, — для медтеха это дисквалифицирующая ошибка.
  • Слабый SQL. Плавать на оконных функциях и оптимизации на позиции middle-senior.
  • PII без маскирования. Тащить персональные данные в аналитику, логи или дев-окружение в открытом виде.

Связанные темы

FAQ

Сколько этапов на собесе DE в СберЗдоровье?

Обычно 5–6: скрининг, SQL/Python, Spark, ClickHouse и DWH, секция про приватность и архитектуру, поведенческое и финал. Точный набор зависит от команды и грейда.

Нужен ли опыт в медтехе?

Желателен, но не обязателен. Гораздо важнее опыт работы с чувствительными данными и понимание, как устроены маскирование, обезличивание и разграничение доступа — это переносится из любой регулируемой сферы (финтех, госсектор).

Насколько глубоко спрашивают про 152-ФЗ и врачебную тайну?

Не как юриста. Ждут понимания, как требования к защите данных влияют на архитектуру: где маскировать PII, что можно хранить, как разделять сырые персональные данные и обезличенные витрины, как вести аудит доступа.

Какой уровень SQL ожидают?

Middle-senior: уверенные оконные функции, CTE, дедупликация и оптимизация запросов.

Это официальная информация?

Нет. Этапы основаны на публичных источниках и опыте кандидатов и могут отличаться по командам и грейдам. Точный формат уточняйте у рекрутера.