Собеседование на Data Scientist в Яндекс Лавке

Проверь себя · 1/3разбор после ответа
Команда в разведочном анализе решила показывать интервалы с уровнем доверия 90% вместо 95%. Какое утверждение корректно описывает последствия?

Почему Яндекс Лавка — особенный работодатель для DS

Яндекс Лавка — это q-commerce (быстрая доставка продуктов за считанные минуты) внутри экосистемы Яндекс Go. Data Scientist здесь решает не абстрактные, а операционные задачи, от которых напрямую зависит, приедет ли заказ вовремя: прогноз времени доставки (ETA), предсказание спроса по конкретному дарксторе и часу, рекомендации товаров (recsys) и cross-sell, скоринг фрода, прогноз нагрузки на сборщиков.

Главная особенность — ML здесь real-time и операционный. Модель не просто выдаёт отчёт раз в неделю, а участвует в живом процессе: ошиблись с ETA — клиент недоволен, промахнулись с прогнозом спроса — товар закончился или испортился. Поэтому от кандидата ждут не только знания алгоритмов, но и понимания, как модель работает в проде под нагрузкой и как её ошибки конвертируются в деньги и в опыт пользователя. Подробнее о вакансиях — на странице карьеры Яндекса.

Информация в статье основана на публичных источниках и опыте кандидатов. Формат может отличаться по командам и грейдам. Уточняйте у рекрутера.

Этапы собеседования

Точный набор секций зависит от команды и грейда, но обычно воронка стандартная для DS-собеса в Яндексе и состоит из 5–6 этапов:

  1. Скрининг с рекрутером. Опыт, мотивация, ожидания по деньгам, знакомство с задачами Лавки.
  2. SQL и Python. Живое написание кода: агрегации, оконные функции, обработка данных на pandas.
  3. ML-теория. Классические модели, метрики, переобучение, валидация,特特 — как выбрать модель под задачу.
  4. ML system design. Спроектировать end-to-end решение: как собрать фичи, обучить, выкатить и мониторить модель в проде.
  5. Поведенческое и финал. Прошлые проекты по STAR, работа в команде, принятие решений в неопределённости.

Что Яндекс Лавка ценит в DS

  • Recsys. Рекомендации товаров и cross-sell — как собрать корзину и поднять средний чек, не раздражая пользователя.
  • Time series. Прогноз спроса и нагрузки во времени с учётом сезонности, дня недели и часа.
  • Real-time ML. Понимание, как модель работает в проде под нагрузкой, с ограничениями по latency.
  • Causal inference. Умение отделить корреляцию от причины: не «после этого», а «из-за этого».
  • A/B-mindset. Способность честно измерить эффект изменения через эксперимент, а не по красивому графику.

Типичные задачи и кейсы

  • ETA-модель. Спрогнозировать время доставки заказа с учётом расстояния, загрузки дарксторов, числа свободных курьеров, времени суток и погоды.
  • Прогноз спроса по дарксторе и часу. Сколько единиц товара закажут в конкретной точке в конкретный час — от этого зависят запасы и списания скоропортящегося.
  • Recsys SKU. Какие товары показать пользователю, чтобы он добавил их в корзину.
  • Cross-sell сопутствующих товаров. Что предложить в дополнение к тому, что уже в корзине.
  • Прогноз нагрузки на сборщиков. Сколько сборщиков нужно в смене, чтобы уложиться в SLA по времени сборки.

На кейсе важно вслух проговорить постановку: какую метрику оптимизируем, какие фичи возьмём, как провалидируем, как выкатим и как будем ловить деградацию модели в проде.

Готовишься к собесу аналитика?
4000+ человек тренируются в Карьернике — 1700+ вопросов с реальных собеседований
Открыть Карьерник в Telegram

Как готовиться: план

  1. Recsys. Разберите классические подходы (коллаборативная фильтрация, контентные модели, эмбеддинги) и обязательно проблему cold start — как рекомендовать новым товарам и новым пользователям.
  2. Time series. Прогноз спроса: сезонность, тренд, признаки календаря; когда достаточно градиентного бустинга, а когда нужны специализированные модели.
  3. Классический ML. Бустинг, метрики, валидация, борьба с переобучением — фундамент, который спрашивают всегда.
  4. A/B-тесты. Дизайн эксперимента, выбор метрики, стат-значимость, типичные ловушки. Полезно освежить перед секцией.
  5. SQL. Ориентируйтесь на уверенный middle: оконные функции, соединения, агрегации на больших данных.

Частые ошибки

  • Recsys без cold start. Предложить решение, которое разваливается на новых товарах и новых пользователях, — частый провал на кейсе.
  • Слабый SQL. Отличная теория ML не спасёт, если кандидат не может написать корректный аналитический запрос.
  • MAPE на нулях. Использовать MAPE как метрику ошибки прогноза спроса, забыв, что при нулевом фактическом спросе она уходит в бесконечность. В q-commerce нулей много — уместнее WAPE или MAE.
  • Игнорировать latency. Предлагать тяжёлую модель, не думая, что в real-time она не уложится в бюджет по времени ответа.

Связанные темы

FAQ

Сколько этапов на собеседовании?

Обычно 5–6: скрининг, SQL/Python, ML-теория, ML system design и поведенческое с финалом. Точное число зависит от команды и грейда.

Нужен ли опыт в q-commerce или доставке?

Желателен, но не обязателен. Важнее понимать специфику операционного real-time ML: как ошибки модели превращаются в проблемы для клиента и в деньги. Опыт в смежных операционных доменах (логистика, маркетплейсы, райдтех) тоже ценится.

Какой нужен уровень SQL?

Ориентируйтесь на уверенный middle: оконные функции, сложные соединения, агрегации на больших объёмах. SQL спрашивают почти на всех DS-секциях, и слабый SQL часто становится причиной отказа.

Какие ML-темы важнее всего?

Recsys (с обязательным cold start), прогноз временных рядов для спроса и нагрузки, классический бустинг и грамотная работа с метриками и валидацией. Плюс A/B-мышление и базовое понимание causal inference.

Это официальная информация?

Нет. Этапы и требования основаны на публичных источниках и опыте кандидатов. Конкретный формат зависит от команды и грейда — уточняйте у рекрутера.