Собеседование на Data Scientist в Яндекс Лавке
Содержание:
Почему Яндекс Лавка — особенный работодатель для DS
Яндекс Лавка — это q-commerce (быстрая доставка продуктов за считанные минуты) внутри экосистемы Яндекс Go. Data Scientist здесь решает не абстрактные, а операционные задачи, от которых напрямую зависит, приедет ли заказ вовремя: прогноз времени доставки (ETA), предсказание спроса по конкретному дарксторе и часу, рекомендации товаров (recsys) и cross-sell, скоринг фрода, прогноз нагрузки на сборщиков.
Главная особенность — ML здесь real-time и операционный. Модель не просто выдаёт отчёт раз в неделю, а участвует в живом процессе: ошиблись с ETA — клиент недоволен, промахнулись с прогнозом спроса — товар закончился или испортился. Поэтому от кандидата ждут не только знания алгоритмов, но и понимания, как модель работает в проде под нагрузкой и как её ошибки конвертируются в деньги и в опыт пользователя. Подробнее о вакансиях — на странице карьеры Яндекса.
Информация в статье основана на публичных источниках и опыте кандидатов. Формат может отличаться по командам и грейдам. Уточняйте у рекрутера.
Этапы собеседования
Точный набор секций зависит от команды и грейда, но обычно воронка стандартная для DS-собеса в Яндексе и состоит из 5–6 этапов:
- Скрининг с рекрутером. Опыт, мотивация, ожидания по деньгам, знакомство с задачами Лавки.
- SQL и Python. Живое написание кода: агрегации, оконные функции, обработка данных на pandas.
- ML-теория. Классические модели, метрики, переобучение, валидация,特特 — как выбрать модель под задачу.
- ML system design. Спроектировать end-to-end решение: как собрать фичи, обучить, выкатить и мониторить модель в проде.
- Поведенческое и финал. Прошлые проекты по STAR, работа в команде, принятие решений в неопределённости.
Что Яндекс Лавка ценит в DS
- Recsys. Рекомендации товаров и cross-sell — как собрать корзину и поднять средний чек, не раздражая пользователя.
- Time series. Прогноз спроса и нагрузки во времени с учётом сезонности, дня недели и часа.
- Real-time ML. Понимание, как модель работает в проде под нагрузкой, с ограничениями по latency.
- Causal inference. Умение отделить корреляцию от причины: не «после этого», а «из-за этого».
- A/B-mindset. Способность честно измерить эффект изменения через эксперимент, а не по красивому графику.
Типичные задачи и кейсы
- ETA-модель. Спрогнозировать время доставки заказа с учётом расстояния, загрузки дарксторов, числа свободных курьеров, времени суток и погоды.
- Прогноз спроса по дарксторе и часу. Сколько единиц товара закажут в конкретной точке в конкретный час — от этого зависят запасы и списания скоропортящегося.
- Recsys SKU. Какие товары показать пользователю, чтобы он добавил их в корзину.
- Cross-sell сопутствующих товаров. Что предложить в дополнение к тому, что уже в корзине.
- Прогноз нагрузки на сборщиков. Сколько сборщиков нужно в смене, чтобы уложиться в SLA по времени сборки.
На кейсе важно вслух проговорить постановку: какую метрику оптимизируем, какие фичи возьмём, как провалидируем, как выкатим и как будем ловить деградацию модели в проде.
Как готовиться: план
- Recsys. Разберите классические подходы (коллаборативная фильтрация, контентные модели, эмбеддинги) и обязательно проблему cold start — как рекомендовать новым товарам и новым пользователям.
- Time series. Прогноз спроса: сезонность, тренд, признаки календаря; когда достаточно градиентного бустинга, а когда нужны специализированные модели.
- Классический ML. Бустинг, метрики, валидация, борьба с переобучением — фундамент, который спрашивают всегда.
- A/B-тесты. Дизайн эксперимента, выбор метрики, стат-значимость, типичные ловушки. Полезно освежить перед секцией.
- SQL. Ориентируйтесь на уверенный middle: оконные функции, соединения, агрегации на больших данных.
Частые ошибки
- Recsys без cold start. Предложить решение, которое разваливается на новых товарах и новых пользователях, — частый провал на кейсе.
- Слабый SQL. Отличная теория ML не спасёт, если кандидат не может написать корректный аналитический запрос.
- MAPE на нулях. Использовать MAPE как метрику ошибки прогноза спроса, забыв, что при нулевом фактическом спросе она уходит в бесконечность. В q-commerce нулей много — уместнее WAPE или MAE.
- Игнорировать latency. Предлагать тяжёлую модель, не думая, что в real-time она не уложится в бюджет по времени ответа.
Связанные темы
- Собеседование на DS в Я.Еде
- Собеседование на DS в Я.Go
- Собеседование на DS в Купер
- Embeddings на собесе DS
- Собеседование на PM в Я.Лавке
FAQ
Сколько этапов на собеседовании?
Обычно 5–6: скрининг, SQL/Python, ML-теория, ML system design и поведенческое с финалом. Точное число зависит от команды и грейда.
Нужен ли опыт в q-commerce или доставке?
Желателен, но не обязателен. Важнее понимать специфику операционного real-time ML: как ошибки модели превращаются в проблемы для клиента и в деньги. Опыт в смежных операционных доменах (логистика, маркетплейсы, райдтех) тоже ценится.
Какой нужен уровень SQL?
Ориентируйтесь на уверенный middle: оконные функции, сложные соединения, агрегации на больших объёмах. SQL спрашивают почти на всех DS-секциях, и слабый SQL часто становится причиной отказа.
Какие ML-темы важнее всего?
Recsys (с обязательным cold start), прогноз временных рядов для спроса и нагрузки, классический бустинг и грамотная работа с метриками и валидацией. Плюс A/B-мышление и базовое понимание causal inference.
Это официальная информация?
Нет. Этапы и требования основаны на публичных источниках и опыте кандидатов. Конкретный формат зависит от команды и грейда — уточняйте у рекрутера.