Собеседование на Data Scientist в Яндекс Недвижимости

Проверь себя · 1/3разбор после ответа
Аналитик оценивает удержание по списку подписчиков на рассылку и делает выводы про всех пользователей продукта. В чём основная проблема такого подхода?

Почему Яндекс Недвижимость — особенный работодатель для DS

Яндекс Недвижимость — PropTech-сервис внутри Яндекса: поиск и размещение объявлений о продаже и аренде жилья. Для Data Scientist это в первую очередь задача оценки стоимости — AVM (automated valuation model, автоматическая оценка недвижимости): по параметрам квартиры и её расположению модель предсказывает рыночную цену. Рядом — рекомендации объявлений, детект спама и мошеннических объявлений, NLP-анализ текстов описаний и гео-кластеризация районов.

Особенность роли — сочетание PropTech-специфики и зрелого стека Яндекса. Данные тут разнородные: табличные признаки квартиры, текст объявления, фотографии, геокоординаты — и хорошая модель часто использует несколько типов сразу. При этом недвижимость — сфера, где цена решения высока: ошибка в оценке на десятки процентов бьёт по доверию, а пропущенное мошенническое объявление — по безопасности пользователей. Поэтому на собесе много внимания уделяют не только метрикам, но и интерпретируемости модели, обработке холодного старта в рекомендациях и устойчивости к спаму.

Актуальные вакансии и описание команд — на странице карьеры Яндекса.

Информация в статье основана на публичных источниках и опыте кандидатов. Формат может отличаться по командам и грейдам. Уточняйте у рекрутера.

Этапы собеседования

Обычно 5–6 этапов. Структура типовая для DS в Яндексе, с алгоритмической секцией и упором на классический ML.

1. Скрининг с рекрутером (30–45 минут)

Знакомство, проверка бэкграунда и мотивации. Полезно за пару минут рассказать про свой ML-проект: задача, данные, какую модель выбрали и почему, какой был результат в бизнес-метриках.

2. SQL и Python (60 минут)

Практический SQL (агрегации, оконные функции, JOIN) и Python для работы с данными: pandas, numpy, чистка и подготовка признаков. Часто с элементами алгоритмического мышления — Яндекс это любит.

3. Классический ML (60–90 минут)

Теория и практика: bias-variance, регуляризация, работа с переобучением, метрики для регрессии и классификации, градиентный бустинг (в задачах оценки и ранжирования он основной инструмент). Спросят, как валидировать модель и как объяснить её предсказания.

4. ML system design (60 минут)

Проектирование ML-системы под кейс — например, AVM для квартир или рекомендации объявлений. Смотрят, как вы формулируете задачу, выбираете признаки и метрику, обрабатываете холодный старт, продумываете обучение, инференс и мониторинг качества в проде.

5. Профильная секция (60 минут)

В зависимости от команды — углубление в рекомендации, NLP по текстам объявлений или геоаналитику. Могут дать прикладной кейс из домена недвижимости и разобрать его вместе.

6. Поведенческое и финал (45 минут)

Командная работа, как доносите результаты до продукта, как принимаете решения при неоднозначных метриках. Финал — с руководителем, обсуждение оффера.

Что Яндекс Недвижимость ценит в DS

  • Классический ML. Уверенное владение градиентным бустингом, работа с признаками, валидация и метрики — основа для задач оценки и ранжирования.
  • Рекомендательные системы. Понимание, как строить рекомендации объявлений и, главное, как решать холодный старт для новых объектов и пользователей.
  • Базовый NLP. Умение извлекать признаки из текстов объявлений: характеристики квартиры, качество описания, признаки спама.
  • Работа с разными типами данных. Модель часто объединяет табличные признаки, текст и фото — ценится умение это сочетать (multi-modal).
  • Геоданные. Работа с координатами и районами: гео-признаки, кластеризация, влияние локации на цену.

Типичные задачи и кейсы

  • «AVM для квартир». Построить модель оценки стоимости жилья по параметрам и локации, объяснить предсказания и оценить надёжность.
  • «Рекомендации объявлений». Подобрать релевантные объявления пользователю с учётом холодного старта для новых объектов.
  • «Детект спама». Классифицировать мошеннические и накрученные объявления, устойчиво к попыткам обойти фильтр.
  • «Извлечение характеристик из текста». NLP-парсинг описаний: вытащить площадь, ремонт, этаж и другие признаки из свободного текста.
  • «Гео-кластеризация». Сгруппировать районы по характеристикам для аналитики и признаков в модели цены.
Готовишься к собесу аналитика?
4000+ человек тренируются в Карьернике — 1700+ вопросов с реальных собеседований
Открыть Карьерник в Telegram

Как готовиться: план

  1. Классический ML. Повторите bias-variance, регуляризацию, метрики регрессии и классификации, градиентный бустинг и валидацию.
  2. Рекомендательные системы. Разберите базовые подходы и отдельно — стратегии для холодного старта.
  3. Базовый NLP. Освежите извлечение признаков из текста, эмбеддинги и простую классификацию.
  4. Геоданные. Поймите работу с координатами, гео-признаками и кластеризацией.
  5. SQL. Доведите до уверенного middle: агрегации, оконные функции, JOIN.

Частые ошибки

  • AVM без интерпретируемости. Показать модель с хорошей метрикой, но не уметь объяснить предсказание — в оценке недвижимости это важно для доверия.
  • Рекомендации без холодного старта. Забыть, что новые объявления и пользователи не имеют истории, и не предложить решение.
  • Слабый SQL. Плавать на оконных функциях и агрегациях для middle-позиции.

Связанные темы

FAQ

Сколько этапов на собесе DS в Яндекс Недвижимости?

Обычно 5–6: скрининг, SQL/Python, классический ML, ML system design, профильная секция и финал с поведенческими вопросами. Точный набор зависит от команды и грейда.

Нужен ли опыт в PropTech?

Желателен, но не обязателен. Важнее сильная база в классическом ML и рекомендациях: доменную специфику недвижимости обычно можно освоить на месте, а вот бустинг, валидация и холодный старт должны быть уверенными.

Что такое AVM и почему про него столько спрашивают?

AVM (automated valuation model) — модель автоматической оценки стоимости недвижимости по её параметрам и локации. Это ядро продукта, поэтому кандидата проверяют на умение построить такую модель, выбрать метрику и, что важно, объяснить её предсказания.

Какой уровень SQL ожидают?

Уверенный middle: агрегации, JOIN, оконные функции и умение подготовить выборку под анализ без подсказок.

Это официальная информация?

Нет. Этапы основаны на публичных источниках и опыте кандидатов и могут отличаться по командам и грейдам. Точный формат уточняйте у рекрутера.