🤖 Data Scientist и ML на собеседовании — страница 3

Что спрашивают у дата-сайентистов и ML-инженеров: от базовых метрик качества до продакшена моделей и мониторинга дрифта.

120 материалов · страница 3 из 3

Self-supervised learning на собеседовании Data Scientist
SSL на собесе DS: pretext tasks, contrastive, masked, SimCLR, MoCo, BYOL.
SHAP и интерпретируемость моделей для Data Scientist
SHAP, LIME, feature importance, interpretability на собесе DS: что использовать, типичные ошибки.
Stable Diffusion и GAN на собеседовании Data Scientist
Generative модели на собесе DS: GAN, diffusion, Stable Diffusion архитектура, applications.
Survival analysis на собеседовании Data Scientist
Survival analysis на собесе DS: Kaplan-Meier, Cox regression, censored data, hazard ratio.
SVD на собеседовании Data Scientist
SVD на собесе DS: формула, связь с PCA, применение в recsys, dimensionality reduction, intuition.
T-tests на собеседовании Data Scientist
T-test на собесе DS: одно- и двухвыборочный, парный, Welch's, предпосылки и что делать при их нарушении. Как спрашивают и частые ошибки.
Tabular deep learning на собеседовании Data Scientist
DL для tabular на собесе DS: TabNet, NODE, FT-Transformer, vs gradient boosting.
Multi-label classification на собеседовании Data Scientist
Multi-label на собесе DS: BCE per label, micro / macro F1, threshold tuning.
Temperature и sampling в LLM на собеседовании Data Scientist
Decoding на собесе DS: temperature, top-k, top-p, beam search, repetition penalty.
Text classification на собеседовании Data Scientist
Text classification на собесе DS: TF-IDF + linear, BERT fine-tune, sentence embeddings + classifier.
Time series CV и фичи на собеседовании Data Scientist
Time series cross-validation, lag-фичи, rolling stats, утечки на собесе DS.
Transformer на собеседовании Data Scientist
Архитектура Transformer на собесе DS: self-attention, positional encoding, encoder/decoder, BERT, GPT.
Two-tower DSSM на собеседовании Data Scientist
Two-tower / DSSM на собесе DS: архитектура, обучение, in-batch negatives, ANN search.
Uplift modeling на собеседовании Data Scientist
Uplift modeling на собесе DS: causal forest, T-learner, S-learner, ITE.
Vector databases на собеседовании Data Scientist
Vector DBs на собесе DS: pgvector, Pinecone, Weaviate, Qdrant, ANN search для embeddings.
Vector search optimization на собеседовании Data Scientist
Vector search optimization на собесе DS: ANN tuning, quantization, clustering, hybrid.
VLM evaluation на собеседовании Data Scientist
Как оценивают vision-language модели на собесе DS: VQA-бенчмарки, понимание документов, MMMU и MathVista, кастомный golden set и LLM-as-judge.
word2vec vs GloVe vs FastText на собеседовании Data Scientist
Word embeddings на собесе DS: word2vec (Skip-gram, CBOW), GloVe, FastText — отличия, применение.
XGBoost vs LightGBM vs CatBoost на собеседовании Data Scientist
Gradient boosting на собесе DS: XGBoost, LightGBM, CatBoost — отличия, когда что выбирать.
YOLO и DETR на собеседовании Data Scientist
Object detection на собесе DS: YOLO, DETR, R-CNN — отличия архитектур, anchor-based vs anchor-free.
Deep Learning на собеседовании Data Scientist
Deep Learning на собеседовании Data Scientist: MLP, CNN, RNN, transformers, регуляризация, обучение.
Классический ML на собеседовании Data Scientist
Классический ML на собеседовании Data Scientist: линейные модели, деревья, бустинг, кластеризация, метрики.
MLOps на собеседовании Data Scientist
MLOps на собеседовании Data Scientist: pipelines, serving, мониторинг, A/B-тесты моделей, drift.
NLP на собеседовании Data Scientist
NLP на собеседовании Data Scientist: токенизация, embeddings, BERT, GPT, fine-tuning, основные задачи.

Другие разделы блога

🏢 Компании🗄 SQL🧪 A/B-тесты и статистика📊 Продуктовая аналитика🐍 Python🛠 Data Engineering🧩 Системный анализ🎯 Карьера и собеседования