🤖 Data Scientist и ML на собеседовании — страница 2

Что спрашивают у дата-сайентистов и ML-инженеров: от базовых метрик качества до продакшена моделей и мониторинга дрифта.

120 материалов · страница 2 из 3

Generative AI применения на собеседовании Data Scientist
GenAI на собесе DS: text, image, code, audio, video generation. Production patterns.
GPT architecture на собеседовании Data Scientist
Архитектура GPT на собесе DS: decoder-only, causal masking, Pre-LN и RMSNorm, RoPE и ALiBi, SwiGLU. Как это спрашивают и частые ошибки.
Hallucinations и LLM evals на собеседовании Data Scientist
LLM evals на собесе DS: hallucinations, RAGAS, LLM-as-judge, MMLU, custom benchmarks.
Holt-Winters на собеседовании Data Scientist
Holt-Winters на собесе DS: exponential smoothing, level/trend/seasonal, additive vs multiplicative.
Hyperparameter tuning на собеседовании Data Scientist
Hyperparameter tuning на собесе DS: grid search, random search, bayesian optimization, optuna, ошибки.
Image classifier ML system design на собеседовании Data Scientist
Image classifier design на собесе DS: data pipeline, augmentation, transfer, deployment.
Image segmentation на собеседовании Data Scientist
Сегментация изображений на собесе DS: U-Net, Mask R-CNN, SAM, semantic vs instance vs panoptic.
Inference optimization на собеседовании Data Scientist
Inference optimization на собесе DS: ONNX, TensorRT, batching, quantization, edge.
Калибровка вероятностей на собеседовании Data Scientist
Калибровка вероятностей на собесе DS: Platt scaling, isotonic, reliability diagram, Brier score.
Kalman filter на собеседовании Data Scientist
Kalman filter на собесе DS: state space, prediction, update, EKF, applications.
Knowledge graph на собеседовании Data Scientist
Knowledge graph на собесе DS: triples, RDF, embeddings, applications в search и LLM.
KV-cache и speculative decoding на собеседовании Data Scientist
LLM inference optimization на собесе DS: KV-cache, speculative decoding, FlashAttention, batching.
Квантование LLM на собеседовании Data Scientist
Quantization LLM на собесе DS: INT8, FP4, AWQ, GPTQ, GGUF, как работает и для чего.
LangChain на собеседовании Data Scientist
LangChain на собесе DS: цепочки, агенты, память, LangGraph, альтернативы и когда фреймворк не нужен.
Learning curves на собеседовании Data Scientist
Learning curves на собесе Data Scientist: кривые train и validation, диагностика bias и variance, когда помогут новые данные, validation curves. Что спрашивает интервьюер.
Linear vs logistic regression на собеседовании Data Scientist
Linear и logistic regression на собесе DS: формулы, лоссы, MLE, regularization, интерпретация коэффициентов.
Long context LLM на собеседовании Data Scientist
Long context на собесе DS: 100K-1M tokens, ALiBi, sparse attention, retrieval.
Loss-функции на собеседовании Data Scientist
Loss-функции на собесе DS: MSE, MAE, cross-entropy, hinge, focal loss — когда что выбирать.
Markov chains на собеседовании Data Scientist
Markov chains на собесе DS: transition matrix, stationary distribution, HMM, MCMC.
Meta-learning на собеседовании Data Scientist
Meta-learning на собесе DS: идея learn-to-learn, MAML, prototypical networks, Reptile, few-shot. Как спрашивают, типичные ошибки, FAQ.
Mixture of Experts на собеседовании Data Scientist
MoE на собесе DS: sparse activation, routing, applications в LLM, Mixtral.
Versioning ML datasets на собеседовании Data Scientist
Dataset versioning на собесе DS: DVC, Git LFS, lakeFS, reproducibility.
ML inference latency optimization на собеседовании Data Scientist
Latency optimization на собесе DS: model size, batching, caching, hardware.
MLflow и DVC на собеседовании Data Scientist
MLflow и DVC на собесе DS: experiment tracking, model registry, data versioning, что когда использовать.
MLOps мониторинг моделей на собеседовании Data Scientist
Model monitoring на собесе DS: data drift, performance, alerts, dashboards.
Model card на собеседовании Data Scientist
Model card на собесе DS: зачем нужна карточка модели, её структура, intended use, метрики по подгруппам, этические соображения и частые ошибки.
Стратегии деплоя ML-модели на собеседовании Data Scientist
Как деплоят ML-модели: REST API, batch, embedded, edge и streaming. Плюсы, минусы, latency vs throughput и как выбор стратегии спрашивают на собесе DS.
Model versioning на собеседовании Data Scientist
Model versioning на собесе DS: зачем нужен, model registry (MLflow), схемы именования (semver, timestamp), стадии жизненного цикла, rollback и частые ошибки.
Multi-armed bandit на собеседовании Data Scientist
MAB на собесе DS: epsilon-greedy, UCB, Thompson sampling, contextual bandits, отличие от A/B.
Multimodal LLM на собеседовании Data Scientist
Multimodal LLM на собесе DS: vision-language, GPT-4V, Claude Vision, applications.
Multi-task learning на собеседовании Data Scientist
Multi-task learning на собесе DS: hard / soft sharing, applications, transfer learning.
NumPy vectorization и broadcasting на собеседовании Data Scientist
NumPy на собесе DS: vectorization, broadcasting, dtype, memory layout, ускорение в 100×.
Online learning на собеседовании Data Scientist
Online learning на собесе DS: incremental updates, SGD, river, applications, отличие от batch.
Permutation importance на собеседовании Data Scientist
Permutation importance на собесе DS: алгоритм, отличие от feature_importances, ошибки.
Prompt engineering на собеседовании Data Scientist
Prompt engineering на собесе DS: роли сообщений, few-shot, chain-of-thought, ReAct, структурированный вывод и function calling. Механика, примеры и типичные ошибки.
Prompt injection на собеседовании Data Scientist
Prompt injection на собесе DS: direct, indirect, defenses, jailbreaks.
Pruning и distillation на собеседовании Data Scientist
Model pruning и knowledge distillation на собесе DS: techniques, teacher-student, structured pruning.
RAG evaluation на собеседовании Data Scientist
RAG eval на собесе DS: faithfulness, answer relevancy, context precision, RAGAS, golden set.
RAG на собеседовании Data Scientist
RAG на собесе DS: chunking, embeddings, vector search, hybrid retrieval, reranking, eval.
Ranking-метрики NDCG, MAP, MRR на собеседовании Data Scientist
Ranking-метрики на собесе DS: NDCG, MAP, MRR, Hit@K, Recall@K — формулы, примеры, когда что.
Recsys ML system design на собеседовании Data Scientist
System design рекомендаций на собесе DS: многоступенчатая архитектура, collaborative + content, cold start, online learning, метрики. Как спрашивают и частые ошибки.
Vector quantization для recsys на собеседовании Data Scientist
VQ для recsys на собесе DS: PQ, codebooks, multi-stage retrieval, latency.
Regression metrics на собеседовании Data Scientist
Regression metrics на собесе DS: MAE, MSE, RMSE, MAPE, R², when to use.
Регуляризация L1 vs L2 на собеседовании Data Scientist
L1, L2, ElasticNet регуляризация на собесе DS: математика, разница, когда что выбирать, sparse vs shrinkage.
Reinforcement learning на собеседовании Data Scientist
RL на собесе DS: MDP, Q-learning, policy gradient, DQN, PPO, applications.
RLHF и DPO на собеседовании Data Scientist
RLHF и DPO на собесе DS: как fine-tunes LLM, reward model, PPO, DPO как замена.
ROC-AUC vs PR-AUC на собеседовании Data Scientist
ROC-AUC и PR-AUC на собесе DS: формулы, разница, дисбаланс классов, когда что выбирать.
Search ranking ML system design на собеседовании Data Scientist
Search ranking design на собесе DS: BM25, dense retrieval, cross-encoder, learning-to-rank.

Другие разделы блога

🏢 Компании🗄 SQL🧪 A/B-тесты и статистика📊 Продуктовая аналитика🐍 Python🛠 Data Engineering🧩 Системный анализ🎯 Карьера и собеседования