VLM evaluation на собеседовании Data Scientist
Содержание:
Зачем оценивать VLM
VLM (vision-language model) — модель, которая принимает на вход и картинку, и текст: GPT-4V, Claude с vision, Qwen-VL, LLaVA, Gemini. На собесе Data Scientist их всё чаще спрашивают в контексте «как понять, что модель реально работает на вашей задаче».
Проблема в том, что VLM выглядят одинаково умными в демо, но сильно расходятся на конкретных задачах. Одна хорошо читает таблицы, но проваливает счёт объектов; другая отлично распознаёт сцену, но галлюцинирует текст на картинке. Поэтому «оценить VLM» — это не запустить один бенчмарк, а собрать набор метрик под конкретный use case: OCR, чтение графиков, пространственные рассуждения, знание предметной области.
Интервьюер проверяет, понимаете ли вы, что публичные бенчмарки — это ориентир, а не гарантия. Сильный ответ звучит так: «Возьму 2–3 релевантных бенчмарка для sanity-check, но финальное решение приму на кастомном golden set из своего домена».
VQA-бенчмарки
Visual Question Answering — базовый класс задач: модели дают картинку и вопрос, она отвечает текстом. Основные бенчмарки:
- VQAv2 — открытые вопросы по обычным фотографиям («сколько людей на снимке», «какого цвета машина»). Классический baseline, но задачи простые, потолок уже давно взят.
- OK-VQA (Outside Knowledge VQA) — вопросы, где ответа нет на самой картинке, нужны внешние знания о мире. Проверяет, умеет ли модель связать изображение со своими знаниями.
- ScienceQA — мультимодальные вопросы по школьной науке с картинками, диаграммами и объяснениями. Хорошо ловит способность к пошаговому рассуждению (chain-of-thought).
- TextVQA — вопросы про текст внутри изображения (вывеска, этикетка, экран). Здесь важен OCR плюс рассуждение поверх прочитанного, а не просто распознавание.
Понимание документов
Отдельная и коммерчески самая горячая ветка — работа с документами и структурированной графикой:
- DocVQA — вопросы к сканам документов: формы, чеки, отчёты, счета. Ближе всего к реальным продуктовым задачам (автоматизация бэк-офиса).
- ChartQA — чтение графиков и диаграмм: извлечь значение, сравнить бары, посчитать разницу. Проверяет, умеет ли модель не только «видеть» график, но и делать по нему арифметику.
- InfographicVQA — инфографика со сложной вёрсткой, иконками и смешением текста с визуалом. Сложнее DocVQA из-за плотной компоновки.
- RuDocVQA и подобные — версии на русских документах. Если продукт работает с русскоязычными сканами, англоязычные бенчмарки могут переоценивать качество, поэтому нужен локальный набор.
Специфические способности
Когда нужно проверить «умную» часть модели, а не только распознавание:
- MMMU (Massive Multi-discipline Multimodal Understanding) — вопросы уровня университета по десяткам дисциплин, с диаграммами и формулами. Один из самых сложных бенчмарков, хорошо разделяет топовые модели.
- MathVista — визуальная математика: задачи, где условие задано картинкой (геометрия, графики функций). Проверяет связку «восприятие + рассуждение».
- MM-Vet — комплексный бенчмарк, который меряет сразу несколько способностей: распознавание, OCR, знания, генерацию языка, пространственное мышление и математику.
- RealWorldQA — пространственные рассуждения на реальных фото (что ближе, что слева, поместится ли объект). Полезен для робототехники и навигации.
Важно помнить: у каждой модели свои слабые места. GPT-4V, например, исторически ошибается в точном подсчёте объектов, а некоторые модели плохо читают мелкий или рукописный текст. Именно поэтому один агрегированный балл почти ничего не говорит — смотреть надо на разрез по способностям.
Как считают метрики
Способ подсчёта зависит от формата ответа:
- Exact match / accuracy — для закрытых вопросов (multiple choice, число, короткая фраза). Просто, но чувствительно к формулировке: «5» и «пять» без нормализации считаются разными ответами.
- ANLS (Average Normalized Levenshtein Similarity) — стандарт для DocVQA: частичное совпадение строк, чтобы опечатка OCR не обнуляла балл.
- LLM-as-judge — для открытых ответов, где нет одной правильной строки. Сильную модель просят оценить ответ по рубрике (корректность, полнота, отсутствие галлюцинаций). Дёшево и масштабируемо, но судья сам может ошибаться и иметь bias — калибруйте его на подвыборке с ручной разметкой.
- Human eval — золотой стандарт для финального решения, дорогой и медленный. Обычно оставляют на небольшой набор самых важных кейсов.
Кастомная оценка
Для продакшена generic-бенчмарки почти всегда недостаточны — нужен свой golden set из реальных данных домена. Типичный пайплайн:
- Соберите 100–1000 репрезентативных кейсов из настоящего трафика продукта, а не случайных картинок.
- Разметьте эталонные ответы (ground truth), в идеале двумя аннотаторами с проверкой согласованности.
- Прогоните всех кандидатов (разные модели, промпты, версии) на одном и том же наборе.
- Оцените ответы через LLM-as-judge или людей, зафиксируйте метрику по каждой способности отдельно.
- Держите набор как регрессионный: при каждом обновлении модели или промпта прогоняйте заново и ловите деградации.
В чувствительных доменах (медицина, юриспруденция, финансы) публичные бенчмарки бесполезны как финальный критерий — кастомный набор обязателен, а к разметке привлекают экспертов домена.
Как это спрашивают на собесе
Формулировки, которые реально звучат:
- «У нас продукт распознаёт чеки. Как вы выберете VLM и докажете, что она лучше текущей?» — ждут: кастомный golden set чеков, метрика ANLS/accuracy по полям, а не общий балл на DocVQA.
- «Модель на бенчмарке показывает 85%, а в проде жалобы. Почему?» — ждут: distribution shift между бенчмарком и реальными данными, переобучение бенчмарка (data contamination), разрез по подтипам кейсов.
- «Как оценить открытые ответы, где нет одного правильного?» — ждут: LLM-as-judge с рубрикой плюс валидация судьи на ручной разметке.
- «Как поймать галлюцинации VLM?» — ждут: набор кейсов, где на картинке нет ответа, и проверка, что модель говорит «не знаю», а не выдумывает.
Частые ошибки
- Судить модель по одному агрегированному баллу. Средняя точность прячет провалы в конкретной способности (OCR, счёт). Всегда смотрите разрез.
- Доверять публичному лидерборду как финальному критерию. Данные бенчмарка могли попасть в обучение модели (contamination), а распределение отличается от вашего.
- Игнорировать язык и домен. Англоязычный DocVQA переоценит качество на русских сканах или на специфичных формах.
- Экономить на разметке golden set. Плохой ground truth делает всю оценку бессмысленной — мусор на входе, мусор на выходе.
- Не проверять галлюцинации отдельно. Модель может быть точной на «отвечаемых» вопросах и при этом уверенно врать там, где ответа на картинке нет.
Связанные темы
- Multimodal LLM для DS
- CLIP multimodal для DS
- Hallucinations и LLM evals для DS
- RAG eval для DS
- Подготовка к собесу Data Scientist
FAQ
Чем VLM eval отличается от обычного eval LLM?
Добавляется визуальная модальность: нужно проверять не только качество текста, но и восприятие картинки — OCR, чтение графиков, счёт объектов, пространственные отношения. Поэтому и бенчмарки другие (VQA, DocVQA, MMMU), и ошибки специфические: галлюцинации о том, чего на изображении нет.
Какой бенчмарк взять, если время ограничено?
Для быстрого sanity-check — MMMU (общий интеллект) и один прикладной под задачу: DocVQA для документов, ChartQA для графиков, TextVQA для сцен с текстом. Но финальное решение всё равно принимайте на своём golden set.
Можно ли доверять LLM-as-judge для оценки VLM?
Как масштабируемому инструменту — да, но с оговорками. Судья наследует свои bias и сам может галлюцинировать, поэтому его обязательно калибруют: берут 50–100 кейсов с ручной разметкой и проверяют, совпадает ли вердикт судьи с человеком.
Почему модель хорошо проходит бенчмарк, но плохо работает в проде?
Чаще всего — distribution shift: реальные данные отличаются от бенчмарка по языку, качеству сканов, типу вопросов. Плюс возможна data contamination — бенчмарк попал в обучающую выборку, и высокий балл не отражает обобщения.
Это официальная информация?
Нет. Статья основана на публичных VLM-бенчмарках и статьях (VQAv2, DocVQA, MMMU, MathVista, MM-Vet и др.). Конкретные требования зависят от компании, команды и уровня позиции.
Тренируйте Data Science — откройте тренажёр с 1500+ вопросами для собесов.