VLM evaluation на собеседовании Data Scientist

Проверь себя · 1/3разбор после ответа
Если величина измеряется в минутах, в каких единицах измеряется стандартное отклонение этой величины?

Зачем оценивать VLM

VLM (vision-language model) — модель, которая принимает на вход и картинку, и текст: GPT-4V, Claude с vision, Qwen-VL, LLaVA, Gemini. На собесе Data Scientist их всё чаще спрашивают в контексте «как понять, что модель реально работает на вашей задаче».

Проблема в том, что VLM выглядят одинаково умными в демо, но сильно расходятся на конкретных задачах. Одна хорошо читает таблицы, но проваливает счёт объектов; другая отлично распознаёт сцену, но галлюцинирует текст на картинке. Поэтому «оценить VLM» — это не запустить один бенчмарк, а собрать набор метрик под конкретный use case: OCR, чтение графиков, пространственные рассуждения, знание предметной области.

Интервьюер проверяет, понимаете ли вы, что публичные бенчмарки — это ориентир, а не гарантия. Сильный ответ звучит так: «Возьму 2–3 релевантных бенчмарка для sanity-check, но финальное решение приму на кастомном golden set из своего домена».

VQA-бенчмарки

Visual Question Answering — базовый класс задач: модели дают картинку и вопрос, она отвечает текстом. Основные бенчмарки:

  • VQAv2 — открытые вопросы по обычным фотографиям («сколько людей на снимке», «какого цвета машина»). Классический baseline, но задачи простые, потолок уже давно взят.
  • OK-VQA (Outside Knowledge VQA) — вопросы, где ответа нет на самой картинке, нужны внешние знания о мире. Проверяет, умеет ли модель связать изображение со своими знаниями.
  • ScienceQA — мультимодальные вопросы по школьной науке с картинками, диаграммами и объяснениями. Хорошо ловит способность к пошаговому рассуждению (chain-of-thought).
  • TextVQA — вопросы про текст внутри изображения (вывеска, этикетка, экран). Здесь важен OCR плюс рассуждение поверх прочитанного, а не просто распознавание.

Понимание документов

Отдельная и коммерчески самая горячая ветка — работа с документами и структурированной графикой:

  • DocVQA — вопросы к сканам документов: формы, чеки, отчёты, счета. Ближе всего к реальным продуктовым задачам (автоматизация бэк-офиса).
  • ChartQA — чтение графиков и диаграмм: извлечь значение, сравнить бары, посчитать разницу. Проверяет, умеет ли модель не только «видеть» график, но и делать по нему арифметику.
  • InfographicVQA — инфографика со сложной вёрсткой, иконками и смешением текста с визуалом. Сложнее DocVQA из-за плотной компоновки.
  • RuDocVQA и подобные — версии на русских документах. Если продукт работает с русскоязычными сканами, англоязычные бенчмарки могут переоценивать качество, поэтому нужен локальный набор.

Специфические способности

Когда нужно проверить «умную» часть модели, а не только распознавание:

  • MMMU (Massive Multi-discipline Multimodal Understanding) — вопросы уровня университета по десяткам дисциплин, с диаграммами и формулами. Один из самых сложных бенчмарков, хорошо разделяет топовые модели.
  • MathVista — визуальная математика: задачи, где условие задано картинкой (геометрия, графики функций). Проверяет связку «восприятие + рассуждение».
  • MM-Vet — комплексный бенчмарк, который меряет сразу несколько способностей: распознавание, OCR, знания, генерацию языка, пространственное мышление и математику.
  • RealWorldQA — пространственные рассуждения на реальных фото (что ближе, что слева, поместится ли объект). Полезен для робототехники и навигации.

Важно помнить: у каждой модели свои слабые места. GPT-4V, например, исторически ошибается в точном подсчёте объектов, а некоторые модели плохо читают мелкий или рукописный текст. Именно поэтому один агрегированный балл почти ничего не говорит — смотреть надо на разрез по способностям.

Как считают метрики

Способ подсчёта зависит от формата ответа:

  • Exact match / accuracy — для закрытых вопросов (multiple choice, число, короткая фраза). Просто, но чувствительно к формулировке: «5» и «пять» без нормализации считаются разными ответами.
  • ANLS (Average Normalized Levenshtein Similarity) — стандарт для DocVQA: частичное совпадение строк, чтобы опечатка OCR не обнуляла балл.
  • LLM-as-judge — для открытых ответов, где нет одной правильной строки. Сильную модель просят оценить ответ по рубрике (корректность, полнота, отсутствие галлюцинаций). Дёшево и масштабируемо, но судья сам может ошибаться и иметь bias — калибруйте его на подвыборке с ручной разметкой.
  • Human eval — золотой стандарт для финального решения, дорогой и медленный. Обычно оставляют на небольшой набор самых важных кейсов.
Готовишься к собесу Data Scientist?
ML, Deep Learning, NLP, MLOps — вопросы с разборами в Telegram
Тренировать DS в Telegram

Кастомная оценка

Для продакшена generic-бенчмарки почти всегда недостаточны — нужен свой golden set из реальных данных домена. Типичный пайплайн:

  1. Соберите 100–1000 репрезентативных кейсов из настоящего трафика продукта, а не случайных картинок.
  2. Разметьте эталонные ответы (ground truth), в идеале двумя аннотаторами с проверкой согласованности.
  3. Прогоните всех кандидатов (разные модели, промпты, версии) на одном и том же наборе.
  4. Оцените ответы через LLM-as-judge или людей, зафиксируйте метрику по каждой способности отдельно.
  5. Держите набор как регрессионный: при каждом обновлении модели или промпта прогоняйте заново и ловите деградации.

В чувствительных доменах (медицина, юриспруденция, финансы) публичные бенчмарки бесполезны как финальный критерий — кастомный набор обязателен, а к разметке привлекают экспертов домена.

Как это спрашивают на собесе

Формулировки, которые реально звучат:

  • «У нас продукт распознаёт чеки. Как вы выберете VLM и докажете, что она лучше текущей?» — ждут: кастомный golden set чеков, метрика ANLS/accuracy по полям, а не общий балл на DocVQA.
  • «Модель на бенчмарке показывает 85%, а в проде жалобы. Почему?» — ждут: distribution shift между бенчмарком и реальными данными, переобучение бенчмарка (data contamination), разрез по подтипам кейсов.
  • «Как оценить открытые ответы, где нет одного правильного?» — ждут: LLM-as-judge с рубрикой плюс валидация судьи на ручной разметке.
  • «Как поймать галлюцинации VLM?» — ждут: набор кейсов, где на картинке нет ответа, и проверка, что модель говорит «не знаю», а не выдумывает.

Частые ошибки

  • Судить модель по одному агрегированному баллу. Средняя точность прячет провалы в конкретной способности (OCR, счёт). Всегда смотрите разрез.
  • Доверять публичному лидерборду как финальному критерию. Данные бенчмарка могли попасть в обучение модели (contamination), а распределение отличается от вашего.
  • Игнорировать язык и домен. Англоязычный DocVQA переоценит качество на русских сканах или на специфичных формах.
  • Экономить на разметке golden set. Плохой ground truth делает всю оценку бессмысленной — мусор на входе, мусор на выходе.
  • Не проверять галлюцинации отдельно. Модель может быть точной на «отвечаемых» вопросах и при этом уверенно врать там, где ответа на картинке нет.

Связанные темы

FAQ

Чем VLM eval отличается от обычного eval LLM?

Добавляется визуальная модальность: нужно проверять не только качество текста, но и восприятие картинки — OCR, чтение графиков, счёт объектов, пространственные отношения. Поэтому и бенчмарки другие (VQA, DocVQA, MMMU), и ошибки специфические: галлюцинации о том, чего на изображении нет.

Какой бенчмарк взять, если время ограничено?

Для быстрого sanity-check — MMMU (общий интеллект) и один прикладной под задачу: DocVQA для документов, ChartQA для графиков, TextVQA для сцен с текстом. Но финальное решение всё равно принимайте на своём golden set.

Можно ли доверять LLM-as-judge для оценки VLM?

Как масштабируемому инструменту — да, но с оговорками. Судья наследует свои bias и сам может галлюцинировать, поэтому его обязательно калибруют: берут 50–100 кейсов с ручной разметкой и проверяют, совпадает ли вердикт судьи с человеком.

Почему модель хорошо проходит бенчмарк, но плохо работает в проде?

Чаще всего — distribution shift: реальные данные отличаются от бенчмарка по языку, качеству сканов, типу вопросов. Плюс возможна data contamination — бенчмарк попал в обучающую выборку, и высокий балл не отражает обобщения.

Это официальная информация?

Нет. Статья основана на публичных VLM-бенчмарках и статьях (VQAv2, DocVQA, MMMU, MathVista, MM-Vet и др.). Конкретные требования зависят от компании, команды и уровня позиции.


Тренируйте Data Science — откройте тренажёр с 1500+ вопросами для собесов.