Когда модель видит картинку, но не понимает метрику
Вышел бенчмарк CrystalXRD-Bench: 250 примеров из 10 публичных кристаллографических наборов, где модели нужно не просто «описать изображение», а восстановить полный набор HKL для самого сильного пика на XRD-паттерне.
Задача выглядит узкой, но для атрибуции и измерений она очень показательная. Тут проверяют не распознавание формы как таковой, а способность связать визуальный сигнал с структурной интерпретацией. Это примерно тот же разрыв, который мы видим в маркетинговой аналитике, когда система умеет нарисовать красивый дашборд, но ошибается в логике расчёта, дедупликации событий или чтении источника.
В бенчмарке у каждого примера есть три слоя данных: сам XRD-рендер, текст CIF и химическая формула. Такой дизайн удобен именно для диагностики ошибок — можно понять, модель промахнулась на уровне изображения, на уровне текста или на этапе объединения признаков.
Результаты не выглядят впечатляюще: лучший Jaccard — 0.5888 у GPT-5.4, exact match — 37.6%. Для задач, где нужен точный разбор структуры, этого мало. Вывод простой: VLM всё ещё хорошо ловят паттерны, но плохо держат сложную предметную логику, если она завязана на специализированные обозначения и строгую интерпретацию.
Для команд, которые тестируют AI в аналитике, это полезный сигнал. Если модель работает с графиками, таблицами, воронками, server-side событиями или MMM-выкладками, её стоит проверять не только на «похоже/не похоже», а на точность связки между визуальным выводом и исходными данными. В таких задачах ошибка часто не в картинке, а в том, как модель решила её прочитать.
Index Attribution & Measurement Notes
@IndexAttributionMeasurementNotes
Когда модель видит картинку, но не понимает метрику
Этот пост опубликован в Telegram-канале Index Attribution & Measurement Notes. Подписаться можно по ссылке: @IndexAttributionMeasurementNotes.