Когда узкая модельная задача проваливается, это обычно хороший сигнал не про саму модель, а про качество всей цепочки данных. В новом бенчмарке CrystalXRD-Bench это видно особенно
Сравнили 7 VLM-моделей. Лидером оказался GPT-5.4, но даже он набрал лишь Jaccard 0.5888, а exact match — 37.6%. У шести моделей из семи показатель Jaccard не дотянул до 0.50. Для узкой прикладной задачи это много говорит о границах текущего визуально-языкового подхода.
Почему это важно не только для материаловедения? Потому что XRD здесь — просто удобный тест на то, как модель работает с плотной структурированной информацией. Если алгоритм ошибается в разборе пиков, индексов и связей между ними, то в более привычных для нас сценариях будут те же риски: PDF-отчёты, таблицы медиаплана, скриншоты из кабинетов, графики по атрибуции, выгрузки из BI.
Для programmatic- и AdTech-команды вывод простой: автоматическое извлечение смысла из сложных документов нельзя считать “достаточно надёжным” только потому, что модель хорошо звучит на демо. В measurement, privacy-аналитике и supply path особенно опасны ошибки на уровне структуры: один неверно считанный столбец, одна перепутанная связь, и вся интерпретация уезжает.
Полезный практический вывод здесь не про отказ от AI, а про более жёсткую валидацию. Там, где решение влияет на бюджеты, инвентарь или отчётность, модель должна быть не только умной, но и проверяемой. И чем сложнее источник, тем меньше доверия к “автопониманию” без контроля.
Programmatic & AdTech Review
@ProgrammaticAdtechReview
Когда узкая модельная задача проваливается, это обычно хороший сигнал не про саму модель, а про качество всей
Этот пост опубликован в Telegram-канале Programmatic & AdTech Review. Подписаться можно по ссылке: @ProgrammaticAdtechReview.