Новая проверка для мультимодальных моделей: в сложной вертикали они пока заметно теряют точность
Исследователи представили CrystalXRD-Bench — небольшой, но очень жёсткий бенчмарк для распознавания XRD-паттернов. В наборе 250 примеров, собранных из 10 публичных кристаллографических баз. Задача не общая, а узкая: по изображению рентгеновской дифракции восстановить полный набор HKL для самого сильного пика.
На таком тесте прогнали 7 vision-language моделей. Лидером стал GPT-5.4: Jaccard 0.5888, exact match — 37.6%. Для остальных картина ещё слабее: у 6 из 7 моделей показатель Jaccard не дотянул до 0.50. То есть даже в небольшой и хорошо размеченной выборке модели часто дают неполный или неточный ответ.
Что важно для рынка CPA и digital в целом: это ещё один пример того, как «умный» поиск и AI-ответы в сложных тематиках не гарантируют стабильного качества. Когда задача требует не просто распознать картинку, а связать визуальный сигнал с текстовой и структурной информацией, ошибки накапливаются быстро.
У авторов у каждого кейса есть не только XRD-изображение, но и исходный CIF-текст с химической формулой. Такой формат полезен не только для науки: он показывает, где именно ломается модель — в зрении, в логике или в связке между ними. Для контентных и поисковых систем вывод простой: без чётких схем, подписей и структурированных данных видимость в AI-поиске будет нестабильной, особенно в нишах со сложной терминологией и плотной фактурой.
Если данные и код оценки действительно опубликуют, это станет удобной базой для проверки, насколько мультимодальные ответы готовы к прикладным сценариям, а не только к демонстрациям на витрине.
CPA Market Brief
@CpaMarketBrief
Новая проверка для мультимодальных моделей: в сложной вертикали они пока заметно теряют точность
Этот пост опубликован в Telegram-канале CPA Market Brief. Подписаться можно по ссылке: @CpaMarketBrief.