Agentic search учат ценить не только ответ, но и маршрут к нему
В arXiv появилась работа, где авторы предлагают смотреть на поиск как на цепочку шагов, а не как на один финальный результат. Их подход GDCR (Graph-Distance Contribution Reward) оценивает, насколько каждый новый факт, сущность или цитата реально приблизили систему к правильному ответу в обучающем графе сущностей и связей.
Вместе с этим они добавляют SAPO — схему, которая объединяет два уровня оценки: вклад отдельных шагов и общий результат всей траектории. То есть модель начинают обучать не по принципу «угадал/не угадал», а по тому, какие промежуточные действия были полезны для вывода.
Проверяли метод на четырёх бенчмарках, и сам сдвиг здесь важнее конкретной метрики. Для AI Search это сигнал, что уходит логика грубого tree sampling, когда система накапливает много вариантов и выбирает лучший почти вслепую. На первый план выходит качество цепочки: какие сущности связаны между собой, насколько точны цитаты, есть ли у ответа понятная опора на граф фактов.
Для редакторов, SEO и контент-команд вывод простой: в agentic-поиске ценятся не только «правильные слова», но и связность материала. Структурированные сущности, аккуратные ссылки на источники и логика изложения становятся частью того, как система собирает и ранжирует ответ.
Market Digests Daily 4
@MarketDigestsDaily4
Agentic search учат ценить не только ответ, но и маршрут к нему
Этот пост опубликован в Telegram-канале Market Digests Daily 4. Подписаться можно по ссылке: @MarketDigestsDaily4.