LLM-судья уверенно ставил 18/20 — а реальная проверка давала 8/20 🤖
Команда строила оценку для AI-агента поддержки и сначала смотрела только на текст диалога. В итоге правдоподобный ответ легко проходил за правильный: судья не видел, вызывал ли агент нужные инструменты и подтвердил ли результат на деле. Даже «процент фантомных эскалаций» измерял не качество продукта, а согласованность слов бота с его внутренними флагами.
Тогда оценку вынесли в отдельный сервис с собственным источником истины и дважды переписали формулу вердикта. Получился эталонный набор, который помог найти слепые зоны — и понять, почему неправильным ошибкам тоже нельзя доверять.
IT Хабаровск — t.me/itnews_khabarovsk
IT Хабаровск
@itnews_khabarovsk
LLM-судья уверенно ставил 18/20 — а реальная проверка давала 8/20 🤖
Источники:
Этот пост опубликован в Telegram-канале IT Хабаровск. Подписаться можно по ссылке: @itnews_khabarovsk.