Шесть LLM-судей, четыре лаборатории и три страны — а независимости почти нет 😅
На RAGTruth автор проверил комитет из 6 LLM-судей и выяснил: их ошибки заметно коррелируют, средняя попарная корреляция около 0,42. В итоге по независимому вкладу это не 6 голосов, а примерно 1,9.
Почему это важно? Потому что просто накидать моделей от разных вендоров — ещё не значит получить честное голосование. Если строите LLM-оценку, стоит помнить: консенсус может выглядеть сильнее одиночной модели, но реальной независимости там сильно меньше, чем кажется.
IT Самара — t.me/itsamara_news
IT Самара
@itsamara_news
Шесть LLM-судей, четыре лаборатории и три страны — а независимости почти нет 😅
Источники:
Этот пост опубликован в Telegram-канале IT Самара. Подписаться можно по ссылке: @itsamara_news.