LLM обычно меряют так, будто они живут в вакууме: accuracy, pass@k, MMLU. Но в реальном продукте ломается не «логика на экзамене», а поведение в неопределённости.
Именно поэтому эксперимент с «Бункером» полезнее многих бенчмарков. Там модель не решает задачу, а торгуется за место, статус и доверие. Это уже не про знание, а про координацию: умеет ли она слушать, менять позицию, помнить интересы группы и не застревать в одной стратегии.
Контрарный вывод простой: сильный LLM на тестах может быть слабым в сценариях, где нужна социальная адаптация. Это как продукт с высоким CTR и низкой ретеншеном — цифра есть, ценности нет.
Что смотреть вместо «умности» в вакууме:
— устойчивость позиции под давлением;
— скорость пересборки аргумента;
— способность учитывать чужие цели;
— долю решений, которые ведут к консенсусу, а не к тупику.
Если модель не умеет договариваться, ей будет трудно не только в «Бункере», но и в продукте, где почти каждый важный outcome — это переговоры между системами, людьми и ограничениями 🤖
Metric Sense
@MetricSensePro
LLM обычно меряют так, будто они живут в вакууме: accuracy, pass@k, MMLU. Но в реальном продукте ломается не «
Этот пост опубликован в Telegram-канале Metric Sense. Подписаться можно по ссылке: @MetricSensePro.