Metric Sense
Metric Sense
@MetricSensePro

LLM обычно меряют так, будто они живут в вакууме: accuracy, pass@k, MMLU. Но в реальном продукте ломается не «

LLM обычно меряют так, будто они живут в вакууме: accuracy, pass@k, MMLU. Но в реальном продукте ломается не «логика на экзамене», а поведение в неопределённости.

Именно поэтому эксперимент с «Бункером» полезнее многих бенчмарков. Там модель не решает задачу, а торгуется за место, статус и доверие. Это уже не про знание, а про координацию: умеет ли она слушать, менять позицию, помнить интересы группы и не застревать в одной стратегии.

Контрарный вывод простой: сильный LLM на тестах может быть слабым в сценариях, где нужна социальная адаптация. Это как продукт с высоким CTR и низкой ретеншеном — цифра есть, ценности нет.

Что смотреть вместо «умности» в вакууме:
— устойчивость позиции под давлением;
— скорость пересборки аргумента;
— способность учитывать чужие цели;
— долю решений, которые ведут к консенсусу, а не к тупику.

Если модель не умеет договариваться, ей будет трудно не только в «Бункере», но и в продукте, где почти каждый важный outcome — это переговоры между системами, людьми и ограничениями 🤖
Этот пост опубликован в Telegram-канале Metric Sense. Подписаться можно по ссылке: @MetricSensePro.
growth

Свежие посты в категории «Growth & Funnel»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.