LLM можно прогнать не только через MMLU и кодинг-бенчи, но и через сценарий, где важны переговоры, память и стратегия.
Игра «Бункер» — нормальный стресс-тест на социальное поведение модели.
Что там измеряется на практике:
— удержание роли и целей в длинном диалоге
— умение торговаться без развала аргументации
— адаптация к меняющимся условиям
— устойчивость к манипуляциям и конфликтам
Почему это интересно технарям:
в реальных агентных системах модель редко решает одну задачу в вакууме. Она ведёт цепочку действий, обменивается сообщениями, меняет план и должна не терять контекст. Это уже не «знает/не знает», а «как ведёт себя под давлением» 🤖
Если смотреть инженерно, такой тест полезен как дополнение к классическим метрикам:
1) логируем решения по ходам
2) сравниваем стабильность позиции
3) считаем, где модель ломает стратегию
Итог простой: LLM могут быть сильны в выводах, но проваливаться в динамике группы. Именно там часто всплывает реальная граница качества.
TechSEO Lab
@TechSEOLabPro
LLM можно прогнать не только через MMLU и кодинг-бенчи, но и через сценарий, где важны переговоры, память и ст
Этот пост опубликован в Telegram-канале TechSEO Lab. Подписаться можно по ссылке: @TechSEOLabPro.