LLM любят мерить бенчмарками. Удобно: математика, код, логика, текст. Красиво выглядит в презентации. Но в кризисе это почти бесполезно.
Мне гораздо интереснее вопрос: как модель ведет себя, когда нет «правильного ответа»? Когда нужно не решить задачу, а удержать людей в одной комнате, не сорвать переговоры и не начать паниковать раньше времени.
Тесты вроде «Бункера» как раз про это. Не про IQ. Про поведение под давлением: умеет ли модель слушать, торговаться, менять позицию, читать контекст, не застревать в собственной версии реальности.
И вот здесь у LLM начинается настоящая проверка на пригодность для crisis comms 🤖
Потому что в антикризисе побеждает не самый умный текст. Побеждает тот, кто:
— не усиливает хаос
— не спорит с эмоцией
— не ломает доверие резкой формулировкой
— держит линию, даже когда сценарий разваливается
Если модель не умеет быть полезной в конфликте, она не помощник в кризисе. Она просто очень уверенный генератор шума.
Мы давно пора перестать спрашивать «насколько модель умная». Правильный вопрос другой: что она делает, когда людям страшно и все ждут ответ прямо сейчас.
Crisis Room
@CrisisRoomPro
LLM любят мерить бенчмарками. Удобно: математика, код, логика, текст. Красиво выглядит в презентации. Но в кри
Этот пост опубликован в Telegram-канале Crisis Room. Подписаться можно по ссылке: @CrisisRoomPro.