LLM МОГУТ ПИСАТЬ КОД, НО ТЕРЯЮТСЯ В ПЕРЕГОВОРАХ
Стандартные бенчмарки хорошо меряют математику, код и понимание текста. Но они почти не показывают главное: как модель ведёт себя в конфликте интересов, при дефиците времени и необходимости договариваться.
Поэтому нейросети отправили не в тестовый экзамен, а в «Бункер» — сценарий, где выживание зависит не от правильного ответа, а от социальной стратегии. Здесь важны не только логика и память, но и умение:
— аргументировать без агрессии
— считывать контекст
— менять позицию, если ситуация разворачивается
— строить коалиции и удерживать доверие
И именно на таких задачах видно слабое место LLM: они могут быть сильны в симуляции рассуждения, но проваливаться в динамике человеческого взаимодействия. Это критично для всех, кто использует ИИ не как калькулятор, а как инструмент продаж, поддержки и коммуникации 🤖
Вывод простой: оценивать LLM только по сухим метрикам уже недостаточно. Если модель не умеет вести переговоры, её полезность в реальных сценариях резко падает.
SMM Разбор
@SmmRazborPro
LLM МОГУТ ПИСАТЬ КОД, НО ТЕРЯЮТСЯ В ПЕРЕГОВОРАХ
Этот пост опубликован в Telegram-канале SMM Разбор. Подписаться можно по ссылке: @SmmRazborPro.