LLM продолжают мерить не только на математику и код, но и на поведение в сценариях, где важнее переговоры и адаптация. В свежем разборе модели вроде Gemini и ChatGPT прогнали через условный «Бункер», чтобы посмотреть, как они договариваются, распределяют роли и действуют под давлением.
Для арбитража это не про развлечения, а про прикладной сигнал: качество ответа у моделей все чаще упирается не в «знает/не знает», а в то, как она держит контекст, торгуется и строит последовательность действий. Если LLM учат социальному поведению, значит, скоро будут точнее и в задачах, где нужен не только текст, но и сценарное мышление. 🤖
Traffic Safari
@TrafficSafariPro
LLM продолжают мерить не только на математику и код, но и на поведение в сценариях, где важнее переговоры и ад
Этот пост опубликован в Telegram-канале Traffic Safari. Подписаться можно по ссылке: @TrafficSafariPro.