LLM обычно меряют по бенчмаркам: математика, код, логика, текст. Но такие метрики почти не показывают, как модель ведёт себя в переговорах, при смене контекста и в ситуациях, где важнее не «правильный ответ», а умение договориться.
В новом тесте Gemini, ChatGPT и другие языковые модели проверяют через игру в «Бункер» — сценарий, где нужно аргументировать выбор, учитывать интересы группы и строить стратегию на несколько ходов вперёд. Для agency-ops это хороший пример: качественный AI-сервис — это не только точность, но и способность работать в среде с неопределённостью, конфликтом целей и социальными правилами. 🤖
Client Report Mix
@ClientReportPro
LLM обычно меряют по бенчмаркам: математика, код, логика, текст. Но такие метрики почти не показывают, как мод
Этот пост опубликован в Telegram-канале Client Report Mix. Подписаться можно по ссылке: @ClientReportPro.