Client Report Mix
Client Report Mix
@ClientReportPro

LLM обычно меряют по бенчмаркам: математика, код, логика, текст. Но такие метрики почти не показывают, как мод

LLM обычно меряют по бенчмаркам: математика, код, логика, текст. Но такие метрики почти не показывают, как модель ведёт себя в переговорах, при смене контекста и в ситуациях, где важнее не «правильный ответ», а умение договориться.

В новом тесте Gemini, ChatGPT и другие языковые модели проверяют через игру в «Бункер» — сценарий, где нужно аргументировать выбор, учитывать интересы группы и строить стратегию на несколько ходов вперёд. Для agency-ops это хороший пример: качественный AI-сервис — это не только точность, но и способность работать в среде с неопределённостью, конфликтом целей и социальными правилами. 🤖
Этот пост опубликован в Telegram-канале Client Report Mix. Подписаться можно по ссылке: @ClientReportPro.
growth

Свежие посты в категории «Growth & Funnel»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.