AI Landing Gen — генерация лендингов через ИИ

MT-Bench: релиз года для тех, кто хочет мерить чат-модели не на глаз, а по сценарию

MT-Bench: релиз года для тех, кто хочет мерить чат-модели не на глаз, а по сценарию

MT-Bench — это не «кто лучше пишет стихи», а попытка прогнать LLM через набор многоходовых диалогов и сравнить ответы по заранее заданной рубрике. Идея простая: у модели проверяют не только фактологию, но и умение держать контекст, следовать инструкции и не разваливаться на втором вопросе.

Если используете этот бенч как ориентир, смотрите не на один общий балл, а на паттерны:
— где модель стабильно путает инструкции;
— где начинает уверенно галлюцинировать;
— где хороша в коротком ответе, но плывёт в длинной переписке;
— где выигрывает стиль, а не качество. Это и есть нормальный evals, а не маркетинговый танец с цифрами.

Главная ловушка MT-Bench — переоценить его как «абсолютный суд». Он чувствителен к промптингу, к выбранной рубрике и к тому, кто именно оценивает ответы. Поэтому его лучше использовать вместе с HumanEval, MMLU, SWE-bench и своими внутренними model_comparison тестами, а не вместо них.

Если коротко: MT-Bench полезен, когда вам нужен живой разговорный стресс-тест, а не один красивый score на слайде. Может, конечно, ни хуя не взлетит у конкретной модели — но как чек на адекватность чат-LLM он до сих пор выглядит очень бодро.
Этот пост опубликован в Telegram-канале AI Landing Gen — генерация лендингов через ИИ. Подписаться можно по ссылке: @ai_landing_gen.
tech

Свежие посты в категории «Tech Infrastructure»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.