MT-Bench: релиз года для тех, кто хочет мерить чат-модели не на глаз, а по сценарию
MT-Bench — это не «кто лучше пишет стихи», а попытка прогнать LLM через набор многоходовых диалогов и сравнить ответы по заранее заданной рубрике. Идея простая: у модели проверяют не только фактологию, но и умение держать контекст, следовать инструкции и не разваливаться на втором вопросе.
Если используете этот бенч как ориентир, смотрите не на один общий балл, а на паттерны:
— где модель стабильно путает инструкции;
— где начинает уверенно галлюцинировать;
— где хороша в коротком ответе, но плывёт в длинной переписке;
— где выигрывает стиль, а не качество. Это и есть нормальный evals, а не маркетинговый танец с цифрами.
Главная ловушка MT-Bench — переоценить его как «абсолютный суд». Он чувствителен к промптингу, к выбранной рубрике и к тому, кто именно оценивает ответы. Поэтому его лучше использовать вместе с HumanEval, MMLU, SWE-bench и своими внутренними model_comparison тестами, а не вместо них.
Если коротко: MT-Bench полезен, когда вам нужен живой разговорный стресс-тест, а не один красивый score на слайде. Может, конечно, ни хуя не взлетит у конкретной модели — но как чек на адекватность чат-LLM он до сих пор выглядит очень бодро.
AI Landing Gen — генерация лендингов через ИИ
@ai_landing_gen
MT-Bench: релиз года для тех, кто хочет мерить чат-модели не на глаз, а по сценарию
Этот пост опубликован в Telegram-канале AI Landing Gen — генерация лендингов через ИИ. Подписаться можно по ссылке: @ai_landing_gen.