llama_evals: как не перепутать реальный прогресс llm с красивым benchmark-театром
Если модель «победила» в evals, первым делом смотрим не на цифру, а на условия. Часто решает не интеллект, а формат промпта, длина ответа, sampling, system prompt и то, не подсматривал ли датасет в обучение. Одна и та же llm может выглядеть как релиз года на одном бенчмарке и как MVP с амнезией на другом.
Мини-чек-лист для model_comparison:
— есть ли фиксированные промпты и одинаковые параметры генерации;
— совпадает ли pre-processing для всех моделей;
— отделены ли train/val/test, или там уже гуляет data contamination;
— меряют ли один навык, а не смесь из памяти, шаблонов и luck.
Для llama_evals особенно важна интерпретация ошибок. Считайте не только average score, но и провалы по подзадачам: где модель ломается на длинном контексте, где путает инструкции, где теряет устойчивость на повторных прогонах. Хороший evals-отчёт показывает не только «кто выше», но и «почему выше» — иначе это просто красивый leaderboard с плохой диагностикой.
И да, если метрика выросла, а продуктовые сценарии не изменились, возможно, это не новый стандарт, а очередная победа на табло. Evals полезны ровно настолько, насколько они помогают принимать решения, а не кормят презентацию — может и не взлетит, если сравнивать только ради хайпа.
CRO Lab — конверсия лендингов
@cro_lab
llama_evals: как не перепутать реальный прогресс llm с красивым benchmark-театром
Этот пост опубликован в Telegram-канале CRO Lab — конверсия лендингов. Подписаться можно по ссылке: @cro_lab.