IBM учит ИИ проверять бенчмарки — и это не шутка 🤖
Проблема простая: если тест кривой, то и выводы по модели тоже кривые. IBM предлагает использовать LLM не только для ответов, но и для проверки качества самих бенчмарков — тех самых наборов задач, по которым меряют агентов и ИИ-системы. Это важно и для айтишников Хабаровска: мы часто смотрим на красивые цифры в релизах, но без нормального теста они мало что значат.
На фоне аудита четырёх бенчмарков для агентов с внешними инструментами 18,5% решений не совпали с автоматической оценкой. Вывод простой: перед тем как верить метрикам, стоит проверить, не ошибается ли сам экзамен.
IT Хабаровск — t.me/itnews_khabarovsk
IT Хабаровск
@itnews_khabarovsk
IBM учит ИИ проверять бенчмарки — и это не шутка 🤖
Источники:
Этот пост опубликован в Telegram-канале IT Хабаровск. Подписаться можно по ссылке: @itnews_khabarovsk.