Набор данных редко бывает похож на реальность, и почти никогда — случайно.
Берут то, что легко собрать: свежие записи, удачные кадры, обращения из одного канала. Потом модель отлично работает на тестах и разваливается на живом потоке, где всё выглядит иначе.
Вторая беда — редкие классы. Если интересующее событие встречается редко, при честной случайной выборке разметчики будут размечать пустоту, а нужных примеров наберётся горстка. Отсюда соблазн собрать выборку целенаправленно, и вместе с ним новый перекос: модель учится на слишком удобных примерах редкого класса.
Что обычно делают:
— считают, из каких источников и периодов набрана выборка, до начала разметки;
— осознанно добирают редкие случаи, но помечают их происхождение;
— держат отдельную часть данных, собранную честно и случайно, — именно на ней оценивают качество;
— сравнивают распределение в наборе с распределением в реальном потоке хотя бы грубо.
Правило, которое стоит повесить перед глазами: обучать можно на подобранной выборке, оценивать — только на похожей на реальность. 📊
Разметка Данных
@data_labeling_ru_n1k
Набор данных редко бывает похож на реальность, и почти никогда — случайно.
Этот пост опубликован в Telegram-канале Разметка Данных. Подписаться можно по ссылке: @data_labeling_ru_n1k.