Разметка Данных
Разметка Данных
@data_labeling_ru_n1k

Набор данных редко бывает похож на реальность, и почти никогда — случайно.

Набор данных редко бывает похож на реальность, и почти никогда — случайно.

Берут то, что легко собрать: свежие записи, удачные кадры, обращения из одного канала. Потом модель отлично работает на тестах и разваливается на живом потоке, где всё выглядит иначе.

Вторая беда — редкие классы. Если интересующее событие встречается редко, при честной случайной выборке разметчики будут размечать пустоту, а нужных примеров наберётся горстка. Отсюда соблазн собрать выборку целенаправленно, и вместе с ним новый перекос: модель учится на слишком удобных примерах редкого класса.

Что обычно делают:

— считают, из каких источников и периодов набрана выборка, до начала разметки;
— осознанно добирают редкие случаи, но помечают их происхождение;
— держат отдельную часть данных, собранную честно и случайно, — именно на ней оценивают качество;
— сравнивают распределение в наборе с распределением в реальном потоке хотя бы грубо.

Правило, которое стоит повесить перед глазами: обучать можно на подобранной выборке, оценивать — только на похожей на реальность. 📊
Этот пост опубликован в Telegram-канале Разметка Данных. Подписаться можно по ссылке: @data_labeling_ru_n1k.
ai_creative

Свежие посты в категории «AI & Creative Production»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.