Разметка Данных
Разметка Данных
@data_labeling_ru_n1k

Двое разметчиков на одной и той же задаче дают разные ответы чаще, чем принято думать. Это не признак плохих и

Двое разметчиков на одной и той же задаче дают разные ответы чаще, чем принято думать. Это не признак плохих исполнителей, это нормальное свойство любой человеческой разметки.

Поэтому серьёзные наборы данных собирают с перекрытием: одна и та же единица уходит нескольким людям, а дальше смотрят, насколько ответы совпали.

Что даёт перекрытие:

— видно, какие категории вообще спорные, а какие понятны всем;
— спорные единицы можно отправить на разбор, а не тащить в обучение как есть;
— по уровню согласия оценивают саму задачу: если люди не могут договориться между собой, модель тоже не сможет.

Частая ошибка — считать согласием простое совпадение ответов. Если один класс встречается почти всегда, случайное совпадение будет высоким само по себе, и цифра не покажет ничего.

Ещё одна ошибка — тихо усреднять спорные случаи большинством голосов. Иногда большинство ошибается вместе, потому что инструкция подталкивает к удобному ответу.

Разногласия — это не брак, а бесплатная диагностика задачи. Их стоит собирать отдельно и читать глазами. 📊
Этот пост опубликован в Telegram-канале Разметка Данных. Подписаться можно по ссылке: @data_labeling_ru_n1k.
ai_creative

Свежие посты в категории «AI & Creative Production»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.