Двое разметчиков на одной и той же задаче дают разные ответы чаще, чем принято думать. Это не признак плохих исполнителей, это нормальное свойство любой человеческой разметки.
Поэтому серьёзные наборы данных собирают с перекрытием: одна и та же единица уходит нескольким людям, а дальше смотрят, насколько ответы совпали.
Что даёт перекрытие:
— видно, какие категории вообще спорные, а какие понятны всем;
— спорные единицы можно отправить на разбор, а не тащить в обучение как есть;
— по уровню согласия оценивают саму задачу: если люди не могут договориться между собой, модель тоже не сможет.
Частая ошибка — считать согласием простое совпадение ответов. Если один класс встречается почти всегда, случайное совпадение будет высоким само по себе, и цифра не покажет ничего.
Ещё одна ошибка — тихо усреднять спорные случаи большинством голосов. Иногда большинство ошибается вместе, потому что инструкция подталкивает к удобному ответу.
Разногласия — это не брак, а бесплатная диагностика задачи. Их стоит собирать отдельно и читать глазами. 📊
Разметка Данных
@data_labeling_ru_n1k
Двое разметчиков на одной и той же задаче дают разные ответы чаще, чем принято думать. Это не признак плохих и
Этот пост опубликован в Telegram-канале Разметка Данных. Подписаться можно по ссылке: @data_labeling_ru_n1k.