Предразметка выглядит как бесплатное ускорение: модель расставляет ответы, человек только проверяет. Экономия времени реальная, но у приёма есть цена, о которой узнают поздно.
Человек, который видит готовый ответ, проверяет его хуже, чем размечает с нуля. Согласиться легче, чем возразить, особенно к концу смены. В результате ошибки модели переезжают в новый набор данных, модель на нём дообучается и уверенно повторяет ровно то же самое.
Как с этим живут:
— часть потока размечают вслепую, без подсказки, и сравнивают с подсказанной частью;
— смотрят, как часто человек вообще исправляет предразметку: подозрительно редкие правки — плохой знак;
— прячут подсказку там, где модель заведомо слаба: на редких классах и на краях;
— оценивают качество только на данных, которые никогда не видели предразметки.
Отдельно стоит держать в голове, что предразметка меняет и скорость, и восприятие сложности. Задача кажется лёгкой, исполнители расслабляются, а спорные случаи перестают всплывать в переписке.
Ускорять разметку можно. Нельзя только делать это молча и не проверять, что именно ускорилось. ⚙️
Разметка Данных
@data_labeling_ru_n1k
Предразметка выглядит как бесплатное ускорение: модель расставляет ответы, человек только проверяет. Экономия
Этот пост опубликован в Telegram-канале Разметка Данных. Подписаться можно по ссылке: @data_labeling_ru_n1k.