Разметка живёт дольше, чем кажется, и меняется чаще, чем её успевают версионировать.
Типичная картина: набор собрали, часть спорных единиц потом переразметили, что-то поправили вручную прямо в файле, что-то догрузили. Спустя время никто не может ответить, какая именно версия использовалась для обучения и почему старые результаты не воспроизводятся.
Минимум, который спасает:
— каждая партия хранится как есть, без правок задним числом; исправления оформляются новой версией;
— рядом с данными лежит текст инструкции той версии, по которой размечали;
— фиксируется, кто разметил единицу, когда и с каким перекрытием;
— разбиение на обучающую и проверочную части хранится вместе с набором, а не пересобирается каждый раз заново.
Последний пункт важнее прочих. Если разбиение делают заново после добавления данных, почти дублирующие единицы разъезжаются по обеим частям, и оценка качества становится оптимистичнее реальности. Особенно это заметно там, где один источник дал много похожих записей.
Данные без истории изменений — это данные, которым нельзя доверять, даже если они размечены безупречно.
Разметка Данных
@data_labeling_ru_n1k
Разметка живёт дольше, чем кажется, и меняется чаще, чем её успевают версионировать.
Этот пост опубликован в Telegram-канале Разметка Данных. Подписаться можно по ссылке: @data_labeling_ru_n1k.