Вопрос «а моя работа была в обучающей выборке?» пока почти без ответа.
Методы membership inference и training data attribution могут что-то показать, но не дают надёжной гарантии. Высокий influence score тоже не доказывает авторство или влияние конкретной записи. Особенно сложно музыкантам: даже если у модели есть большой каталог за 20 лет, проверить вклад отдельного трека в свежую генерацию практически невозможно.
При этом происхождение данных проще зафиксировать до обучения, чем восстановить постфактум. ЕС уже требует машиночитаемо помечать синтетический контент, а Spotify с середины сентября начнёт отмечать профили вымышленных исполнителей ярлыком AI Persona и убирать их из рекомендаций.
IT Рязань — t.me/it_ryazan
IT Рязань
@it_ryazan
Вопрос «а моя работа была в обучающей выборке?» пока почти без ответа.
Источники:
Этот пост опубликован в Telegram-канале IT Рязань. Подписаться можно по ссылке: @it_ryazan.