Когда признаков слишком много, «идеальная» чистка часто мешает сильнее, чем помогает
В одном исследовании на синтетическом бенчмарке SCM3K проверили 3 450 задач и сравнили, как работает регрессор, если ограничить его набором признаков через oracle Markov boundary — условно говоря, оставить только те переменные, которые действительно несут полезный сигнал для предсказания.
Вывод оказался неочевидным, но очень прикладным: качество модели часто растёт, когда её не заставляют переваривать весь массив фичей. Особенно это заметно в больших и разреженных пространствах, где лишние признаки шумят сильнее всего.
Но есть важная оговорка. Методы, которые пытаются найти такую boundary, нередко упираются в вычислительный лимит раньше, чем доходят до режима, где эффект становится максимальным. То есть ресурс уходит на поиск «правильного» набора, а бизнес-выигрыш так и не успевает проявиться.
Авторы выделяют три типичные проблемы:
- алгоритмы часто оптимизируются под восстановление структуры, а не под точность предсказания;
- ложные пропуски и ложные включения стоят по-разному, но это не всегда учитывается;
- иногда лучший результат даёт не «идеальный» набор, а просто более компактный и практичный список сигналов.
Для вертикалей это полезное напоминание: в креативах, ставках, аудиториях, прокладках и событиях не всегда выигрывает самая широкая схема атрибуции или самый тяжёлый feature selection. Иногда быстрее и точнее работает урезанный набор признаков, если он проверен именно по качеству прогноза, а не по красоте структуры.
Главная мысль простая: не путать сложный отбор сигналов с полезным отбором сигналов. В вертикалях это особенно заметно — где шумных данных много, а окно для принятия решения короткое.
Vertical Watch Signal
@VerticalWatchSignal
Когда признаков слишком много, «идеальная» чистка часто мешает сильнее, чем помогает
Этот пост опубликован в Telegram-канале Vertical Watch Signal. Подписаться можно по ссылке: @VerticalWatchSignal.