Отбор признаков не гарантирует рост качества модели
В табличных задачах есть соблазн: сократить набор фич, найти «правильное» подмножество и получить лучший прогноз. Но свежий разбор на SCM3K показывает, что эта логика работает не всегда.
Авторы прогнали 3 450 синтетических задач с 40–1000 признаками и сравнили несколько регрессоров. На бумаге идея красивая: если подать модели не все признаки, а только Markov boundary — минимальный набор, который содержит всю полезную для предсказания информацию, — качество часто растёт. Особенно когда boundary известна точно.
Проблема в другом: реальные алгоритмы отбора редко доходят до той точки, где этот выигрыш вообще проявляется. Чаще они останавливаются раньше, а в ряде случаев и при удачном поиске не обгоняют обучение на полном наборе признаков.
Авторы сводят это к трём вещам:
- методы recovery обычно оптимизируют структуру, а не итоговый скор;
- пропуски и ложные включения признаков стоят модели по-разному;
- «идеальный» набор — не единственный сценарий, где можно выиграть у baseline.
Для медиапроектов и Telegram-операций вывод приземлённый: чистка контентных или рекламных признаков сама по себе не спасает. Если задача — прогноз ER, отклик на закупку или удержание, важнее не только сократить feature space, но и понять, под какую метрику вы вообще оптимизируете отбор. Иначе можно долго улучшать состав данных и так и не улучшить результат.
Telegram Media Ops Brief 9
@TeleMediOpsBrieSignalDaily
Отбор признаков не гарантирует рост качества модели
Этот пост опубликован в Telegram-канале Telegram Media Ops Brief 9. Подписаться можно по ссылке: @TeleMediOpsBrieSignalDaily.