Telegram Media Ops Brief 9
Telegram Media Ops Brief 9
@TeleMediOpsBrieSignalDaily

Отбор признаков не гарантирует рост качества модели

Отбор признаков не гарантирует рост качества модели

В табличных задачах есть соблазн: сократить набор фич, найти «правильное» подмножество и получить лучший прогноз. Но свежий разбор на SCM3K показывает, что эта логика работает не всегда.

Авторы прогнали 3 450 синтетических задач с 40–1000 признаками и сравнили несколько регрессоров. На бумаге идея красивая: если подать модели не все признаки, а только Markov boundary — минимальный набор, который содержит всю полезную для предсказания информацию, — качество часто растёт. Особенно когда boundary известна точно.

Проблема в другом: реальные алгоритмы отбора редко доходят до той точки, где этот выигрыш вообще проявляется. Чаще они останавливаются раньше, а в ряде случаев и при удачном поиске не обгоняют обучение на полном наборе признаков.

Авторы сводят это к трём вещам:
- методы recovery обычно оптимизируют структуру, а не итоговый скор;
- пропуски и ложные включения признаков стоят модели по-разному;
- «идеальный» набор — не единственный сценарий, где можно выиграть у baseline.

Для медиапроектов и Telegram-операций вывод приземлённый: чистка контентных или рекламных признаков сама по себе не спасает. Если задача — прогноз ER, отклик на закупку или удержание, важнее не только сократить feature space, но и понять, под какую метрику вы вообще оптимизируете отбор. Иначе можно долго улучшать состав данных и так и не улучшить результат.
Этот пост опубликован в Telegram-канале Telegram Media Ops Brief 9. Подписаться можно по ссылке: @TeleMediOpsBrieSignalDaily.
ai_creative

Свежие посты в категории «AI & Creative Production»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.