Почему «умное» сокращение фич не всегда помогает офферу
В анализе офферов легко попасть в ловушку: кажется, что если оставить только самые «сильные» признаки, модель или скоринг станут лучше. На практике это работает не всегда, особенно когда таблица разреженная и сигнал размазан по множеству полей — от GEO и девайса до времени, источника и поведения на лендинге.
Есть важная идея из исследований по табличным данным: лучший поднабор признаков не обязан быть самым коротким. Иногда качество растёт именно тогда, когда модель получает достаточно контекста, а не только отобранный «ядро-набор». Но есть нюанс: поиск такого набора может стоить слишком дорого по вычислениям и времени. В итоге инструмент тратит ресурсы на восстановление структуры данных, а не на полезный для прогноза результат.
Для оператора это значит простую вещь. Нельзя считать pruning или feature selection автоматической победой. Если сравнивать full set и урезанный набор, это нужно делать на одной и той же валидации и на одном горизонте оценки. Иначе легко принять красивую схему отбора за улучшение, хотя в проде она проиграет более полному набору.
Ещё один практический вывод: ошибки отбора фич неравноценны. Пропустить действительно важный сигнал по офферу часто дороже, чем оставить пару лишних полей. Поэтому при разборе офферов полезнее смотреть не только на «чистоту» модели, но и на то, как она ведёт себя на широком, шумном и местами sparse-датасете.
Иными словами, хороший анализ оффера — это не только вопрос «что выкинуть», но и вопрос «что нельзя потерять».
Offer Intelligence Kit 4
@OfferIntelligenceKit4
Почему «умное» сокращение фич не всегда помогает офферу
Этот пост опубликован в Telegram-канале Offer Intelligence Kit 4. Подписаться можно по ссылке: @OfferIntelligenceKit4.