Когда признаков слишком много, выигрывает не «всё подряд», а точная выжимка
В iGaming- и affiliate-аналитике это знакомая ситуация: у команды есть десятки источников, событий, сегментов, GEO и креативов, но модель не становится лучше линейно от каждого нового поля. Исследование на синтетическом бенчмарке SCM3K с 3 450 задачами показало важный эффект: если ограничить регрессию не полным набором признаков, а oracle Markov boundary — то есть минимальным подмножеством, которое сохраняет всю нужную для прогноза информацию, — качество предсказания часто растёт.
Особенно заметно это на больших и разреженных данных. Но есть нюанс, который хорошо знаком любому, кто строил скоринговые или медиамикс-модели: сам поиск такого подмножества очень дорог по compute. В итоге часть оценщиков тратит ресурсы на восстановление структуры признаков и просто не доезжает до режима, где выигрыш становится заметным.
Авторы отдельно отмечают три причины, почему «идеальная» выборка не всегда обгоняет полный набор:
1. многие методы оптимизируют корректность восстановления, а не точность прогноза;
2. ложные включения и пропуски в признаках стоят модели по-разному;
3. даже точный Markov boundary — не единственный возможный короткий набор, который может дать хороший результат.
Для iGaming market research вывод простой: ширина дата-сета не равна качеству модели. Узкое, хорошо подобранное подмножество фичей может быть сильнее перегруженного пайплайна, но экономический смысл есть только тогда, когда стоимость отбора не съедает выигрыш. Это напрямую касается антифрода, LTV-прогнозов, кластеризации трафика и автоматического фичеринга, где признаки растут быстрее, чем бюджет на их отбор.
iGaming Market Watch Casebook
@IgamingMarketWatchCasebook
Когда признаков слишком много, выигрывает не «всё подряд», а точная выжимка
Этот пост опубликован в Telegram-канале iGaming Market Watch Casebook. Подписаться можно по ссылке: @IgamingMarketWatchCasebook.