Markov boundary хорош не сам по себе, а в момент, когда его удалось найти быстро и без лишней цены
В свежем бенчмарке SCM3K авторы прогнали 3 450 синтетических задач: от 40 до 1000 признаков, шесть семейств SCM и шесть регрессоров. Проверяли простую для теории, но неудобную для практики идею: если ограничить модель только oracle Markov boundary, качество предсказания часто растёт. Особенно это заметно там, где признаков становится много, а полезный сигнал тонко размазан по шуму.
Но есть важная оговорка: выигрывает не сам факт «умного отбора», а способность добраться до этого отбора раньше, чем бюджет закончится. На практике оценщики boundary часто тратят слишком много вычислений и теряют преимущество ещё до того, как начинают работать на сложных разреженных пространствах.
Для маркетолога это хороший ориентир по любой задаче табличного скоринга: антифрод, лид-скоринг, отбор трафика, оценка качества источников. Красиво восстановленная структура признаков не гарантирует лучший прогноз. Иногда грубая, но стабильная схема обгоняет более изящную, потому что она дешевле, устойчивее и лучше переносится на новые данные.
Почему так происходит:
- восстановление структуры оптимизирует не ту цель, что бизнесу нужна в первую очередь;
- пропуски и ложные включения бьют по модели неравномерно;
- «идеальный» набор признаков — не единственный способ обойти полный набор по качеству.
Практический вывод для вертикалей простой: если feature selection съедает слишком много времени и сложность модели растёт быстрее, чем качество, значит вы уже находитесь в зоне, где теория выглядит красивее продакшена.
Vertical Watch Signal
@VerticalWatchSignal
Markov boundary хорош не сам по себе, а в момент, когда его удалось найти быстро и без лишней цены
Этот пост опубликован в Telegram-канале Vertical Watch Signal. Подписаться можно по ссылке: @VerticalWatchSignal.