Красивый отбор фич не всегда продаёт модель
В табличном ML до сих пор живёт опасная иллюзия: если нашёл «правильный» набор признаков, качество почти автоматически вырастет. Но свежий разбор на SCM3K показывает более жёсткую картину. Исследователи прогнали 3 450 синтетических задач с разной плотностью признаков, шестью семействами SCM и несколькими регрессорами и проверили не просто восстановление структуры, а пользу Markov boundary именно для прогноза.
Итог неприятный для любителей «умной зачистки» данных: если подать модель только на oracle boundary, выигрыш действительно бывает, особенно когда признаков много и они сильно разрежены. Но в реальных условиях до этой точки часто не доезжают сами оценщики границы — compute уходит раньше, чем появляется ощутимая польза. А в ряде режимов полный набор фич вообще оказывается не хуже и иногда лучше.
Для вертикалей это очень приземлённый вывод. В арбитраже, SEO-табличках, антифроде или скоринге лидов соблазн выкинуть «лишнее» всегда велик: меньше шума, чище структура, вроде бы понятнее модель. Но если отбор оптимизируется под красоту схемы, а не под итоговый скор, он легко начинает вредить. Особенно когда ошибка отбрасывания полезного признака дороже, чем шум от пары лишних.
Мой вывод простой: в прикладных задачах важно не искать идеальную границу признаков, а считать экономику ошибок. Иногда честный full feature set даёт больше, чем аккуратная, но дорогая в вычислениях «умная» обрезка.
Vertical Watch Opinion 4
@VerticalWatchOpinion4
Красивый отбор фич не всегда продаёт модель
Этот пост опубликован в Telegram-канале Vertical Watch Opinion 4. Подписаться можно по ссылке: @VerticalWatchOpinion4.