Vertical Watch Opinion 4
Vertical Watch Opinion 4
@VerticalWatchOpinion4

Красивый отбор фич не всегда продаёт модель

Красивый отбор фич не всегда продаёт модель

В табличном ML до сих пор живёт опасная иллюзия: если нашёл «правильный» набор признаков, качество почти автоматически вырастет. Но свежий разбор на SCM3K показывает более жёсткую картину. Исследователи прогнали 3 450 синтетических задач с разной плотностью признаков, шестью семействами SCM и несколькими регрессорами и проверили не просто восстановление структуры, а пользу Markov boundary именно для прогноза.

Итог неприятный для любителей «умной зачистки» данных: если подать модель только на oracle boundary, выигрыш действительно бывает, особенно когда признаков много и они сильно разрежены. Но в реальных условиях до этой точки часто не доезжают сами оценщики границы — compute уходит раньше, чем появляется ощутимая польза. А в ряде режимов полный набор фич вообще оказывается не хуже и иногда лучше.

Для вертикалей это очень приземлённый вывод. В арбитраже, SEO-табличках, антифроде или скоринге лидов соблазн выкинуть «лишнее» всегда велик: меньше шума, чище структура, вроде бы понятнее модель. Но если отбор оптимизируется под красоту схемы, а не под итоговый скор, он легко начинает вредить. Особенно когда ошибка отбрасывания полезного признака дороже, чем шум от пары лишних.

Мой вывод простой: в прикладных задачах важно не искать идеальную границу признаков, а считать экономику ошибок. Иногда честный full feature set даёт больше, чем аккуратная, но дорогая в вычислениях «умная» обрезка.
Этот пост опубликован в Telegram-канале Vertical Watch Opinion 4. Подписаться можно по ссылке: @VerticalWatchOpinion4.
verticals

Свежие посты в категории «Verticals & Offers»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.