Между выбором алгоритма и качеством данных выбор давно сделан практикой: данные важнее. Простая модель на аккуратных данных обыгрывает сложную на грязных почти всегда, а разбираться со второй значительно дороже.
Список типичных проблем не меняется годами. Дубли после сбоев и повторных отправок. Разъехавшиеся справочники, где одно и то же называется по-разному. Пропуски, заполненные нулями, из-за чего среднее уезжает. Смена смысла поля в какой-то момент, о которой никто не написал. Часовые пояса, из-за которых события выстраиваются в неправильном порядке.
Особенно коварна последняя категория — изменения задним числом. Модель обучена на данных, собранных по старым правилам, а работает на новых, и ухудшение происходит незаметно.
Поэтому первым делом полезно вкладываться не в алгоритмы, а в скучное: описание полей, проверки при загрузке, контроль полноты, фиксацию изменений в сборе. Это неинтересно и определяет результат сильнее всего остального ⚙️
AI в Аналитике
@ai_analytics_ru_n1k
Между выбором алгоритма и качеством данных выбор давно сделан практикой: данные важнее. Простая модель на акку
Этот пост опубликован в Telegram-канале AI в Аналитике. Подписаться можно по ссылке: @ai_analytics_ru_n1k.