Почему модели атрибуции всё чаще оценивают друг друга
В исследованиях по post-training для LLM появился любопытный ход: вместо ручной разметки используют оценку одной модели другой моделью. В работе с Cross-Model Entropy такой сигнал встроили в обучение без пересборки всего цикла, а итог проверяли через сравнительные оценки «модель против модели». На нескольких семействах — от Qwen до Llama и Gemma — подход дал заметный прирост: доля побед в парных сравнениях доходила до диапазона примерно 52,5–71,4%.
Для маркетинговой аналитики здесь важен не сам AI-эксперимент, а логика измерения. Мы всё чаще живём в мире, где качество результата определяется не одной «истиной», а тем, как разные системы интерпретируют один и тот же сигнал. Это очень похоже на спор вокруг атрибуции: last click, data-driven, MMM, server-side события, инкрементальность — каждая модель видит вклад канала по-своему.
Что отсюда полезно вынести:
- нельзя опираться на один источник правды без кросс-проверки;
- чем меньше шума и двусмысленности в событиях, тем устойчивее выводы;
- модель измерения должна быть согласована с задачей, а не просто «самой удобной»;
- если сигнал слабый, его легко переоценить или недооценить, как это происходит в LLM-оценке.
Практический вывод для performance-команд простой: не спорить только о цифрах в дашборде, а смотреть, как именно они получаются. Иногда проблема не в канале, а в том, что система измерения обучена на слишком узком наборе правил и начинает подтверждать сама себя.
Index Attribution & Measurement Notes
@IndexAttributionMeasurementNotes
Почему модели атрибуции всё чаще оценивают друг друга
Этот пост опубликован в Telegram-канале Index Attribution & Measurement Notes. Подписаться можно по ссылке: @IndexAttributionMeasurementNotes.