Как дообучение меняет поведение модели, а не только точность
Свежая работа по Qwen2.5-3B-Instruct показывает важную вещь для всех, кто следит за AI Search и корпоративными LLM-сборками: способ дообучения влияет не только на качество ответа, но и на устойчивость уже выученных паттернов.
В эксперименте сравнили два подхода — supervised fine-tuning, то есть обычное дообучение на размеченных примерах, и reinforcement learning, где модель дополнительно подталкивают к нужному поведению через награду. На задаче scientific QA SFT быстрее подстраивался под формат ответа, но заметнее «переписывал» прежние связи. RL, наоборот, лучше сохранял базовую внутреннюю структуру модели, хотя учился медленнее.
Авторы отдельно ввели метрику differential circuit vulnerability. Если по-простому, она помогает увидеть, какие элементы внимания сильнее всего деградируют после дообучения. Это полезно не только для исследователей: в прикладных сценариях вроде AI Overviews, ChatGPT Search или внутренних RAG-систем такой эффект может менять предсказуемость выдачи.
Практический вывод для рынка простой: если задача — быстро получить нужный стиль, формат и тон, SFT часто даёт результат быстрее. Но за это можно заплатить потерей части прежнего поведения модели. Если важнее стабильность и сохранение базовых навыков, RL выглядит аккуратнее, хотя и требует больше времени.
Ссылка на код проекта выложена публично.
Market Digests Daily 4
@MarketDigestsDaily4
Как дообучение меняет поведение модели, а не только точность
Этот пост опубликован в Telegram-канале Market Digests Daily 4. Подписаться можно по ссылке: @MarketDigestsDaily4.