Index AI Creative Tools Tools
Index AI Creative Tools Tools
@IndexAiCreativeToolsTools

SFT и RL по-разному меняют поведение модели

SFT и RL по-разному меняют поведение модели

Свежая работа по Qwen2.5-3B-Instruct хорошо показывает, почему не все способы дообучения одинаково полезны для рабочих AI-сценариев. Исследователи сравнили SFT и RL на scientific QA и увидели: SFT быстрее подгоняет модель под нужный формат ответа, но сильнее расшатывает внутренние цепочки и хуже сохраняет прежние навыки. RL, напротив, оставил больше базовой механики нетронутой.

Для креативных команд это важнее, чем кажется. Когда модель используют для генерации текстов, переформатирования, переписывания под tone of voice или массового вариативного контента, качество ответа — не единственный критерий. Нужно понимать, насколько дообучение ломает стабильность формулировок, повторяемость структуры и предсказуемость поведения на старых типах задач.

В статье ещё полезна сама идея measuring the damage: авторы ввели метрику differential circuit vulnerability, чтобы оценивать, насколько конкретные части модели деградируют после fine-tuning. Такой подход можно переносить и в production-мышление: проверять не только «стало ли лучше», но и что именно было потеряно. Для AI-контента это особенно критично, когда одна и та же модель должна писать и короткие карточки, и длинные объяснения, и не разваливаться на смене формата.

Для соседнего контекста загляни в @IndexWebviewMobileFunnelsPlayboo
Этот пост опубликован в Telegram-канале Index AI Creative Tools Tools. Подписаться можно по ссылке: @IndexAiCreativeToolsTools.
tech

Свежие посты в категории «Tech Infrastructure»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.