📚 DPO против SFT — чем реально отличаются
На эту тему написано тонна статей, но мало кто объясняет по-человечески.
🔸 SFT (Supervised Fine-Tuning) — «вот пример хорошего ответа, копируй». Модель учит стиль и знания.
🔸 DPO (Direct Preference Optimization) — «вот хороший ответ, вот плохой, отличай». Модель учится не что говорить, а чего избегать.
DPO почти всегда стоит поверх SFT. Один даёт форму, второй — вкус.
Я вижу ребят, которые пытаются DPO без SFT — модель тупо не понимает, чему её учат. Как учить ребёнка манерам, пока он не научился говорить.
Смысла ноль.
➖➖➖➖➖➖➖➖➖➖
Антон Хоменок про дообучение LLM 🧠
Хоменок про дообучение LLM 🧠
@xomenok_llmft
📚 DPO против SFT — чем реально отличаются
Этот пост опубликован в Telegram-канале Хоменок про дообучение LLM 🧠. Подписаться можно по ссылке: @xomenok_llmft.