📚 Reward model для DPO — что это и зачем
Разбор для тех, кто дошёл до пред-продакшена.
DPO нужны пары «хороший ответ / плохой ответ». Где брать? Три пути:
🔸 руками. Дорого, медленно, но эталон качества.
🔸 через реворд-модель — обучаешь классификатор «оценка 1-10» на 2-5к размеченных примеров, потом им маркируешь остальные 50к.
🔸 через большую LLM (GPT-4, Claude) как судью. Быстро, дёшево, но модель наследует предвзятости судьи.
Я обычно комбинирую: 300 руками для калибровки, потом GPT-4o как судья на остальные 20к. Стоит $15-30, но качество не хуже, чем полностью руками.
Готов сделать разбор с кодом отдельно? Ставьте 👍.
➖➖➖➖➖➖➖➖➖➖
Антон Хоменок про дообучение LLM 🧠
Хоменок про дообучение LLM 🧠
@xomenok_llmft
📚 Reward model для DPO — что это и зачем
Этот пост опубликован в Telegram-канале Хоменок про дообучение LLM 🧠. Подписаться можно по ссылке: @xomenok_llmft.