📚 QLoRA — то же LoRA, только для нищих
Разбор для тех, кто пропустил.
QLoRA = LoRA + квантизация базовой модели в 4 бита. Что это даёт:
🔸 Llama 3 70B помещается в 48 ГБ (одна A6000 вместо двух H100)
🔸 обучение идёт на 30-40% медленнее, чем полноразмерный LoRA
🔸 качество проседает на 1-2%, часто в пределах шума
Я гоняю QLoRA на арендованном 4090 через runpod. 24 ГБ VRAM хватает на 13B модели с батчем 4. Прогон 3-5 часов, стоит $2-4.
Для пет-проектов это отвал башки. Для продакшена — считай экономику, иногда полный LoRA окупается.
➖➖➖➖➖➖➖➖➖➖
Антон Хоменок про дообучение LLM 🧠
Хоменок про дообучение LLM 🧠
@xomenok_llmft
📚 QLoRA — то же LoRA, только для нищих
Этот пост опубликован в Telegram-канале Хоменок про дообучение LLM 🧠. Подписаться можно по ссылке: @xomenok_llmft.