📚 GGUF-квантизация — почему без неё в проде тебе конец
Обучил модель в fp16 на арендованной H100, теперь надо задеплоить на клиентский сервер с одним RTX 4070. Что делать?
Ответ — GGUF-квантизация в 4-8 бит через llama.cpp.
Что теряешь и что получаешь:
🔸 Q8: качество идентично fp16, размер −45%, скорость +30%
🔸 Q5_K_M: качество проседает на 1-2%, размер −65%, скорость +80%
🔸 Q4_K_M: качество −3-5%, размер −72%, скорость +100%
Я обычно беру Q5_K_M — это sweet spot между качеством и ценой. На 7B модели укладываюсь в 5 ГБ VRAM.
Ссылку на llama.cpp гуглите, там всё в 3 команды делается.
➖➖➖➖➖➖➖➖➖➖
Антон Хоменок про дообучение LLM 🧠
Хоменок про дообучение LLM 🧠
@xomenok_llmft
📚 GGUF-квантизация — почему без неё в проде тебе конец
Этот пост опубликован в Telegram-канале Хоменок про дообучение LLM 🧠. Подписаться можно по ссылке: @xomenok_llmft.