Llama в проде: 5 ошибок, которые убивают скорость и экономику сразу
Llama часто берут как «универсальную» модель, а потом удивляются, почему latency растёт, а GPU простаивает. Проблема почти всегда не в самой модели, а в выборе размера, контекста и рантайма.
— 8B с fp16 на одной GPU даёт хороший баланс качества и простоты; 70B без нормального шардирования быстро упирается в VRAM и межGPU-оверhead.
— Квантизация q4/q5 почти всегда выгоднее, чем «чуть-чуть побольше качество» на fp16, если задача — чат, классификация, extraction.
— Длинный контекст надо тестировать отдельно: 128k на бумаге не означает стабильную генерацию на всём окне, после определённой длины растёт деградация.
— Для продакшена важнее throughput на batch, чем пиковая скорость одного запроса. Один запрос в секунду и 20 concurrent — это разные системы.
Если нужен API под автоматизацию, сначала считайте токены на задачу, потом выбирайте размер модели. Часто 8B/13B в правильной квантизации закрывают 80% сценариев дешевле и стабильнее, чем попытка «добить качество» тяжёлой моделью.
Лучший чек перед запуском: один и тот же промпт прогнать на 3 режимах — fp16, int8, int4 — и сравнить не только ответы, но и p95 latency, потребление VRAM и стоимость 1M токенов.
Open Source LLM — Llama / Qwen / DeepSeek
@open_source_llm_aff
Llama в проде: 5 ошибок, которые убивают скорость и экономику сразу
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.