Llama в проде: 5 ошибок, из-за которых open-source съедает бюджет быстрее API
Llama часто берут как «свою» модель, но экономия появляется только когда сходятся 4 вещи: размер, квантизация, длина контекста и throughput на вашем железе. Если один из параметров не бьётся, self-hosted превращается в дорогую игрушку.
— Слишком большая модель для задачи: 70B на простом чат-боте почти всегда избыточна; 8B/13B с хорошим промптом и RAG дают лучшее соотношение качество/цена.
— Неправильная квантизация: int4/gguf снижает VRAM, но на длинном контексте и сложных ответах может просадить качество сильнее, чем ожидается.
— Игнорирование batching: без нормального batch size vLLM/TGI/GGUF-серверов вы платите за GPU, а не за токены.
— Переоценка контекста: 128k «на бумаге» не значит, что весь контекст работает одинаково стабильно; после роста окна качество retrieval и следование инструкции деградируют.
— Отсутствие профилирования: пока не измерены tokens/sec, latency p95 и загрузка VRAM, сравнивать Llama с API бессмысленно.
Для продакшена смотрите не на «лучшую модель», а на точку окупаемости: сколько одновременных запросов держит одна GPU, какая доля ответов требует пересчёта, и сколько стоит 1M токенов с учётом простоев.
Правильный выбор Llama — это не размер модели, а совпадение качества с вашей нагрузкой и железом.
Open Source LLM — Llama / Qwen / DeepSeek
@open_source_llm_aff
Llama в проде: 5 ошибок, из-за которых open-source съедает бюджет быстрее API
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.