5 ошибок при выборе Llama для продакшена: ломают скорость, бюджет и качество
Llama часто берут по размеру, а не по профилю задачи. В результате 8B ставят там, где нужен строгий след за инструкцией, а 70B — там, где важнее throughput. Сначала фиксируй три вещи: тип запросов, допустимую задержку и бюджет на 1M токенов.
• Для коротких одношаговых задач чаще хватает младших моделей, но только при хорошем промпте и жёстком шаблоне ответа.
• Для длинного контекста проверяй не паспортные 128k, а реальную деградацию на твоих данных: у многих моделей после части контекста растёт забывание и падает точность извлечения.
• Квантизация почти всегда меняет не только скорость, но и формат ошибок: где-то растёт галлюцинация, где-то модель хуже держит структуру.
Дальше смотри на стек инференса. vLLM обычно выигрывает на батчинге и throughput, TGI удобен для сервинга и интеграций, llama.cpp полезен там, где нужен локальный запуск на слабом железе. Один и тот же Llama на разных рантаймах может вести себя как три разные модели.
Не сравнивай модель в вакууме. Смотри связку: размер, квантизация, контекст, prompt template и runtime. Если ответы нестабильны, сначала меняй шаблон и квант, а уже потом модель.
Open Source LLM — Llama / Qwen / DeepSeek
@open_source_llm_aff
5 ошибок при выборе Llama для продакшена: ломают скорость, бюджет и качество
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.