Qwen в проде ломается не на качестве, а на неправильном выборе размера и runtime
Если вам нужен китайский open-source стек для русского и английского, Qwen обычно берут за адекватный баланс: сильный instruction-following, нормальная работа с кодом, широкий выбор размеров. Но ошибка №1 — ставить слишком большую модель там, где нужен throughput, а не рекордный ответ на один запрос.
Смотрите на 4 вещи:
— 7B/8B часто хватает для классификации, извлечения полей, коротких генераций.
— 14B уже заметно лучше держит сложные инструкции и многошаговые промпты.
— 32B имеет смысл, если цена ошибки выше стоимости лишней VRAM.
— Для длинного контекста проверяйте не заявленные цифры, а реальную деградацию после первых десятков тысяч токенов.
По инференсу Qwen обычно раскрывается в vLLM, когда нужна параллельная выдача и батчинг; llama.cpp имеет смысл для локального CPU/GPU edge; TGI берут там, где уже стандартизован HF-стек. Квантизация int4 часто даёт лучший trade-off, чем упор в fp16: меньше VRAM, выше плотность посадки, но обязательно прогоняйте свой датасет — у разных задач просадка разная.
Вердикт: Qwen — это не «одна лучшая модель», а линейка под разные бюджеты. Начинайте с минимального размера, который проходит вашу метрику качества, и только потом поднимайтесь вверх по памяти и стоимости инференса.
Open Source LLM — Llama / Qwen / DeepSeek
@open_source_llm_aff
Qwen в проде ломается не на качестве, а на неправильном выборе размера и runtime
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.