Open Source LLM — Llama / Qwen / DeepSeek

Qwen в проде ломается не на качестве, а на неправильном выборе размера и runtime

Qwen в проде ломается не на качестве, а на неправильном выборе размера и runtime

Если вам нужен китайский open-source стек для русского и английского, Qwen обычно берут за адекватный баланс: сильный instruction-following, нормальная работа с кодом, широкий выбор размеров. Но ошибка №1 — ставить слишком большую модель там, где нужен throughput, а не рекордный ответ на один запрос.

Смотрите на 4 вещи:
— 7B/8B часто хватает для классификации, извлечения полей, коротких генераций.
— 14B уже заметно лучше держит сложные инструкции и многошаговые промпты.
— 32B имеет смысл, если цена ошибки выше стоимости лишней VRAM.
— Для длинного контекста проверяйте не заявленные цифры, а реальную деградацию после первых десятков тысяч токенов.

По инференсу Qwen обычно раскрывается в vLLM, когда нужна параллельная выдача и батчинг; llama.cpp имеет смысл для локального CPU/GPU edge; TGI берут там, где уже стандартизован HF-стек. Квантизация int4 часто даёт лучший trade-off, чем упор в fp16: меньше VRAM, выше плотность посадки, но обязательно прогоняйте свой датасет — у разных задач просадка разная.

Вердикт: Qwen — это не «одна лучшая модель», а линейка под разные бюджеты. Начинайте с минимального размера, который проходит вашу метрику качества, и только потом поднимайтесь вверх по памяти и стоимости инференса.
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.
ai_creative

Свежие посты в категории «AI & Creative Production»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.