Qwen в проде ломается не на «качестве», а на неправильном режиме инференса
У этой линейки сильный код, мультиязычность и длинный контекст, но в проде важны три вещи: длина промпта, квантизация и батчинг. Если гонять модель как чат-бота с мелкими запросами, вы не увидите её сильные стороны; если скормить длинный диалог без лимитов, латентность быстро уйдёт в пол.
Правило первое: для API-сервиса почти всегда выгоднее vLLM или TGI, если нужен нормальный throughput и continuous batching. Правило второе: для edge- или бюджетного деплоя GGUF/Q4 через llama.cpp ок, но на сложных задачах следите за деградацией в tool-use и многошаговой логике. Правило третье: чем длиннее контекст, тем сильнее нужен реальный замер, а не вера в «128k на бумаге».
С Qwen лучше сразу тестировать три профиля: короткий чат, код/JSON, длинный документ. На каждом профиле меряйте tokens/sec, p95 latency и процент валидного формата. Если модель хорошо пишет код, но ломает JSON на 5-10% ответов, это уже не «мелкая ошибка», а прямой риск для автоматизации.
Отдельно смотрите на лицензии и источник весов: в коммерческий контур берут только то, что можно легально встраивать в свой продукт. Для большинства команд Qwen — это не «одна лучшая модель», а удобный набор: одна конфигурация под дешёвый чат, другая под код, третья под длинные документы.
Open Source LLM — Llama / Qwen / DeepSeek
@open_source_llm_aff
Qwen в проде ломается не на «качестве», а на неправильном режиме инференса
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.