Open Source LLM — Llama / Qwen / DeepSeek

Qwen в проде ломается не на ответах, а на плохом выборе режима и контекста

Qwen в проде ломается не на ответах, а на плохом выборе режима и контекста

Qwen часто берут как «универсальную» модель, но в проде её надо делить на три сценария: короткие ответы, длинный контекст и структурированный JSON. Для каждого — свой стек. Одна и та же модель в fp16, int8 и gguf даёт разную цену ошибки: где-то выигрывает latency, где-то падает точность на вложенных инструкциях.

Если нужен API под автоматизацию, смотрите на три вещи:
— стабильность следования формату;
— деградацию на длине контекста;
— поведение на русском без англоязычного промпта-«костыля».
У Qwen обычно хорошо с разметкой и извлечением полей, но при слишком длинной истории надо резать хвост и выносить память в RAG, иначе растёт мусор в ответах.

В инференсе типичная ошибка — гнать всё через один и тот же шаблон. Для генерации текста лучше один system prompt и короткий контекст; для агента — строгий JSON schema и жёсткий post-validate; для саппорта — summarization каждые N сообщений. Иначе throughput есть, а качество плавает.

Если выбираете Qwen под прод, сначала тестируйте не «бенчмарк на бумаге», а свои 50–100 реальных запросов: извлечение, классификация, переформатирование, отказоустойчивость к шуму. Модель, которая проходит ваш формат без ручной правки, почти всегда дешевле любой «чуть умнее» на бумаге.
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.
ai_creative

Свежие посты в категории «AI & Creative Production»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.