Open Source LLM — Llama / Qwen / DeepSeek

vLLM и TGI ломают одинаковые задачи по-разному: где один выигрывает, второй теряет

vLLM и TGI ломают одинаковые задачи по-разному: где один выигрывает, второй теряет

Если вам нужен high-throughput инференс на GPU, не выбирайте стек по привычке. Сначала смотрите на профиль нагрузки: длинные промпты, много параллельных запросов, streaming, tool-calls, batch.

vLLM обычно берут, когда важны плотная утилизация VRAM и стабильный токен/сек на конкурентной нагрузке: PagedAttention лучше держит KV-cache, а continuous batching помогает не проседать при очередях. TGI чаще удобнее там, где нужен более «сервисный» подход: готовая обвязка, привычная эксплуатация, проще встроить в существующий продовый контур.

Типовая ошибка — сравнивать их на одном коротком промпте и делать вывод по latency first token. Для честного теста нужны: одинаковая модель, одинаковая квантизация, одинаковый max context, фиксированный batch mix и нагрузка с длинными хвостами. Иначе вы меряете не движок, а случайный сценарий.

Смотрите на 4 метрики: throughput, p95 latency, memory headroom и деградацию на контексте. Если очередь растёт, а throughput падает плавно — стек живой. Если при 6–8 одновременных запросах начинается резкий обвал, это уже не «медленно», а неправильно выбранный runtime.

Выбирайте не «лучший фреймворк», а тот, который держит ваш паттерн запросов без лишнего запаса по VRAM и без сюрпризов в очереди.
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.
ai_creative

Свежие посты в категории «AI & Creative Production»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.