vLLM и TGI ломают одинаковые задачи по-разному: где один выигрывает, второй теряет
Если вам нужен high-throughput инференс на GPU, не выбирайте стек по привычке. Сначала смотрите на профиль нагрузки: длинные промпты, много параллельных запросов, streaming, tool-calls, batch.
vLLM обычно берут, когда важны плотная утилизация VRAM и стабильный токен/сек на конкурентной нагрузке: PagedAttention лучше держит KV-cache, а continuous batching помогает не проседать при очередях. TGI чаще удобнее там, где нужен более «сервисный» подход: готовая обвязка, привычная эксплуатация, проще встроить в существующий продовый контур.
Типовая ошибка — сравнивать их на одном коротком промпте и делать вывод по latency first token. Для честного теста нужны: одинаковая модель, одинаковая квантизация, одинаковый max context, фиксированный batch mix и нагрузка с длинными хвостами. Иначе вы меряете не движок, а случайный сценарий.
Смотрите на 4 метрики: throughput, p95 latency, memory headroom и деградацию на контексте. Если очередь растёт, а throughput падает плавно — стек живой. Если при 6–8 одновременных запросах начинается резкий обвал, это уже не «медленно», а неправильно выбранный runtime.
Выбирайте не «лучший фреймворк», а тот, который держит ваш паттерн запросов без лишнего запаса по VRAM и без сюрпризов в очереди.
Open Source LLM — Llama / Qwen / DeepSeek
@open_source_llm_aff
vLLM и TGI ломают одинаковые задачи по-разному: где один выигрывает, второй теряет
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.