Open Source LLM — Llama / Qwen / DeepSeek

vLLM и TGI ломают прод в разных местах — проверь это до миграции

vLLM и TGI ломают прод в разных местах — проверь это до миграции

Если модель крутится на одной GPU и у тебя короткий контекст, оба сервера могут дать похожий throughput. Но различие вылезает на пачках запросов, длинном контексте и при высокой конкуренции за KV-cache: один лучше держит параллелизм, другой чаще упирается в память и batching-паттерн.

Смотри на 4 вещи:
— модель и квантизация: fp16, int8, int4, GGUF дают разный баланс качества и скорости;
— длина контекста: заявленные 128k не равны рабочим 128k, latency растёт нелинейно;
— форма трафика: много коротких запросов, один длинный диалог или смешанный поток;
— механизм batch/prefill/decode: именно он решает, сколько tokens/sec ты увидишь в проде.

vLLM обычно берут, когда нужен агрессивный continuous batching и высокая утилизация GPU. TGI удобен, если важнее предсказуемость, простая эксплуатация и интеграция в типовой inference-стек. На практике узкое место часто не в самой модели, а в том, как сервер режет память под KV-cache и как он переживает пики.

Перед выбором сделай один честный тест: одинаковая модель, одинаковая квантизация, одинаковый prompt set, одинаковый лимит concurrency. Сравни не только tokens/sec, но и p95 latency, OOM-поведение и деградацию на длинном контексте.

Сначала меряй свой профиль нагрузки, потом выбирай сервер. Иначе ты оптимизируешь не инференс, а иллюзию throughput.
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.
ai_creative

Свежие посты в категории «AI & Creative Production»

Все каналы категории →

@carousel_engine_ubt · 22 SeptemberSeptember9
Инструменты для быстрой графики без мыла на выходе: что реально ускоряет production Карусель — это не пост, это последовательный интерфейс....
@ai_bulk_pages_ubt · 22 SeptemberSeptember9
Галлюцинации в AI-контенте: как ловить их до публикации и не кормить мусорный индекс Разбираем пайплайн на атомы: сгенерированный текст нель...
@ai_image_pipeline_ubt · 22 SeptemberSeptember9
Реалистичные лица для нутры на Flux и SDXL: как не палить нейросетку Генерим конвертящий визуал: для нутры лицо должно выглядеть как случайн...
@creo_factory_arb · 22 SeptemberSeptember9
Аналитика конверсии: как не перепутать клики с реальными деньгами Клик — это не победа, а только вход в мясорубку. Если у тебя CTR бодрый, а...
@creo_stack_aff · 22 SeptemberSeptember9
Голосовой генератор не спасает плохой сценарий: 5 проверок перед рендером Почти любой AI-голос можно испортить не моделью, а входом. Если те...
start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.