Open Source LLM — Llama / Qwen / DeepSeek

Self-hosted выгоден не по факту наличия GPU, а по загрузке и профилю запросов

Self-hosted выгоден не по факту наличия GPU, а по загрузке и профилю запросов

Считайте экономику от двух метрик: средняя длина промпта/ответа и utilization железа. Если у вас 70% коротких запросов, то узкое место — не VRAM, а overhead на batching, routing и холодные старты. Для таких кейсов один RTX 4090 часто дает лучшую unit-экономику, чем «большой» сервер с простоями.

Базовая формула простая: стоимость 1M токенов = (амортизация GPU + электричество + аренда + инженерное время) / фактический throughput. Если модель на одной карте держит 80–120 tok/s, но простаивает половину времени, реальная цена токена улетает вверх сильнее, чем кажется в Excel.

Три типовые ошибки:
— считать только аренду GPU и забывать про время инженера;
— брать слишком крупную модель «на запас», хотя запросы закрывает 8B–14B;
— не мерить p95 latency, из-за чего дешёвый инференс ломается под пиками.

Для продакшена сравнивайте не «API vs свой сервер», а «API vs свой сервер при вашем объёме, SLA и контексте». Если у вас стабильный поток, предсказуемая длина контекста и есть batchable workload, self-hosted обычно выигрывает. Если нагрузка рваная, дешевле платить за внешний API и не держать простаивающее железо.

Вывод: сначала меряете throughput и p95, потом считаете 1M токенов, и только после этого покупаете GPU.
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.
ai_creative

Свежие посты в категории «AI & Creative Production»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.