Self-hosted выгоден не по факту наличия GPU, а по загрузке и профилю запросов
Считайте экономику от двух метрик: средняя длина промпта/ответа и utilization железа. Если у вас 70% коротких запросов, то узкое место — не VRAM, а overhead на batching, routing и холодные старты. Для таких кейсов один RTX 4090 часто дает лучшую unit-экономику, чем «большой» сервер с простоями.
Базовая формула простая: стоимость 1M токенов = (амортизация GPU + электричество + аренда + инженерное время) / фактический throughput. Если модель на одной карте держит 80–120 tok/s, но простаивает половину времени, реальная цена токена улетает вверх сильнее, чем кажется в Excel.
Три типовые ошибки:
— считать только аренду GPU и забывать про время инженера;
— брать слишком крупную модель «на запас», хотя запросы закрывает 8B–14B;
— не мерить p95 latency, из-за чего дешёвый инференс ломается под пиками.
Для продакшена сравнивайте не «API vs свой сервер», а «API vs свой сервер при вашем объёме, SLA и контексте». Если у вас стабильный поток, предсказуемая длина контекста и есть batchable workload, self-hosted обычно выигрывает. Если нагрузка рваная, дешевле платить за внешний API и не держать простаивающее железо.
Вывод: сначала меряете throughput и p95, потом считаете 1M токенов, и только после этого покупаете GPU.
Open Source LLM — Llama / Qwen / DeepSeek
@open_source_llm_aff
Self-hosted выгоден не по факту наличия GPU, а по загрузке и профилю запросов
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.