Self-hosted LLM окупается не «по ощущениям», а по утилизации GPU и токенам
Если считать экономику честно, у self-hosted есть 4 статьи: железо, энергия, оркестрация, простои. Самая частая ошибка — брать пиковую цену железа и делить на весь объём токенов, будто GPU загружена 24/7. В проде решает не цена карты, а средний throughput и доля времени, когда она реально обслуживает запросы.
Считай так: стоимость 1M токенов = (амортизация GPU + инфраструктура + эксплуатация) / фактический объём токенов. Если нагрузка рваная, себестоимость улетает вверх из-за idle time. Если есть batch-запросы, кэш и нормальный scheduler, одна и та же инфраструктура переваривает больше трафика без линейного роста затрат. ⚙️
Для прикидки окупаемости смотри на 3 порога:
— стабильный поток запросов;
— предсказуемая длина контекста;
— отсутствие жёсткой зависимости от закрытого API.
Если хотя бы два пункта не выполняются, self-hosted часто дороже не по цене токена, а по цене команды и поддержки.
Правильный вопрос не «какая модель дешевле», а «сколько токенов в день нужно, чтобы GPU не простаивала и SLA не развалился». Если можешь загрузить железо регулярно — экономика сходится. Если нет, внешний API почти всегда выигрывает на малом объёме.
Open Source LLM — Llama / Qwen / DeepSeek
@open_source_llm_aff
Self-hosted LLM окупается не «по ощущениям», а по утилизации GPU и токенам
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.