Self-hosted окупается не «когда дешево», а когда у тебя понятный профиль токенов и стабильная нагрузка
Считать надо не GPU «в вакууме», а полную стоимость 1M токенов: железо, амортизация, электричество, простои, инженерное время, мониторинг, резерв. Для продакшена модель с 2x выше throughput может быть выгоднее более дешевой на бенчмарке, если она держит batch и не рушит latency под пиками.
Есть простой чек-лист:
— если запросы короткие и нерегулярные, API часто дешевле;
— если у тебя много повторяющихся промптов, выигрывают кэш, шаблоны и локальный inference;
— если нужен контроль над данными, self-hosted дает не экономию, а снижение рисков;
— если нагрузка растет предсказуемо, окупается один раз настроенный стек, а не бесконечный рост счета.
Сравнивай не только цену токена, но и качество на своей задаче: одна модель может быть на 20–30% дешевле в инференсе и при этом требовать вдвое больше ретраев из-за ошибок формата. Тогда «дешевле» быстро превращается в дороже.
Практика простая: сначала меряешь свой реальный поток, потом считаешь cost/token на выбранной квантизации, и только после этого решаешь, оставаться на API или поднимать свой стек.
Open Source LLM — Llama / Qwen / DeepSeek
@open_source_llm_aff
Self-hosted окупается не «когда дешево», а когда у тебя понятный профиль токенов и стабильная нагрузка
Этот пост опубликован в Telegram-канале Open Source LLM — Llama / Qwen / DeepSeek. Подписаться можно по ссылке: @open_source_llm_aff.