Custom-model на Replicate: где чаще всего теряют маржу на inference
Комиссия платформы — не единственная строка в калькуляторе. На маржу влияют ещё размер модели, длина прогона, очередь, повторные запросы и то, как часто клиент гоняет пустые или слишком длинные промпты.
На практике считайте так: себестоимость = время работы модели × цена за секунду/шаг + overhead на хранение и запуск. Дальше закладывайте запас на неудачные прогоны, потому что в AI-арте и генерации крео часть запросов уходит в брак. Если продаёте доступ по подписке, ориентируйтесь не на средний запрос, а на пиковую нагрузку.
Что важно:
— короткий inference почти всегда выгоднее, чем «тяжёлый» кастом без лимитов;
— кэшируйте повторяющиеся входы, если продукт это позволяет;
— режьте oversized input до запуска, а не после;
— для дорогих моделей ставьте лимиты на batch и очереди.
Ещё одна ошибка — считать только прямой cost per run. Если у вас есть предпросмотр, апскейл, повторная генерация и модерация, реальная себестоимость растёт в 1.5–3 раза без ощущения в интерфейсе.
Держите отдельный P&L на модель: если inference не покрывает support, retries и простои, продукт кажется прибыльным только на бумаге.
AI Creators Monetize
@ai_creators_monetize
Custom-model на Replicate: где чаще всего теряют маржу на inference
Этот пост опубликован в Telegram-канале AI Creators Monetize. Подписаться можно по ссылке: @ai_creators_monetize.