Ollama в связке: как гонять AI-промпты локально и не кормить SaaS
Если у вас промпты крутятся в парсере, саппорте, генераторе крео или внутреннем боте, Ollama закрывает главную дыру: запросы не уходят наружу. Под капотом всё устроено проще, чем кажется — локальный API, модели в файлах, контроль над логами и железом.
Базовая схема: поднять Ollama на отдельной машине, открыть только нужный порт внутри VPN или private-сети, а приложения дергать по HTTP. Для связок удобно держать один шлюзовый сервис, который принимает prompt, добавляет system-слой, режет контекст и отправляет в модель. Так проще менять модели без переписывания всех клиентов.
Минимум, который стоит сразу сделать:
— вынести models на быстрый SSD;
— ограничить доступ firewall’ом;
— включить системный лог запросов без сырого контента;
— задать лимиты на размер контекста и число параллельных генераций;
— прогреть нужные модели заранее, а не на боевом трафике.
Для арбитража это особенно полезно, когда один пайплайн делает: классификацию лида, чистку текста, локальный перевод и генерацию ответов. Меньше внешних зависимостей — меньше сюрпризов с задержкой, квотами и утечкой данных.
Контроль над стеком — это контроль над прибылью. Начните с одной модели и одного сценария, потом добавляйте очередь, кэш и отдельные инстансы под разные задачи.
Self-hosted арсенал
@self_hosted_arsenal_ubt
Ollama в связке: как гонять AI-промпты локально и не кормить SaaS
Этот пост опубликован в Telegram-канале Self-hosted арсенал. Подписаться можно по ссылке: @self_hosted_arsenal_ubt.