Что произошло: автор не стал покупать «правильную» дорогую GPU с большим VRAM, а собрал локальный AI-стек из двух видеокарт — игровой RTX 4080 на 16 ГБ и серверной карты через адаптер. Итог — 32 ГБ VRAM в одной системе и запуск модели на 27B параметров со скоростью около 32 токенов/с.
Цифры здесь важнее истории про «хак». За £200 он закрыл главный барьер локального инференса — память. Для продакта это хороший пример не про железо, а про constraint thinking: если пользователь упирается в лимит ресурса, он не всегда уходит к дорогому апгрейду. Иногда он ищет обходной путь, если тот быстрее и дешевле даст value moment ⚙️
Вывод для growth-product простой: люди выбирают не «лучшее решение», а самое доступное решение, которое уже сейчас снимает боль. В онбординге, активации и re-engagement это работает так же: чем быстрее показать рабочий результат, тем выше шанс, что пользователь останется.
Retention Mix
@RetentionMixPro
Что произошло: автор не стал покупать «правильную» дорогую GPU с большим VRAM, а собрал локальный AI-стек из д
Этот пост опубликован в Telegram-канале Retention Mix. Подписаться можно по ссылке: @RetentionMixPro.