Контекст: у человека уже есть RTX 4080 с 16 ГБ VRAM. Для игр — окей, для локальных LLM — уже тесно. Варианта два: сжечь бюджет на жирную consumer-карту или пойти против глянцевого маркетинга и взять серверный GPU за £200.
Действие: автор не покупает «самую правильную» карту, а добирает память через датацентровую железку без нормального PCIe-коннектора, подключает её через адаптер и складывает VRAM двух GPU в один рабочий стек.
Результат: 32 ГБ VRAM в системе, модель на 27B параметров крутится локально и выдаёт 32 токена/с. За £200. 🚨
Что тут важно для growth/product людей: иногда ограничение — не качество модели, а ресурсный потолок. И если вы не меряете bottleneck, вы оптимизируете не то.
Мораль простая: сначала найди узкое место, потом уже покупай «решение». А не наоборот.
A/B Test Room
@ABTestRoomPro
Контекст: у человека уже есть RTX 4080 с 16 ГБ VRAM. Для игр — окей, для локальных LLM — уже тесно. Варианта д
Этот пост опубликован в Telegram-канале A/B Test Room. Подписаться можно по ссылке: @ABTestRoomPro.