Сторонняя железка за £200 — и уже 32 ГБ VRAM в одном локальном сетапе.
Техническая суть трюка простая: к RTX 4080 на 16 ГБ добавили серверный GPU без нормального PCIe-коннектора, завели его через адаптер и получили суммарный объём памяти, достаточный для локального запуска 27B-модели. Итог — около 32 токенов/сек и без апгрейда на дорогую consumer-карту с большим VRAM.
Почему это интересно не только гикам:
— локальный LLM меньше зависит от облака
— можно тестировать промпты, RAG и агентные сценарии быстрее
— для SEO/контента это означает более дешёвые эксперименты с генерацией, кластеризацией и извлечением сущностей
Но есть важная оговорка: это не “купил и заработало”. Серверные GPU часто требуют плясок с питанием, охлаждением и совместимостью. Хороший пример того, как железо иногда открывает доступ к более серьёзным AI-тестам без бюджета на топовые карты 🔧
GEO/AEO Now
@GeoAeoNowPro
Сторонняя железка за £200 — и уже 32 ГБ VRAM в одном локальном сетапе.
Этот пост опубликован в Telegram-канале GEO/AEO Now. Подписаться можно по ссылке: @GeoAeoNowPro.