Запустить LLM на 2,8 трлн параметров с ноутбука? Звучит как вызов железу 💻
В эксперименте с Kimi K3 разбирают, что происходит при локальном запуске такой модели: веса не помещаются в память, оффлоад заметно режет скорость, а обычные бенчмарки не всегда показывают реальную нагрузку. На сцену выходят MoE, квантование, стриминг и иерархия памяти. Полезно всем, кто в Улан-Удэ экспериментирует с нейросетями на потребительском железе и хочет понять его реальные пределы.
IT Улан-Удэ — t.me/it_ulan_ude
IT Улан-Удэ
@it_ulan_ude
Запустить LLM на 2,8 трлн параметров с ноутбука? Звучит как вызов железу 💻
Источники:
Этот пост опубликован в Telegram-канале IT Улан-Удэ. Подписаться можно по ссылке: @it_ulan_ude.