Квантование с HARP: +100% скорости без потери качества
Новая модель HARP на базе learnable structured orthogonal processor позволяет заменить фиксированное квантование на адаптивное. Результаты: до 128 токенов/с против 61 у FP16 на моделях от 1B до 70B, причём точность не падает — perplexity и zero-shot accuracy улучшаются относительно fixed RHT.
Что это даёт командам, которые генерируют креативы на LLM: скорость деплоя растёт вдвое, а значит, можно быстрее генерировать варианты текстов, экономить на инференсе и делать A/B-тесты в реальном времени. Mixed-Radix снимает ограничения на non-power-of-two размеры, что упрощает внедрение на нестандартных конфигурациях.
Для сравнительных обзоров AI-инструментов важно разделять «квантование» и «ускорение»: новый метод сохраняет full-precision equivalence, поэтому качество предсказаний не страдает. При выборе платформы для генерации крео проверяйте, какой базис квантования используется и есть ли поддержка калибровки под конкретный слой.
Vector TikTok Ads
@VectorTiktokAds
Квантование с HARP: +100% скорости без потери качества
Этот пост опубликован в Telegram-канале Vector TikTok Ads. Подписаться можно по ссылке: @VectorTiktokAds.