Команда инженеров представила открытую библиотеку FastInfer, которая ускоряет вывод небольших языковых моделей на обычных процессорах. По заявлению разработчиков, на внутренних тестах с моделью на 7 млрд параметров время отклика сократилось почти вдвое по сравнению с базовой референсной реализацией.
Ключевая идея — динамическое квантование весов «на лету» и переупорядочивание вычислений под размер кэша конкретного процессора. Библиотека поддерживает архитектуры x86-64 и ARM, а также умеет работать с уже существующими форматами моделей без дополнительной конвертации.
Код опубликован под лицензией Apache 2.0, доступны сборки для Linux, macOS и Windows. В планах — поддержка GPU-ускорения через Vulkan и интеграция с популярными фреймворками для локального запуска ассистентов и чат-ботов на пользовательских устройствах.
Эксперты отмечают, что подобные проекты снижают порог входа для компаний, которые не готовы арендовать дорогие ускорители. При этом реальная производительность сильно зависит от модели и профиля нагрузки, поэтому заявленные цифры стоит перепроверять на собственных сценариях.