Команда разработчиков из независимого проекта Kestrel Labs представила открытый движок инференса для больших языковых моделей, который, по заявлению авторов, ускоряет генерацию токенов на потребительских видеокартах в среднем на 40% по сравнению с популярными решениями. Код опубликован под лицензией Apache 2.0.
Ключевая идея — адаптивное квантование весов на лету и новый планировщик батчей, который распределяет запросы между ядрами GPU и CPU. По словам разработчиков, движок поддерживает модели до 70 млрд параметров и корректно работает на картах с 12 ГБ памяти, выгружая часть слоёв в оперативную память без заметного падения пропускной способности.
В тестах на одном устройстве с моделью 13B движок выдал около 60 токенов в секунду при задержке первого токена менее 300 мс. Независимые разработчики уже отметили, что заявленные цифры сильно зависят от версии драйверов и рантайма, и пообещали провести собственные замеры в ближайшие недели.
Проект распространяется бесплатно, однако коммерческая поддержка и корпоративные сборки будут платными. Первый стабильный релиз запланирован на конец квартала, а документация и примеры интеграции уже доступны в публичном репозитории.