Консорциум европейских исследовательских центров и трёх независимых вендоров объявил о релизе открытой платформы OpenForge 2.0 для запуска больших языковых моделей. Код проекта распространяется под лицензией Apache 2.0, а веса базовых моделей — под открытой исследовательской лицензией.
Главное новшество релиза — переработанный движок инференса, который позволяет запускать модели с 8 миллиардами параметров на обычном ноутбуке без дискретной видеокарты. По заявлениям разработчиков, за счёт 4-битного квантования и агрессивного кеширования механизмов внимания потребление памяти удалось снизить примерно втрое, а скорость генерации выросла до 20 токенов в секунду на процессорах x86 с поддержкой AVX-512.
В платформу также добавили менеджер адаптеров LoRA, инструмент локального файнтюнинга на одном устройстве и встроенный сервер с OpenAI-совместимым API. Это упрощает миграцию существующих приложений: достаточно поменять базовый URL, чтобы запросы ушли на локальную модель вместо облачного сервиса.
Релиз уже доступен в репозитории проекта и в основных пакетных менеджерах. В планах на следующий квартал — поддержка ARM-ускорителей, мобильных NPU и распределённого инференса между несколькими машинами в локальной сети.