Консорциум независимых исследователей OpenLingua опубликовал языковую модель Lume-8B, распространяемую под лицензией Apache 2.0. Веса, токенизатор и скрипты обучения выложены на публичном хостинге, коммерческое использование разрешено без дополнительных согласований.
По заявлению разработчиков, модель обучена на 3,1 трлн токенов и поддерживает 40 языков, включая русский, украинский, казахский и узбекский. Заявленная точность на бенчмарке MMLU составляет 71,4 %, что сопоставимо с проприетарными решениями предыдущего поколения при вдвое меньшем числе параметров.
Ключевое отличие Lume-8B — полностью открытый датасет. Команда раскрыла список источников и методику фильтрации, что позволяет воспроизвести обучение с нуля. Для инференса достаточно одной видеокарты с 16 ГБ памяти в квантованном режиме.
Аналитики отмечают, что выход ещё одной открытой модели усиливает конкуренцию на рынке корпоративных ИИ-решений. Ряд компаний уже анонсировал пилотные внедрения, однако вопросы юридической ответственности за генеративный контент остаются нерешёнными.