Консорциум из семи европейских исследовательских организаций опубликовал веса языковой модели OpenEuro-7B под лицензией Apache 2.0. Разработчики утверждают, что модель одинаково уверенно работает с 40 языками, включая эстонский, словенский и украинский, и обходит сопоставимые открытые решения в задачах перевода и извлечения фактов.
Обучение заняло 21 день на кластере из 1024 ускорителей и потребовало около 4,5 млрд токенов, собранных из открытых корпусов, государственных архивов и лицензированных новостных лент. Все данные прошли фильтрацию на персональную информацию, а сам датасет опубликован отдельным репозиторием с описанием источников и методов очистки.
По словам инженеров проекта, ключевая особенность архитектуры — модуль адаптации к диалектам: перед генерацией ответа модель определяет языковую ветку и переключает небольшой набор параметров. Это снизило потребление памяти на 18% на устройствах с 8 ГБ видеопамяти и упростило дообучение на доменных данных.
Модель уже доступна в популярных библиотеках для локального запуска, а коммерческие пользователи могут применять её без отчислений. Независимые тестировщики отмечают скромный разрыв с закрытыми лидерами в сложных рассуждениях, но подчёркивают предсказуемость лицензии и воспроизводимость результатов.