Консорциум из пяти европейских университетов и двух технологических компаний представил открытую языковую модель Orbis-7B, предназначенную для генерации и ревью программного кода. Веса модели, обучающие скрипты и карточка данных опубликованы под лицензией Apache 2.0 на платформе Hugging Face.
По заявлению разработчиков, Orbis-7B обучалась на 2,1 трлн токенов, из которых 60% составляет лицензированный исходный код, а остальное — техническая документация и обсуждения на профильных форумах. Модель показывает 62% на бенчмарке HumanEval и обходит сопоставимые открытые решения с 13 млрд параметров при вдвое меньшем потреблении памяти.
Отдельное внимание уделено вопросам безопасности и правовой чистоты. Команда внедрила фильтр, отсекающий фрагменты кода с явными признаками проприетарных лицензий, а также механизм цитирования источников при дословном воспроизведении крупных блоков. Аудит проводился независимой лабораторией, отчёт опубликован вместе с моделью.
Первые пользователи отмечают высокое качество автодополнения в проектах на Python и Rust, но жалуются на слабую поддержку редких языков и устаревшие сведения о библиотеках. Разработчики обещают выпустить инструкционную версию и обновление базы знаний в течение квартала, а также открыть приём заявок на участие в дообучении.