Консорциум из пяти европейских исследовательских центров представил открытую языковую модель с длиной контекста в десять миллионов токенов. Веса опубликованы под лицензией Apache 2.0, а код обучения и часть датасетов выложены на GitHub. По заявлению разработчиков, модель способна обрабатывать целые репозитории кода и многочасовые расшифровки встреч без предварительной нарезки на фрагменты.
Ключевое отличие от существующих решений — новая схема разреженного внимания, снижающая вычислительные затраты на длинных последовательностях почти в восемь раз. Инженеры утверждают, что на одном узле из восьми ускорителей модель обрабатывает запрос с контекстом в миллион токенов за несколько секунд, тогда как прежние архитектуры упирались в ограничения памяти задолго до этого порога.
Независимые тестировщики уже отметили неоднозначные результаты: на задачах рассуждения модель уступает проприетарным аналогам, зато уверенно лидирует в анализе больших массивов документации. Часть специалистов предупреждает, что заявленные десять миллионов токенов на практике деградируют: качество ответов заметно падает после третьего миллиона, если запрос требует точных ссылок на источник.
Первые сборки уже появились в популярных фреймворках для локального запуска. Разработчики обещают выпустить облегчённые версии на 8 и 30 миллиардов параметров до конца квартала.