Российская компания «Нейрософт Лабс» объявила о выпуске открытой библиотеки TorchStream 1.0 — инструмента для потоковой обработки данных при обучении больших языковых моделей. Релиз опубликован на GitHub под лицензией Apache 2.0 и доступен для установки через pip.
По словам разработчиков, TorchStream позволяет обучать модели прямо с дисков вместо оперативной памяти, автоматически разбивая датасет на чанки и подгружая их в GPU по мере необходимости. В тестах на кластере из восьми ускорителей A100 библиотека сократила потребление RAM на 74% при падении пропускной способности всего на 6%. Поддерживаются PyTorch 2.3 и выше, а также форматы Parquet, WebDataset и Arrow.
Аналогичные решения уже есть у Hugging Face и MosaicML, однако TorchStream делает ставку на отказоустойчивость: при сбое узла обучение продолжается с последней контрольной точки без ручного вмешательства. Это особенно важно для распределённых кластеров, где один узел из сотни может отказать в любой момент.
Первые отзывы в сообществе сдержанно позитивные: отмечают простоту API, но указывают на скудную документацию и отсутствие поддержки AMD ROCm. Команда обещает закрыть эти пробелы в версии 1.1, запланированной на конец квартала. Исходный код и примеры доступны всем желающим.