NVIDIA представила ускоритель для инференса LLM с вдвое лучшей энергоэффективностью

NVIDIA представила ускоритель для инференса LLM с вдвое лучшей энергоэффективностью
Новость рубрики В мире Фото: Пресс-релиз NVIDIA (условный источник)

Компания NVIDIA представила новый ускоритель вычислений, ориентированный на инференс больших языковых моделей. По заявлению производителя, устройство обеспечивает до двух раз более высокую производительность на ватт по сравнению с предыдущим поколением и позволяет разворачивать модели с сотнями миллиардов параметров на одной плате.

Новинка построена на обновлённой архитектуре с увеличенным объёмом памяти HBM3e и поддержкой низкоуровневых форматов вроде FP8 и FP4. Отдельное внимание уделено программному стеку: библиотеки инференса получили автоматическое квантование и планировщик, который распределяет запросы между несколькими ускорителями без ручной настройки.

Партнёры уже анонсировали серверы на новой платформе. Крупные облачные провайдеры обещают открыть доступ к мощностям во втором полугодии, а поставки массовых систем ожидаются ближе к концу года. Цены производитель не раскрывает, отмечая, что они будут зависеть от конфигурации.

Аналитики отмечают, что ключевым ограничением остаётся энергопотребление дата-центров, а не вычислительная мощность. Конкуренты — AMD с ускорителями Instinct и собственные чипы гиперскейлеров — также готовят ответные решения, поэтому борьба за рынок ИИ-инфраструктуры в ближайшие кварталы только усилится.


Партнеры

Infopost

Экономика и технологии

BazaTV

Прямые трансляции

FoxNews.com.ru

Обсуждение ключевых тем

Jangyru

Новости