Компания NVIDIA представила новый ускоритель вычислений, ориентированный на инференс больших языковых моделей. По заявлению производителя, устройство обеспечивает до двух раз более высокую производительность на ватт по сравнению с предыдущим поколением и позволяет разворачивать модели с сотнями миллиардов параметров на одной плате.
Новинка построена на обновлённой архитектуре с увеличенным объёмом памяти HBM3e и поддержкой низкоуровневых форматов вроде FP8 и FP4. Отдельное внимание уделено программному стеку: библиотеки инференса получили автоматическое квантование и планировщик, который распределяет запросы между несколькими ускорителями без ручной настройки.
Партнёры уже анонсировали серверы на новой платформе. Крупные облачные провайдеры обещают открыть доступ к мощностям во втором полугодии, а поставки массовых систем ожидаются ближе к концу года. Цены производитель не раскрывает, отмечая, что они будут зависеть от конфигурации.
Аналитики отмечают, что ключевым ограничением остаётся энергопотребление дата-центров, а не вычислительная мощность. Конкуренты — AMD с ускорителями Instinct и собственные чипы гиперскейлеров — также готовят ответные решения, поэтому борьба за рынок ИИ-инфраструктуры в ближайшие кварталы только усилится.