NVIDIA впервые раскрыла результаты тестирования будущей флагманской платформы Vera Rubin NVL72, ориентированной на задачи агентного искусственного интеллекта. Согласно материалам компании, новая система сравнивалась с действующей платформой GB300 NVL72 на реалистичном сценарии агентного программирования с использованием модели DeepSeek-V4-Pro.
Ключевой заявленный результат — до 30-кратного роста производительности на мегаватт по сравнению с GB300 NVL72. Одновременно стоимость генерации токенов, по оценке NVIDIA, может снизиться до 35 раз. Если такие показатели подтвердятся в независимых внедрениях, речь будет идти не просто об ускорении отдельных моделей, а о заметном изменении экономики сложных ИИ-сервисов.
Причина такого фокуса — рост агентных сценариев. В отличие от обычного чат-бота, ИИ-агент может выполнять длинную цепочку действий: анализировать документы, обращаться к внешним инструментам, запускать код, порождать подзадачи и использовать результаты предыдущих шагов как новый контекст. Такие процессы требуют существенно больше токенов, памяти, вычислительных ресурсов и пропускной способности между компонентами системы.
Поэтому NVIDIA предлагает оценивать платформы не по традиционным коротким тестам инференса, а по полноценным агентным рабочим процессам. В качестве одного из таких сценариев компания использует AgentX — бенчмарк, воспроизводящий сессии программирования с растущим контекстом, вызовами инструментов и взаимодействием нескольких агентов.
В основе Vera Rubin NVL72 лежит не только новое ускорительное оборудование, но и комплексная архитектура. Компания делает ставку на разделение обработки контекста и генерации токенов, распределенное хранение KV-кэша, маршрутизацию с учетом этого кэша, поддержку MoE-моделей и новые подходы к управлению энергопотреблением. Отдельное значение имеет использование низкоточной квантования NVFP4: оно должно уменьшать требования к памяти без существенной потери качества генерации.
Важную роль играет и новое поколение NVLink. Для крупных MoE-моделей, где разные части запроса могут направляться к разным «экспертам» внутри нейросети, быстрая связь между десятками GPU становится критически важной. NVIDIA позиционирует Vera Rubin NVL72 уже не как набор отдельных графических процессоров, а как цельную «ИИ-фабрику», предназначенную для производства большого объема токенов при ограничениях по электропитанию дата-центра.
Одновременно NVIDIA сообщила о начале массового выпуска Groq 3 LPX — низколатентного ускорителя инференса для платформы Vera Rubin. Его задача — ускорять именно этап последовательной генерации токенов, тогда как Rubin GPU обрабатывают большой входной контекст. В материалах NVIDIA приводится результат до 3400 токенов в секунду для Gemma 4 31B при контекстном окне в 100 тысяч токенов. Для задач, чувствительных к задержкам, например многошагового агентного программирования, подобное разделение труда между ускорителями может стать особенно важным.
Еще одним элементом платформы стал Vera CPU, созданный с учетом высокой нагрузки, которую создают ИИ-агенты: управление вызовами инструментов, выполнение кода, обработка данных и координация многочисленных шагов внутри одного задания. По заявленным характеристикам, процессор включает 88 ядер Olympus и использует память LPDDR5X с высокой пропускной способностью.
Главная идея NVIDIA заключается в том, что эпоха агентного ИИ меняет саму структуру вычислительной инфраструктуры. Если в предыдущем цикле рынка главным продуктом была GPU для обучения и инференса, то теперь компания формирует более широкий стек: GPU, CPU, ускорители декодирования, высокоскоростные интерконнекты, средства управления энергией и программные механизмы для распределения нагрузки.
Однако представленные цифры следует воспринимать с учетом условий тестирования и выбранных бенчмарков. Практическая ценность Vera Rubin будет зависеть от независимых измерений, стоимости развертывания, доступности энергии, зрелости программного стека и того, насколько быстро компании смогут превратить рост производительности в реальные агентные продукты. Тем не менее анонс показывает, что борьба на рынке ИИ все сильнее смещается от отдельных моделей к инфраструктуре, способной поддерживать масштабные и непрерывные рабочие процессы автономных агентов.
Источник: NVIDIA Developer Blog
sms_systems@inbox.ru
+ 7 (985) 982-70-55