🤖🇺🇸 NVIDIA создаёт специализированную инфраструктуру для ускорения работы ИИ-агентов
NVIDIA перевела в полномасштабное производство ускоритель Groq 3 LPX, который будет использоваться совместно с вычислительной платформой Vera Rubin. Его задача – ускорить наиболее медленную часть работы больших языковых моделей: последовательное формирование ответа по одному токену.
📌 При обычной работе модели обработка большого исходного текста хорошо распределяется между множеством вычислительных блоков. Однако при последующей генерации каждый новый токен зависит от предыдущего. Для ИИ-агентов это особенно важно: при выполнении одной задачи модель может многократно обращаться к программам, файлам, поиску и другим средствам, после чего снова продолжать вычисления. Задержка каждого такого обращения накапливается и увеличивает общее время выполнения задачи.
NVIDIA предлагает разделить эту нагрузку. Процессоры Rubin GPU выполняют наиболее ресурсоёмкую обработку исходных данных и большие параллельные вычисления, а Groq 3 LPX ускоряет последовательное формирование новых токенов. Распределением вычислений между ними управляет программная система NVIDIA Dynamo.
🔷 В одной стойке Groq 3 LPX размещается до 256 процессоров LP30. Система имеет 128 ГБ сверхбыстрой SRAM с совокупной пропускной способностью около 40 ПБ/с, 12 ТБ DDR5 и производительность до 315 PFLOPS FP8.
Особенность LPX заключается в заранее определённом порядке выполнения операций. Компилятор ещё до запуска модели рассчитывает, какой процессор и в какой момент выполняет вычисление и куда передаёт полученные данные. Это уменьшает задержки на управление обменом между сотнями процессоров.
📊 В испытании модель Gemma 4 31B при исходном контексте около 100 тыс. токенов обеспечила 3 431 выходной токен/с на одного пользователя. Для сравнения, самый быстрый из доступных публичных сервисов в том же сопоставлении показывал около 870 токенов/с. При задачах программирования система LPX достигала медианного значения около 4,8 тыс. токенов/с.
Справочно: при скорости 100 токенов/с генерация 5 тыс. токенов занимает около 50 секунд, при 3,4 тыс. токенов/с – примерно 1,5 секунды. Поэтому выигрыш особенно заметен в агентных системах, которые в ходе одной задачи многократно анализируют промежуточные результаты, запускают программы, проверяют полученные данные и продолжают работу.
⚔️ В военной сфере подобная архитектура потенциально сокращает машинную часть цикла управления. ИИ-агенты могут быстрее обрабатывать донесения, изображения и документы, сопоставлять сведения из различных источников, проверять противоречия, готовить варианты решения, контролировать выполнение поставленных задач и повторно анализировать поступающие изменения.
Особенно заметным эффект может быть в системах, где одновременно работают несколько специализированных ИИ-агентов: один обрабатывает сведения, другой оценивает обстановку, третий проверяет материально-техническое обеспечение или состояние связи, после чего результаты сводятся для штаба. Ускорение каждой отдельной операции позволяет сократить время между поступлением новых данных и подготовкой обоснованного варианта действий.
🔺 Главное изменение заключается не просто в росте скорости генерации. NVIDIA начинает распределять различные этапы работы ИИ между специализированными процессорами. Vera CPU используются для управления вычислительными задачами, Rubin GPU – для обработки больших объёмов данных и сложных параллельных вычислений, а Groq 3 LPX – для максимально быстрого последовательного формирования результата.
Таким образом, Vera Rubin превращается из обычной GPU-платформы в многокомпонентную вычислительную систему, рассчитанную прежде всего на массовое применение автономных ИИ-агентов. Ускорение отдельных этапов позволяет агенту за одинаковое время выполнить значительно больше вычислительных операций и проверок, что напрямую повышает сложность задач, которые он способен решать без постоянного участия пользователя.
Post #1600
64
