Nvidia раскрыла архитектуру Groq 3 LPX и показала сторонний бенчмарк Artificial Analysis

Стойка LPX на чипах LP30, полученных Nvidia в сделке с Groq, уже находится в производстве, заявил вице-президент Nvidia Игорь Арсовски. В тесте Artificial Analysis система достигла 3431 выходного токена в секунду на Gemma 4 31B с контекстом в 100 тыс. токенов.

Nvidia Render

Nvidia на конференции Hot Chips 2026 представила архитектуру стойки Groq 3 LPX и привела результаты первого стороннего бенчмарка для этой системы. По словам вице-президента компании по аппаратному обеспечению Игоря Арсовски, стойки на базе чипов LP30 уже производятся.

Artificial Analysis измерила производительность предварительного закрытого эндпоинта Gemma 4 31B в Google Cloud: медианный результат составил 3431 выходной токен в секунду при контексте в 100 тыс. токенов. Как пишет Tom's Hardware, это примерно вчетверо выше 870 токенов в секунду у следующего по скорости публичного сервиса в сравнении.

Однако условия теста отличаются от работы публичных сервисов. Artificial Analysis отправляла 50 последовательных запросов с параллелизмом один, тогда как сопоставляемые провайдеры использовали общие серверные конечные точки в промышленной эксплуатации. Поэтому показатель отражает максимальную скорость для одного клиента и напрямую не сопоставим с многопользовательской нагрузкой.

На сцене Nvidia также показала собственный результат — 10 996 выходных токенов в секунду на той же модели. Арсовски отдельно назвал эту цифру собственной оценкой компании и заявил, что Nvidia намерена публиковать независимые проверяемые бенчмарки.

Одна стойка LPX объединяет 256 чипов LP30. Каждый из них располагает примерно 500 МБ встроенной SRAM и не использует память HBM; суммарно система получает 128 ГБ памяти, пропускную способность 40 ПБ/с и 315 петафлопс вычислений FP8. Межчиповая задержка указана на уровне 350 нс. Стойка выполнена в совместимом с Vera Rubin жидкостно охлаждаемом формате MGX и может масштабироваться более чем до 1000 LPU.

Архитектура рассчитана прежде всего на этап декодирования — генерацию выходных токенов. Nvidia предлагает задействовать GPU Rubin для ресурсоёмкого этапа prefill и построения KV-кэша, а LPX — для декодирования. Компания также описала варианты разделения задач между GPU и LPU: раздельное выполнение prefill и decode, распределение между attention- и FFN-слоями, а также спекулятивное декодирование с внешней моделью-предиктором на LPU.

По оценке самой Nvidia, такие схемы дают ускорение примерно в три—пять раз относительно Rubin без LPX при работе с моделью на 2 трлн параметров и закэшированным контекстом на 400 тыс. токенов. Это не независимый результат.

LP30 Nvidia получила в рамках сделки с Groq на $20 млрд, заключённой в декабре 2025 года, сообщает Tom's Hardware. Издание отмечает, что подход Groq 3 LPX восходит к Tensor Streaming Processor, описанному Groq в научной работе 2020 года. Ограничением SRAM-подхода остаётся объём памяти: для размещения весов модели на 31 млрд параметров в FP8, по расчёту издания, потребуется около 62 LPU, а крупные mixture-of-experts-модели могут занять тысячи чипов в нескольких стойках.