Nvidia раскрыла детали 88-ядерного процессора Vera для ИИ-агентов

На Hot Chips 2026 компания рассказала о пространственной многопоточности, памяти LPDDR5X в модулях SOCAMM2 и тестах задач, которые Nvidia относит к агентным ИИ-нагрузкам.

Vera CPU

Nvidia на конференции Hot Chips 2026 представила дополнительные технические подробности о серверном процессоре Vera. Это первый CPU компании с собственными ядрами Nvidia: предыдущее поколение Grace использовало готовую архитектуру Arm. Vera поставляется в единственной версии с 88 ядрами и рассчитан прежде всего на дата-центры с агентными ИИ-нагрузками.

В основе процессора лежат ядра Olympus, ориентированные на высокую производительность одного ядра. Среди особенностей Nvidia вновь выделила широкий 10-портовый блок декодирования, крупный блок предсказания ветвлений и нейросетевой предсказатель переходов.

Отдельно компания объяснила принцип пространственной многопоточности. Ресурсы ядра распределены между двумя конвейерами, при этом данные и кэш при необходимости могут передаваться между потоками. По данным Nvidia из SPEC CPU 2017 intrate, при одновременной работе второго потока производительность Vera в меньшей степени зависит от эффекта «шумного соседа», чем у неназванного традиционного CPU. С каким именно процессором проводилось это сравнение, компания не уточнила.

Процессор использует второе поколение Scalable Coherency Fabric. Центральные узлы когерентности связывают ядра с пулами кеша L3 общим объёмом 164 МБ и подсистемой памяти.

Для памяти Nvidia выбрала LPDDR5X вместо привычных серверных RDIMM. На плате для каждого Vera предусмотрено восемь разъёмов SOCAMM2; такая конфигурация обеспечивает до 1,5 ТБ памяти и пропускную способность до 1,2 ТБ/с. По изложению Nvidia, этот выбор связан не только со скоростью, но и с энергопотреблением в дата-центрах, ограниченных по мощности.

Nvidia также привела собственные результаты в задачах, которые компания считает показательными для агентных систем. В тесте с оптимизированным безоконным браузером Vera, по данным производителя, на 24% быстрее масштабирует число экземпляров браузера, чем 96-ядерный AMD EPYC 9655P. При сборке ядра Linux преимущество заявлено на уровне 22% для нативной цели AArch64 и 14% при кросс-компиляции для x86.

Компания при этом признаёт, что единый способ измерять производительность агентных ИИ-сценариев ещё не сформирован: такие цепочки включают разные типы задач. В качестве приближённых тестов Nvidia использует, в частности, работу браузера и компиляцию кода.