Nvidia предложила динамически перераспределять мощность между стойками ИИ-ЦОД
На Hot Chips компания представила подход DSX MaxLPS для управления энергопотреблением площадки. Nvidia утверждает, что он позволит размещать больше вычислительных систем в дата-центрах с фиксированным лимитом мощности.

Nvidia на конференции Hot Chips рассказала о DSX MaxLPS — наборе средств проектирования и динамического управления электропитанием дата-центра. Идея состоит в том, чтобы не резервировать для каждой стойки её максимальное теоретическое потребление, а отслеживать фактическую нагрузку и направлять свободную мощность туда, где она нужна в данный момент.
По оценке Nvidia, дата-центр с лимитом в 100 МВт при использовании технологий управления питанием Vera Rubin и DSX MaxLPS сможет вместить до 40 000 GPU Rubin — примерно 40 систем Rubin DGX SuperPOD. Компания заявляет для такой конфигурации производительность до 2 зетафлопс при инференсе NVFP4 и до 1,4 зетафлопс при обучении NVFP4. Издание Tom’s Hardware обращает внимание, что эти показатели, вероятно, являются расчётными, а не полученными в реальных нагрузках.
Традиционное статическое планирование исходит из пикового энергопотребления каждого узла. Из-за этого часть выделенной мощности может оставаться невостребованной: менее загруженная стойка не использует свой резерв, тогда как другая упирается в установленный лимит. DSX MaxLPS должен учитывать потребление на уровне чипа, стойки и групп стоек, а программный контур Dynamic Power Software — перераспределять доступную мощность между системами.
В качестве примера Nvidia приводит конфигурацию на стойках GB300. При бюджете 540 кВт и статическом резервировании по 135 кВт на систему можно разместить четыре системы. По данным компании, до 170 кВт при таком сценарии могут простаивать из-за разной загрузки стоек; этого запаса достаточно для установки ещё одной современной стойки NVL72 в рамках того же лимита.
Компания также сравнила расчётный режим с DSX MaxLPS на стойке Grace Blackwell GB300, выполняющей инференс DeepSeek-R1. При прежнем подходе для GPU закладывалось энергопотребление 1400 Вт, а для стойки — 136 кВт. С MaxLPS типичное энергопотребление GPU в этой нагрузке, по утверждению Nvidia, составляет 1000 Вт, а стойки — 101 кВт без потери заявленной производительности.
Для стоек предусмотрены профили энергопотребления под разные типы задач, включая инференс, обучение, вычислительно- и память-зависимые нагрузки. Nvidia рассчитывает, что такой подход позволит операторам гибче использовать уже доступную мощности площадки, особенно когда установленное оборудование со временем переходит от обучения моделей к инференсу.