OXMIQ: флеш-память HBF — не универсальная замена HBM в ИИ-ускорителях

На Hot Chips 2026 компания OXMIQ Labs представила расчёты, согласно которым High Bandwidth Flash выгодна прежде всего для хранения очень больших, но нечасто востребованных данных. При высокой нагрузке её меньшая пропускная способность может сделать HBM более экономичным вариантом.

HBM4 chips

High Bandwidth Flash (HBF) не станет универсальной и дешёвой заменой памяти HBM для ИИ-ускорителей. К такому выводу пришла OXMIQ Labs в презентации на конференции Hot Chips 2026: технология способна заметно увеличить локальный объём памяти, но во многих задачах её ограниченная пропускная способность становится узким местом.

HBF использует 3D NAND и интерфейс UCIe. В описанной OXMIQ спецификации предусмотрены три класса: первый предлагает 256 ГБ и пропускную способность 384 ГБ/с, второй — 512 ГБ и 1,536 ТБ/с, третий — те же 512 ГБ при 3,072 ТБ/с. Последний вариант должен использовать UCIe 2.0 со скоростью 32 GT/s. По оценке компании, ключевое преимущество HBF — объём: при сопоставимой стоимости она может дать в 8–16 раз больше памяти, чем HBM.

Однако большой объём не гарантирует низкую стоимость инференса. OXMIQ смоделировала стойку из 72 GPU, работающую с моделью Kimi-K2 на 1 трлн параметров в формате FP4. В конфигурации только с HBM стойка располагает 20,7 ТБ памяти и суммарной пропускной способностью 1584 ТБ/с. Полная замена HBM на HBF увеличивает объём до 294,9 ТБ, но снижает суммарную пропускную способность до 922 ТБ/с.

В этой модели HBF позволяет разместить отдельный экземпляр Kimi-K2 на каждом GPU — всего 72 экземпляра на стойку. При использовании только HBM для хранения одного экземпляра требуется восемь GPU, поэтому стойка может обслуживать девять экземпляров. Но по мере роста числа одновременных запросов и скорости генерации токенов ограничением становится пропускная способность HBF. В таком сценарии стойка с HBM способна обеспечить более низкую стоимость токена, утверждает OXMIQ.

Компания предлагает рассматривать HBF как отдельный уровень памяти для крупных и сравнительно редко используемых данных. Один из возможных сценариев — Mixture-of-Experts-модели. В приведённом OXMIQ примере Kimi-K3 занимает 1,56 ТБ, из которых 1,45 ТБ, или 93%, приходятся на веса экспертов. Поскольку при обработке каждого токена активируется лишь часть экспертов, эти данные можно хранить в HBF, а часто используемые веса — в HBM.

Ещё один предполагаемый сценарий — инференс с длинным контекстом. Для моделей с разреженным механизмом внимания большая часть KV-кэша не требуется на каждом шаге декодирования; OXMIQ предлагает держать такой кэш в HBF и подгружать в HBM только нужные данные.

При этом схема, в которой HBM работает кэшем для HBF, подходит не для любой нагрузки. По данным OXMIQ, с увеличением размера батча и разнообразия запросов обращения распределяются по большему числу экспертов. Рабочий набор может перестать помещаться в HBM, а частые переносы данных из HBF снижают эффект от кэширования. Вывод компании: HBM остаётся памятью для высокопроизводительных стоек, тогда как HBF может быть полезна внутри отдельных вычислительных узлов, где критичнее ёмкость.