Zhipu раскрыла модель Ox Alpha: это GLM-5.3-Flash
Китайская лаборатория Zhipu сообщила, что анонимно тестировала GLM-5.3-Flash под названием Ox Alpha на OpenCode и OpenRouter. По её заявлению, весь трафик во время теста обслуживали китайские ИИ-ускорители.

Китайская ИИ-лаборатория Zhipu (Z.ai) раскрыла происхождение модели Ox Alpha, которая ранее появилась на OpenCode и OpenRouter без указания разработчика. Как сообщает Wccftech со ссылкой на блог компании, под этим именем тестировалась новая модель GLM-5.3-Flash.
По данным издания, Ox Alpha стала доступна 20 августа с мультимодальным контекстным окном до 1 млн токенов, лимитом вывода в 131 072 токена и заявленной пропускной способностью около 100 трлн токенов в сутки в течение недели. Тестирование было бесплатным. Zhipu утверждает, что модель быстро стала самой популярной на этих площадках за неделю, а весь её трафик обслуживался на китайских ИИ-чипах.
GLM-5.3-Flash использует сочетание линейного и разреженного механизмов внимания, а также IndexPool и механизм Manifold-Constrained Hyper-Connections. По заявлению Zhipu, по сравнению с GLM-5.3 новая модель в три раза снижает вычисления механизма внимания на токен и в 4,4 раза уменьшает размер KV-кэша. При этом компания признаёт, что размер KV-кэша у GLM-5.3-Flash всё ещё немного больше, чем у Kimi-K3 и DeepSeek-V4-Flash.
Для обслуживания модели в кластере Zhipu применяет раздельную архитектуру Encode–Prefill–Decode: мультимодальное кодирование, обработка начального запроса и генерация токенов распределены между независимо масштабируемыми группами вычислительных работников. Компания заявляет, что такая схема позволяет надёжно обслуживать нагрузку на десятках тысяч ускорителей отечественной разработки.
Ранее происхождение Ox Alpha было предметом споров: сходство отдельных технических признаков связывали модель с семейством GLM, однако также высказывалась версия о возможной связи с будущей моделью Microsoft MAI 2. Заявление Zhipu снимает эту неопределённость.