Исследовательский материал Z.ai представляет GLM-5.3-Flash как первую нативно мультимодальную модель серии GLM-5. Z.ai развернула GLM-5.3-Flash для всех пользователей GLM Coding Plan.
У GLM-5.3-Flash 320 миллиардов общих и 18 миллиардов активных параметров. Гибридная архитектура со sparse и linear attention должна снизить стоимость обслуживания длинного контекста, сохранив его точность.
Для уменьшения задержки и расхода памяти индексатора при контексте в миллион токенов Z.ai представила IndexPool, сжимающий четыре ключевых вектора индексатора в один. В производственной архитектуре кодирование мультимодальных данных, предварительная обработка запроса и генерация токенов разделены на независимо планируемые и масштабируемые пулы работников.
Z.ai заявляет о трёхкратном росте сквозной производительности обслуживания на том же оборудовании относительно исходного уровня.
Проверка утверждений:
- Z.ai опубликовала исследовательский материал, представляющий GLM-5.3-Flash как первую нативно мультимодальную модель серии GLM-5. (подтверждено самой публикацией: доказательство; «We introduce GLM-5.3-Flash, the first natively multimodal model in the GLM-5 series.»)
- В материале Z.ai указано, что у GLM-5.3-Flash 320 миллиардов общих и 18 миллиардов активных параметров. (подтверждено самой публикацией: доказательство; «With 320B total parameters and just 18B active parameters, it outperforms GLM-5.2 across benchmarks and real-world workloads at one-tenth the price, while approaching Claude Opus 4.8 on coding and agentic benchmarks.»)
- Z.ai описывает гибридную архитектуру со sparse и linear attention, которая должна снизить стоимость обслуживания длинного контекста, сохранив его точность. (подтверждено самой публикацией: доказательство; «For the first time, we introduce a hybrid architecture combining sparse and linear attention, sharply reducing long-context serving costs while preserving precise long-context capabilities.»)
- Для уменьшения задержки и расхода памяти индексатора при контексте в миллион токенов Z.ai представила IndexPool, сжимающий четыре ключевых вектора индексатора в один. (подтверждено самой публикацией: доказательство; «To further reduce the latency and memory overhead of the indexer at a 1M-token context length, we introduce IndexPool, which compresses four indexer key vectors into one through weighted pooling.»)
- Z.ai сообщает, что модель обслуживается на крупном кластере китайских чипов с высокоскоростным межсоединением и оптимизированным стеком обслуживания. (подтверждено самой публикацией: доказательство; «Over the past week, we have served GLM-5.3-Flash on a large-scale cluster of Chinese AI chips, supported by a high-bandwidth interconnect and a serving stack optimized for the underlying hardware.»)
- В производственной архитектуре Z.ai кодирование мультимодальных данных, предварительная обработка запроса и генерация токенов разделены на независимо планируемые и масштабируемые пулы работников. (подтверждено самой публикацией: доказательство; «At cluster scale, our production-grade Encode–Prefill–Decode (EPD) disaggregated architecture separates multimodal encoding, prompt prefill, and token-by-token decoding into independently scheduled and scalable worker pools, enabling efficient and reliable serving.»)
- Z.ai заявляет о трёхкратном росте сквозной производительности обслуживания на том же оборудовании относительно исходного уровня. (подтверждено самой публикацией: доказательство; «Compared with our initial baseline on the same hardware, we achieved a 3× improvement in end-to-end serving performance, reaching hardware efficiency and per-token cost comparable to mainstream NVIDIA GPUs.»)
- Z.ai развернула GLM-5.3-Flash для всех пользователей GLM Coding Plan и указывает на трёхкратное увеличение доступной им квоты по сравнению с GLM-5.3. (подтверждено самой публикацией: доказательство; «We’ve rolled out GLM-5.3-Flash to all GLM Coding Plan users. GLM-5.3-Flash gives you 3x the usable quota of GLM-5.3.»)
- В ZCode мультимодальные возможности GLM-5.3-Flash доступны через Browser Use и Computer Use: агент переходит по веб-страницам, визуально их проверяет и работает с настольными приложениями. (подтверждено самой публикацией: доказательство; «Unlock GLM-5.3-Flash’s multimodal capabilities in ZCode with Browser Use and Computer Use: the agent clicks through and visually verifies web pages, and operates your desktop apps.»)
- Z.ai сообщает, что веса GLM-5.3-Flash опубликованы на HuggingFace, а для локального развёртывания поддерживаются SGLang, vLLM и TokenSpeed. (подтверждено самой публикацией: доказательство; «The model weights of GLM-5.3-Flash are publicly available on HuggingFace. For local deployment, GLM-5.3-Flash currently supports inference frameworks including SGLang, vLLM and TokenSpeed.»)
- В материале Artificial Analysis GLM-5.3-Flash получила 57 баллов в Intelligence Index, что выше медианы сопоставимых моделей в 29 баллов. (подтверждено самой публикацией: доказательство; «GLM-5.3-Flash scores 57 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 29).»)
- Artificial Analysis указывает для GLM-5.3-Flash цену 0,15 доллара за миллион входных токенов и 0,50 доллара за миллион выходных токенов. (подтверждено самой публикацией: доказательство; «Pricing for GLM-5.3-Flash is $0.15 per 1M input tokens (moderately priced, median: $0.30) and $0.50 per 1M output tokens (moderately priced, median: $1.20).»)
Публикации:
Первоисточники:
- https://z.ai/blog/glm-5.3-flash
- https://huggingface.co/zai-org/GLM-5.3-Flash
- https://artificialanalysis.ai/models/glm-5-3-flash
- https://artificialanalysis.ai/models/glm-5-3-flash?intelligence=agentic-index
- https://martinalderson.com/posts/glm-5-3-flash-chinese-hardware
оценка 41.8 · тип release · ревизия 4 · истории st-1cnyxz7