Что изменилось: Добавлены сведения о доступности весов и поддерживаемых фреймворках.
Z.ai представила GLM-5.3-Flash, первую в серии GLM-5 мультимодальную модель, которая обрабатывает текст и изображения. В модели 320 млрд параметров, но при работе активны 18 млрд.
Архитектура сочетает линейное и разреженное внимание, чтобы сократить затраты на работу с длинным контекстом. По заявлению Z.ai, по сравнению с GLM-5.3 модель требует в 3 раза меньше вычислений для внимания и хранит кэш ключей и значений — память для промежуточных данных — в 4,4 раза меньшего размера.
Веса модели опубликованы на Hugging Face. Для локального запуска Z.ai указывает SGLang, vLLM и TokenSpeed — фреймворки для запуска модели.
Проверка утверждений:
- Z.ai представила GLM-5.3-Flash, первую в серии GLM-5 нативно мультимодальную модель. (подтверждено самой публикацией: доказательство; «We introduce GLM-5.3-Flash, the first natively multimodal model in the GLM-5 series.»)
- В модели 320 млрд параметров, но при работе активны 18 млрд. (подтверждено самой публикацией: доказательство; «With 320B total parameters and just 18B active parameters»)
- Архитектура сочетает линейное и разреженное внимание, чтобы сократить затраты на работу с длинным контекстом. (подтверждено самой публикацией: доказательство; «For the first time in the GLM series, we introduce a hybrid architecture combining sparse and linear attention, sharply reducing long-context serving costs while preserving precise long-context capabilities.»)
- По заявлению Z.ai, по сравнению с GLM-5.3 модель требует в 3 раза меньше вычислений для внимания и хранит кэш ключей и значений в 4,4 раза меньшего размера. (подтверждено самой публикацией: доказательство; «Compared with GLM-5.3, GLM-5.3-Flash uses 3.0× less attention compute and a 4.4× smaller KV cache.»)
- Веса модели опубликованы на Hugging Face. (подтверждено самой публикацией: доказательство; «The model weights of GLM-5.3-Flash are publicly available on Hugging Face.»)
- Для локального запуска Z.ai указывает SGLang, vLLM и TokenSpeed. (подтверждено самой публикацией: доказательство; «For local deployment, GLM-5.3-Flash currently supports inference frameworks including SGLang, vLLM and TokenSpeed.»)
Публикации:
Первоисточники:
- https://huggingface.co/zai-org/GLM-5.3-Flash
- https://huggingface.co/unsloth/GLM-5.3-Flash-GGUF
- https://huggingface.co/cyankiwi/GLM-5.3-Flash-AWQ-INT4
- https://docs.z.ai/guides/vlm/glm-5.3-flash
- https://thenewstack.io/glm-flash-flagship-benchmark
- https://huggingface.co/ormandj/GLM-5.3-Flash-W4A16-NVFP4-K32-Experts-FP8-WO
- https://z.ai/blog/glm-5.3-flash
- https://huggingface.co/dealignai/GLM-5.3-Flash-ABLITERATED-NVFP4
- https://dev.classmethod.jp/en/articles/dgx-spark-glm-5-3-flash-first-touch
- https://arxiv.org/abs/2607.00501
- https://docs.z.ai/guides/llm/glm-5.3#emergent-cyber-capability
- https://openai.com/index/hugging-face-incident-and-the-road-ahead
- https://www.anthropic.com/glasswing
- https://openai.com/index/daybreak-for-frontline-defenders
- https://blog.google/security/rust-in-android-move-fast-fix-things
- https://www.whitehouse.gov/presidential-actions/2026/06/promoting-advanced-artificial-intelligence-innovation-and-security/
- https://www.nerc.com/standards/reliability-standards/cip
- https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=CELEX%3A02022L2555-20221227
- https://vercel.com/changelog/glm-5-3-flashx-now-available-on-ai-gateway
- https://huggingface.co/dealignai/GLM-5.3-Flash-CYBERSECURITY-W4A16
- https://huggingface.co/huihui-ai/GLM-5.3-Flash-abliterated-GGUF
оценка 71,7 из 100 · тип: релиз · обновление 9