Что изменилось: Добавлены сведения о доступности весов и поддерживаемых фреймворках.

Z.ai представила GLM-5.3-Flash, первую в серии GLM-5 мультимодальную модель, которая обрабатывает текст и изображения. В модели 320 млрд параметров, но при работе активны 18 млрд.

Архитектура сочетает линейное и разреженное внимание, чтобы сократить затраты на работу с длинным контекстом. По заявлению Z.ai, по сравнению с GLM-5.3 модель требует в 3 раза меньше вычислений для внимания и хранит кэш ключей и значений — память для промежуточных данных — в 4,4 раза меньшего размера.

Веса модели опубликованы на Hugging Face. Для локального запуска Z.ai указывает SGLang, vLLM и TokenSpeed — фреймворки для запуска модели.

Проверка утверждений:

  • Z.ai представила GLM-5.3-Flash, первую в серии GLM-5 нативно мультимодальную модель. (подтверждено самой публикацией: доказательство; «We introduce GLM-5.3-Flash, the first natively multimodal model in the GLM-5 series.»)
  • В модели 320 млрд параметров, но при работе активны 18 млрд. (подтверждено самой публикацией: доказательство; «With 320B total parameters and just 18B active parameters»)
  • Архитектура сочетает линейное и разреженное внимание, чтобы сократить затраты на работу с длинным контекстом. (подтверждено самой публикацией: доказательство; «For the first time in the GLM series, we introduce a hybrid architecture combining sparse and linear attention, sharply reducing long-context serving costs while preserving precise long-context capabilities.»)
  • По заявлению Z.ai, по сравнению с GLM-5.3 модель требует в 3 раза меньше вычислений для внимания и хранит кэш ключей и значений в 4,4 раза меньшего размера. (подтверждено самой публикацией: доказательство; «Compared with GLM-5.3, GLM-5.3-Flash uses 3.0× less attention compute and a 4.4× smaller KV cache.»)
  • Веса модели опубликованы на Hugging Face. (подтверждено самой публикацией: доказательство; «The model weights of GLM-5.3-Flash are publicly available on Hugging Face.»)
  • Для локального запуска Z.ai указывает SGLang, vLLM и TokenSpeed. (подтверждено самой публикацией: доказательство; «For local deployment, GLM-5.3-Flash currently supports inference frameworks including SGLang, vLLM and TokenSpeed.»)

Публикации:

Первоисточники:

оценка 71,7 из 100 · тип: релиз · обновление 9