Z.ai опубликовала карточку текстовой модели GLM-5.3. В карточке перечислены варианты её локального развёртывания.
GLM-5.3 использует ту же базовую модель, что и GLM-5.2. Z.ai получила улучшения модели постобучением.
По заявлению Z.ai, GLM-5.3 улучшила результат на 50% относительно GLM-5.2 во внутреннем Z.ai Code Bench. Z.ai также заявляет открытое лидерство в Terminal Bench 3.0 и Agents’ Last Exam.
RadixArk опубликовала GLM-5.3-NVFP4 как квантизованную версию zai-org/GLM-5.3-BF16. В этой версии квантуются маршрутизируемые эксперты 75 MoE-слоёв, что составляет 96,2% параметров.
Проверка утверждений:
- Z.ai опубликовала карточку текстовой модели GLM-5.3; она, в частности, даёт читателю варианты её локального развёртывания. (подтверждено самой публикацией: доказательство; «GLM-5.3 supports deployment with the following frameworks. Feel free to try them out:»)
- Z.ai заявляет, что GLM-5.3 основана на той же базовой модели, что и GLM-5.2, а улучшения получены постобучением. (подтверждено самой публикацией: доказательство; «GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training.»)
- В карточке GLM-5.3 заявлено улучшение на 50% относительно GLM-5.2 во внутреннем Z.ai Code Bench и открытый SOTA на Terminal Bench 3.0 и Agents’ Last Exam. (подтверждено самой публикацией: доказательство; «Stronger Coding: GLM-5.3 is the most capable open-weights model for coding, with a 50% improvement over GLM-5.2 on our in-house Z.ai Code Bench. It also achieve open-source SOTA on public benchmarks including Terminal Bench 3.0 and Agents’ Last Exam.»)
- Z.ai также заявляет для GLM-5.3 лидерство на CyberGym по поиску уязвимостей и более чем двукратное превосходство над GLM-5.2 на бенчмарках эксплуатации. (подтверждено самой публикацией: доказательство; «Emergent Cyber Capability: As we scaled post-training, cyber capability developed faster than we expected. GLM-5.3 is state of the art on CyberGym for vulnerability discovery, and its gains are largest further up the exploitation chain, where it more than doubles GLM-5.2 on exploitation benchmarks.»)
- Карточка GLM-5.3 описывает параметр reasoning_effort с уровнями low, high и max; при отсутствии параметра используется max. (подтверждено самой публикацией: доказательство; «GLM-5.3 supports controlling the thinking budget through the reasoning_effort parameter, which accepts three levels: low , high , and max . It defaults to max if not passed (or if set to any other value).»)
- DavidsYoung опубликовал 3,25-bpw квантизацию GLM-5.3 EXL3/TR3 со смешанными уровнями K3/K4 без калибровочных данных. (подтверждено самой публикацией: доказательство; «GLM-5.3 — EXL3/TR3 3.25 bpw (mixed K3/K4 trellis, data-free)»)
- В этой EXL3/TR3-сборке маршрутизируемые эксперты слоёв 3–78 квантизованы как 192 эксперта K3 и 64 эксперта K4 на слой, в среднем до 3,25 bpw. (подтверждено самой публикацией: доказательство; «routed experts (layers 3–78, incl. MTP-78) EXL3 trellis, per layer 192 experts K3 + 64 experts K4 (avg 3.25 bpw), mcg codebook»)
- Для этой EXL3/TR3-сборки указан стек exllamav3-b12x/sparkinfer-lineage с патчем смешанных уровней K; стандартный загрузчик exllamav3 её не поддерживает. (подтверждено самой публикацией: доказательство; «TR3 mixed-bit layout (carrier BF16 shards + per-layer trellis payloads) — serve with an exllamav3-b12x/sparkinfer-lineage stack, TP4 (+ DCP4/MTP3), FP8 KV. The mixed-K projection-tiers patch is REQUIRED; a stock loader that assumes a uniform K per layer will produce fluent garbage. Not loadable by vanilla exllamav3 model loading.»)
- DavidsYoung сообщает для 3,25-bpw сборки средний KLD 0,026103 с FP8 KV и 0,026776 в воспроизведении CN3 на отложенных окнах подтверждения. (подтверждено самой публикацией: доказательство; «Measured and independently reproduced 2026-08-29: mean KLD 0.026103 (fp8 KV; CN3 reproduction 0.026776) on held-out confirmation windows.»)
- RadixArk опубликовала GLM-5.3-NVFP4 как квантизованную версию zai-org/GLM-5.3-BF16, созданную NVIDIA Model Optimizer по схеме expert-only NVFP4 W4A4. (подтверждено самой публикацией: доказательство; «The RadixArk GLM-5.3-NVFP4 model is the quantized version of zai-org/GLM-5.3-BF16 . The quantization was produced at RadixArk using NVIDIA Model Optimizer , following an expert-only NVFP4 W4A4 recipe.»)
- В GLM-5.3-NVFP4 квантизуются маршрутизируемые эксперты 75 MoE-слоёв: это 96,2% параметров, а размер чекпойнта заявлен сокращённым с 1 507 до 465 ГБ. (подтверждено самой публикацией: доказательство; «The routed experts of the 75 MoE layers use NVFP4 W4A4 quantization with group size 16 — 57,600 linear entries, or 96.2% of parameters — with FP8-E4M3 block scales and static per-tensor activation scales. Sparse attention including the IndexShare indexer, shared experts, routers, the three dense MLP layers, all norms, embeddings, lm_head , and all MTP tensors retain the source BF16 precision. Checkpoint size is reduced from 1,507 GB to 465 GB.»)
- В опубликованном RadixArk тесте GLM-5.3-NVFP4 на восьми NVIDIA B300 модель получила 97,42% на GSM8K и 94,17% на AIME 2026. (подтверждено самой публикацией: доказательство; «The benchmark results below were produced with this NVFP4 checkpoint on 8x NVIDIA B300 GPUs using a TP8 SGLang deployment. Benchmark Evaluation protocol Score GSM8K Full 1,319-example split, single-shot, sgl-eval 97.42% (1,285/1,319) AIME 2026 30 problems x 16 rollouts, pass@1, sgl-eval 94.17% (majority@16 100% )»)
Публикации:
- https://huggingface.co/davidsyoung/GLM-5.3-EXL3-TR3-3.25bpw
- https://huggingface.co/RadixArk/GLM-5.3-NVFP4
Первоисточники:
- https://huggingface.co/zai-org/GLM-5.3
- https://huggingface.co/zai-org/GLM-5.3-BF16
- https://huggingface.co/davidsyoung/GLM-5.3-EXL3-TR3-3.42bpw
оценка 42.3 · тип release · ревизия 4 · истории st-1171e08