Z.ai публикува карта на текстовия модел GLM-5.3. Картата изброява варианти за локалното му внедряване.
GLM-5.3 използва същия базов модел като GLM-5.2. Z.ai е постигнала подобренията на модела чрез дообучение.
Според Z.ai GLM-5.3 подобрява резултата с 50% спрямо GLM-5.2 във вътрешния Z.ai Code Bench. Z.ai също заявява открито лидерство в Terminal Bench 3.0 и Agents’ Last Exam.
RadixArk публикува GLM-5.3-NVFP4 като квантизирана версия на zai-org/GLM-5.3-BF16. В тази версия се квантизират маршрутизираните експерти на 75 MoE слоя, което представлява 96,2% от параметрите.
Проверка на твърденията:
- Z.ai публикува карта на текстовия модел GLM-5.3. Тя предоставя на читателя и варианти за локалното му внедряване. (потвърдено от самата публикация: доказателство; «GLM-5.3 supports deployment with the following frameworks. Feel free to try them out:»)
- Z.ai заявява, че GLM-5.3 е базиран на същия базов модел като GLM-5.2, а подобренията са постигнати чрез дообучение. (потвърдено от самата публикация: доказателство; «GLM-5.3 uses the same base model as GLM-5.2 — every gain comes from post-training.»)
- Картата на GLM-5.3 заявява подобрение с 50% спрямо GLM-5.2 във вътрешния Z.ai Code Bench и открит SOTA в Terminal Bench 3.0 и Agents’ Last Exam. (потвърдено от самата публикация: доказателство; «Stronger Coding: GLM-5.3 is the most capable open-weights model for coding, with a 50% improvement over GLM-5.2 on our in-house Z.ai Code Bench. It also achieve open-source SOTA on public benchmarks including Terminal Bench 3.0 and Agents’ Last Exam.»)
- Z.ai също заявява за GLM-5.3 лидерство в CyberGym при откриването на уязвимости и над два пъти по-добър резултат от GLM-5.2 в бенчмарковете за експлоатация. (потвърдено от самата публикация: доказателство; «Emergent Cyber Capability: As we scaled post-training, cyber capability developed faster than we expected. GLM-5.3 is state of the art on CyberGym for vulnerability discovery, and its gains are largest further up the exploitation chain, where it more than doubles GLM-5.2 on exploitation benchmarks.»)
- Картата на GLM-5.3 описва параметъра reasoning_effort с нива low, high и max. При липса на параметъра се използва max. (потвърдено от самата публикация: доказателство; «GLM-5.3 supports controlling the thinking budget through the reasoning_effort parameter, which accepts three levels: low , high , and max . It defaults to max if not passed (or if set to any other value).»)
- DavidsYoung публикува 3,25-bpw квантизация на GLM-5.3 EXL3/TR3 със смесени нива K3/K4 без калибрационни данни. (потвърдено от самата публикация: доказателство; «GLM-5.3 — EXL3/TR3 3.25 bpw (mixed K3/K4 trellis, data-free)»)
- В тази EXL3/TR3 компилация маршрутизираните експерти в слоеве 3–78 са квантизирани като 192 експерта K3 и 64 експерта K4 на слой, средно до 3,25 bpw. (потвърдено от самата публикация: доказателство; «routed experts (layers 3–78, incl. MTP-78) EXL3 trellis, per layer 192 experts K3 + 64 experts K4 (avg 3.25 bpw), mcg codebook»)
- За тази EXL3/TR3 компилация е посочен стекът exllamav3-b12x/sparkinfer-lineage с пач за смесени нива K. Стандартният зареждащ механизъм exllamav3 не я поддържа. (потвърдено от самата публикация: доказателство; «TR3 mixed-bit layout (carrier BF16 shards + per-layer trellis payloads) — serve with an exllamav3-b12x/sparkinfer-lineage stack, TP4 (+ DCP4/MTP3), FP8 KV. The mixed-K projection-tiers patch is REQUIRED; a stock loader that assumes a uniform K per layer will produce fluent garbage. Not loadable by vanilla exllamav3 model loading.»)
- DavidsYoung съобщава за 3,25-bpw компилацията среден KLD 0,026103 с FP8 KV и 0,026776 при възпроизвеждане CN3 в отложени прозорци за потвърждение. (потвърдено от самата публикация: доказателство; «Measured and independently reproduced 2026-08-29: mean KLD 0.026103 (fp8 KV; CN3 reproduction 0.026776) on held-out confirmation windows.»)
- RadixArk публикува GLM-5.3-NVFP4 като квантизирана версия на zai-org/GLM-5.3-BF16, създадена с NVIDIA Model Optimizer по схемата expert-only NVFP4 W4A4. (потвърдено от самата публикация: доказателство; «The RadixArk GLM-5.3-NVFP4 model is the quantized version of zai-org/GLM-5.3-BF16 . The quantization was produced at RadixArk using NVIDIA Model Optimizer , following an expert-only NVFP4 W4A4 recipe.»)
- В GLM-5.3-NVFP4 се квантизират маршрутизираните експерти на 75 MoE слоя: това са 96,2% от параметрите, а размерът на чекпойнта е заявен като намален от 1 507 на 465 ГБ. (потвърдено от самата публикация: доказателство; «The routed experts of the 75 MoE layers use NVFP4 W4A4 quantization with group size 16 — 57,600 linear entries, or 96.2% of parameters — with FP8-E4M3 block scales and static per-tensor activation scales. Sparse attention including the IndexShare indexer, shared experts, routers, the three dense MLP layers, all norms, embeddings, lm_head , and all MTP tensors retain the source BF16 precision. Checkpoint size is reduced from 1,507 GB to 465 GB.»)
- В публикувания от RadixArk тест на GLM-5.3-NVFP4 на осем NVIDIA B300 моделът получава 97,42% на GSM8K и 94,17% на AIME 2026. (потвърдено от самата публикация: доказателство; «The benchmark results below were produced with this NVFP4 checkpoint on 8x NVIDIA B300 GPUs using a TP8 SGLang deployment. Benchmark Evaluation protocol Score GSM8K Full 1,319-example split, single-shot, sgl-eval 97.42% (1,285/1,319) AIME 2026 30 problems x 16 rollouts, pass@1, sgl-eval 94.17% (majority@16 100% )»)
Публикации:
- https://huggingface.co/davidsyoung/GLM-5.3-EXL3-TR3-3.25bpw
- https://huggingface.co/RadixArk/GLM-5.3-NVFP4
Първоизточници:
- https://huggingface.co/zai-org/GLM-5.3
- https://huggingface.co/zai-org/GLM-5.3-BF16
- https://huggingface.co/davidsyoung/GLM-5.3-EXL3-TR3-3.42bpw
оценка 42.3 · тип release · ревизия 4 · истории st-1171e08