OrcaRouter выпустила для llama.cpp набор 2–6-битных GGUF-квантов аблитерированной Qwen3.8-Flash-Next. Карточка релиза описывает архитектуру, варианты квантования и восстановление обработки изображений отдельным mmproj-файлом.
Модель описана как MoE-превью архитектуры Qwen4, в котором сочетаются Gated DeltaNet, Qwen Sparse Attention, HyperConnections и PLE n-gram embeddings. Она нативно поддерживает работу с изображениями, рассуждение и вызов инструментов.
Для запуска нужен llama.cpp из PR #27742, поскольку архитектура qwen4_exp ещё не вошла в основную ветку. Обычные и релизные сборки эти файлы не загрузят.
Авторы предупреждают, что аблитерация существенно убрала защитное выравнивание и модель может выполнять вредоносные, неэтичные или незаконные запросы. Выпуск предназначен для исследований и требует собственных слоёв безопасности и модерации перед развёртыванием.
Проверка утверждений:
- OrcaRouter опубликовала материал типа release — карточку модели и набор 2–6-битных GGUF-квантов аблитерированной Qwen3.8-Flash-Next для llama.cpp; материал описывает архитектуру, варианты квантования и восстановление зрения отдельным mmproj-файлом. (подтверждено первоисточником: доказательство; «GGUF conversions of the abliterated (refusal-removed) build of Qwen’s Qwen3.8-Flash-Next — a large Mixture-of-Experts (512 experts, 10 routed + 1 shared active) preview of the Qwen4 architecture ( qwen4_exp ): Gated DeltaNet linear attention + Qwen Sparse Attention (QSA) at the micro-block level, HyperConnections in place of layer norms, PLE n-gram hash embeddings, native vision-language , reasoning, and tool-calling. These files run in llama.cpp (CPU / CUDA / Metal / ROCm), quantized from 2-bit to 6-bit , with a separate mmproj file that restores vision .»)
- Модель описана как MoE-превью архитектуры Qwen4 с 512 экспертами, из которых активны 10 маршрутизируемых и один общий; в ней сочетаются Gated DeltaNet, Qwen Sparse Attention, HyperConnections и PLE n-gram embeddings, а также заявлены нативные зрение, рассуждение и вызов инструментов. (подтверждено первоисточником: доказательство; «Qwen3.8-Flash-Next — a large Mixture-of-Experts (512 experts, 10 routed + 1 shared active) preview of the Qwen4 architecture ( qwen4_exp ): Gated DeltaNet linear attention + Qwen Sparse Attention (QSA) at the micro-block level, HyperConnections in place of layer norms, PLE n-gram hash embeddings, native vision-language , reasoning, and tool-calling.»)
- Авторы предупреждают, что аблитерация существенно убрала защитное выравнивание и модель может выполнять вредоносные, неэтичные или незаконные запросы, поэтому выпуск предназначен для исследований и требует собственных слоёв безопасности и модерации перед развёртыванием. (подтверждено первоисточником: доказательство; «This model has had its safety alignment substantially removed via abliteration (orthogonalizing the refusal direction out of the residual stream). It will comply with harmful, unethical, or illegal requests the original Qwen3.8-Flash-Next would refuse. Released strictly for legitimate research — interpretability, AI-safety / refusal-mechanism study, red-teaming, and robustness evaluation. You assume full responsibility for how you use it and everything it generates; add your own safety and moderation layers before any deployment.»)
- Для запуска нужен llama.cpp из PR #27742: архитектура qwen4_exp ещё не вошла в основную ветку, а штатные и релизные сборки не загрузят эти файлы. (подтверждено первоисточником: доказательство; «The qwen4_exp architecture (Gated DeltaNet + QSA + HyperConnections + PLE n-gram) is not yet in mainline llama.cpp . As of this release it lives in PR #27742 ( model: add Qwen3.8-Flash-Next (qwen4exp) ). Stock / release builds will not load these files ( unknown architecture ‘qwen4_exp’ ).»)
- В GGUF-файлах нет MTP-головы для спекулятивного декодирования, потому что PR qwen4exp не реализует её экспорт и инференс, но авторы утверждают, что текстовые и визуальные возможности от этого не страдают. (подтверждено первоисточником: доказательство; «Unlike some Qwen GGUFs, these files do not include the multi-token prediction ( mtp ) speculative-draft head: the qwen4exp PR does not implement MTP export/inference for this architecture (vLLM drops it too). All text + vision capability is unaffected.»)
- Среди стандартных квантов Q4_K_M размером около 110 ГБ рекомендован как основной баланс качества и размера, а Q6_K размером около 168 ГБ назван самым точным из предложенных вариантов. (подтверждено первоисточником: доказательство; «…-Q4_K_M 4-bit ~110 GB Recommended default — best quality/size balance …-Q5_K_S 5-bit ~117 GB High quality …-Q5_K_M 5-bit ~125 GB Near-max quality; every shard <50 GB (no Xet needed) …-Q6_K 6-bit ~168 GB Highest fidelity offered.»)
- Для Q6_K таблица PLE размером 51,2 млрд параметров не квантуется в K-формат из-за размерности 160, поэтому откатывается к Q8_0, занимает отдельный шард примерно на 54,4 ГБ и требует загрузчика с поддержкой Xet или диапазонных запросов. (подтверждено первоисточником: доказательство; «The model’s n-gram (PLE) embedding table is a single 51.2B -parameter tensor ( per_layer_token_embd , shape [160, 320001536] ; 102.4 GB in BF16). Its quantized dimension (160) is not divisible by 256, so it cannot be a K-quant — at Q6_K it falls back to Q8_0 (~54.4 GB) and occupies its own shard. That shard is above CloudFront’s 50 GB single-request download limit (a delivery constraint, not a storage limit), so it is served via Xet / ranged requests , which the default hf client and recent llama.cpp downloaders handle transparently»)
- Низкобитные IQ-кванты построены с матрицей важности на английском, китайском и программном коде и заявлены как более эффективные по качеству на бит, особенно в вариантах IQ3 и IQ2; самый компактный IQ2_XXS занимает около 52 ГБ и сильнее всего деградирует. (подтверждено первоисточником: доказательство; «Lower-bit quants built with an importance matrix (computed on English + Chinese + code calibration text) — better quality-per-bit than plain K-quants at the low end, especially IQ3/IQ2. File Bits Size Notes / recommendation …-IQ4_XS ~4.25-bit ~97 GB Best low-bit pick — approx Q4_K_S quality at smaller size …-IQ3_M ~3.7-bit ~82 GB Solid 3-bit …-IQ3_XXS ~3.1-bit ~73 GB Smaller 3-bit …-IQ2_M ~2.7-bit ~63 GB Runs in lower VRAM; some quality loss …-IQ2_XXS ~2.1-bit ~52 GB Smallest runnable; most degraded»)
- Для обработки изображений нужно отдельно скачать F16-проектор mmproj объёмом около 0,9 ГБ. (подтверждено первоисточником: доказательство; «mmproj-…-F16.gguf ~0.9 GB Vision projector — download this too for image input»)
- По приведённой авторами оценке, после аблитерации доля отказов на вредоносные запросы снизилась с 64–100% у базовой модели до примерно 0–3,3%, переотказы на безвредных запросах остались около нуля, а показатели способностей сохранились в пределах двух пунктов от базы; отдельно проверены зрение и многоходовый вызов инструментов. (подтверждено первоисточником: доказательство; «Abliteration was measured on this build (served with vLLM) vs the official Qwen/Qwen3.8-Flash-Next , using the same scripts. Harmful-prompt refusal collapses from 64–100% (base) to ~0–3.3% ; benign over-refusal stays near 0%; capability stays within ±2 pts of the base across MMLU-Pro / GSM8K / CMMLU-style checks; vision (image + OCR via mmproj ) and multi-turn tool calling verified working.»)
- Сборка работает через llama.cpp на CPU, CUDA, Metal и ROCm; при генерации активно около 10 из 512 экспертов, однако полные веса всё равно должны помещаться в RAM/VRAM либо отображаться в память, а бюджет дополняют KV-кэш и mmproj. (подтверждено первоисточником: доказательство; «Runs on CPU, CUDA, Metal, or ROCm via llama.cpp. As a large MoE, only ~10 of 512 experts are active per token, so decode is far faster than the total parameter count suggests, but the full weights must fit in RAM/VRAM (or be memory-mapped) : budget ≈ the file size + KV cache + (for vision) the ~0.9 GB mmproj.»)
- Модель распространяется по Apache 2.0, унаследованной от Qwen3.8-Flash-Next; аблитерация и квантование не меняют лицензионных обязательств. (подтверждено первоисточником: доказательство; «Apache 2.0 , inherited from Qwen/Qwen3.8-Flash-Next . Abliteration and quantization do not change the underlying license obligations.»)
Публикации:
- https://huggingface.co/agentionai/Qwen3.8-Flash-Next-AP-GGUF
- https://huggingface.co/agentionai/Qwen3.8-Flash-Next-ROCmFP4-FAST-GGUF
Первоисточники:
оценка 59.2 · тип release · ревизия 1 · истории st-1mubjl4