Inco AI опубликовала карточку Qwen3.8-27B-DFlash2-GGUF с готовыми GGUF-конвертациями черновой модели DFlash 2 для запуска Qwen3.8-27B со спекулятивным декодированием.
DFlash 2 не работает как самостоятельная языковая модель. Внутри сервера спекулятивного декодирования она за один проход предлагает блок черновых токенов, а легковесный селектор прокладывает один согласованный путь через кандидатов.
Разработчики заявляют декодирование без потерь: жадный вывод точно совпадает с целевой моделью, а сэмплирование сохраняет её распределение. Средняя длина принятой последовательности для Q4_K_M составила 5,39 при оценке на первых восьми тестовых примерах GSM8K.
Для запуска нужна сборка llama.cpp с поддержкой DFlash 2 из PR №27342. Карточка приводит команды сборки для NVIDIA CUDA и Apple Silicon с Metal.
Проверка утверждений:
- Inco AI разместила карточку модели Qwen3.8-27B-DFlash2-GGUF с GGUF-конвертациями DFlash 2 для Qwen3.8-27B, давая читателю готовые варианты черновой модели для запуска со спекулятивным декодированием. (подтверждено первоисточником: доказательство; «incoai / Qwen3.8-27B-DFlash2-GGUF like 133 Follow Inco AI 203 Text Generation GGUF llama.cpp dflash2 speculative-decoding draft-model conversational License: apache-2.0 Model card Files Files and versions xet Community 5 Copy to bucket new Use this model Qwen3.8-27B-DFlash2-GGUF Blog | GitHub This repository contains GGUF conversions of incoai/Qwen3.8-27B-DFlash2 , the DFlash 2 draft model for Qwen/Qwen3.8-27B .»)
- DFlash 2 не является самостоятельной языковой моделью: она работает внутри сервера спекулятивного декодирования и предлагает черновые токены, которые проверяет целевая модель. (подтверждено первоисточником: доказательство; «It is not a standalone language model: it runs inside a speculative decoding server and drafts tokens for the target model to verify.»)
- DFlash 2 использует блочно-диффузионный черновик: за один проход предсказывает блок токенов, сохраняет лучшие варианты в каждой позиции, после чего легковесный селектор прокладывает один согласованный путь. (подтверждено первоисточником: доказательство; «DFlash 2 is a block-diffusion drafter for speculative decoding. It predicts a whole block of tokens in a single pass and keeps the top candidates at every position. A lightweight selector then traces one coherent path through them.»)
- Двухотводные динамические свертки препятствуют ухудшению черновика к концу блока; декодирование заявлено как без потерь: жадный вывод совпадает с целевой моделью, а сэмплирование сохраняет ее распределение. (подтверждено первоисточником: доказательство; «Two-tap dynamic convolutions in the backbone keep the draft from decaying toward the end of the block. Decoding is lossless: greedy output matches the target model exactly, and sampling preserves its distribution.»)
- Репозиторий предлагает три GGUF-файла: Q4_K_M размером 1,1 ГБ, Q8_0 размером 2,0 ГБ и BF16 размером 3,8 ГБ. (подтверждено первоисточником: доказательство; «Qwen3.8-27B-DFlash2-Q4_K_M.gguf 1.1 GB Qwen3.8-27B-DFlash2-Q8_0.gguf 2.0 GB Qwen3.8-27B-DFlash2-BF16.gguf 3.8 GB»)
- Для запуска требуется сборка llama.cpp с поддержкой DFlash 2 из PR №27342; карточка приводит команды сборки как для NVIDIA CUDA, так и для Apple Silicon с Metal. (подтверждено первоисточником: доказательство; «Build llama.cpp with DFlash 2 support ( PR #27342 ): git clone https://github.com/ggml-org/llama.cpp.git cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 # NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake –build build -j # Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake –build build -j»)
- Пример запуска llama-server использует Q4_K_M-версию Qwen3.8-27B как целевую модель, Q4_K_M-версию DFlash 2 как черновую, режим draft-dflash и максимум семь черновых токенов. (подтверждено первоисточником: доказательство; «./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ –spec-type draft-dflash \ –spec-draft-n-max 7»)
- Оценка проводилась с целевой Q4_K_M-моделью Qwen3.8-27B, рекомендованными параметрами сэмплирования Qwen3.8 и усилием рассуждения xhigh; использовались первые восемь тестовых примеров GSM8K и лимит 2048 новых токенов. (подтверждено первоисточником: доказательство; «Target: ggml-org/Qwen3.8-27B-GGUF , Q4_K_M Sampling: Qwen3.8’s officially recommended parameters (temperature 1.0, top-p 0.95, top-k 20), with xhigh reasoning effort Maximum new tokens: 2048 Prompts: the first eight GSM8K test examples»)
- Средняя длина принятой последовательности — отношение числа токенов завершения к числу шагов проверки — составила 5,28 для BF16, 5,13 для Q8_0 и 5,39 для Q4_K_M; более высокое значение считается лучшим. (подтверждено первоисточником: доказательство; «Acceptance length is the per-request mean of completion tokens divided by verification steps. Higher is better. Draft GGUF Acceptance Length BF16 5.28 Q8_0 5.13 Q4_K_M 5.39»)
- Модель опубликована по лицензии Apache-2.0. (подтверждено первоисточником: доказательство; «License: apache-2.0»)
Первоисточники:
оценка 56.8 · тип release · ревизия 1 · истории st-1by3gse