Inco AI выпустила на Hugging Face модель DFlash 2 для GLM-5.3-Flash. Карточка релиза объясняет назначение модели и даёт команду запуска с SGLang.
GLM-5.3-Flash-DFlash2 — не самостоятельная языковая модель, а draft-модель внутри сервера спекулятивного декодирования. Она предлагает токены, которые проверяет целевая модель.
DFlash 2 за один проход предсказывает целый блок токенов и сохраняет лучшие варианты в каждой позиции. Затем лёгкий селектор прокладывает один согласованный путь, а динамические свёртки с двумя tap не дают качеству черновика ухудшаться к концу блока.
При greedy decoding результат точно совпадает с целевой моделью, а при sampling сохраняется её распределение. Финальные результаты бенчмарков для этого checkpoint пока повторно измеряют и обещают опубликовать позже.
Проверка утверждений:
- Inco AI выпустила на Hugging Face модель DFlash 2 для GLM-5.3-Flash; карточка релиза объясняет назначение модели и даёт команду запуска с SGLang. (подтверждено первоисточником: доказательство; «This repository contains the DFlash 2 draft model for zai-org/GLM-5.3-Flash . It is not a standalone language model: it runs inside a speculative decoding server and drafts tokens for the target model to verify.»)
- GLM-5.3-Flash-DFlash2 — не самостоятельная языковая модель, а draft-модель внутри сервера спекулятивного декодирования: она предлагает токены, которые проверяет целевая модель. (подтверждено первоисточником: доказательство; «It is not a standalone language model: it runs inside a speculative decoding server and drafts tokens for the target model to verify.»)
- DFlash 2 использует block-diffusion: за один проход предсказывает целый блок токенов, сохраняет лучшие варианты в каждой позиции, после чего лёгкий селектор прокладывает один согласованный путь. (подтверждено первоисточником: доказательство; «DFlash 2 is a block-diffusion drafter for speculative decoding. It predicts a whole block of tokens in a single pass and keeps the top candidates at every position. A lightweight selector then traces one coherent path through them.»)
- В backbone применяются динамические свёртки с двумя tap, чтобы качество черновика не ухудшалось к концу блока. (подтверждено первоисточником: доказательство; «Two-tap dynamic convolutions in the backbone keep the draft from decaying toward the end of the block.»)
- Декодирование заявлено как lossless: при greedy decoding результат точно совпадает с целевой моделью, а при sampling сохраняется её распределение. (подтверждено первоисточником: доказательство; «Decoding is lossless: greedy output matches the target model exactly, and sampling preserves its distribution.»)
- Карточка содержит пример запуска через SGLang с алгоритмом DFLASH, отдельным путём к draft-модели и attention backend fa4. (подтверждено первоисточником: доказательство; «sglang serve \ –model-path zai-org/GLM-5.3-Flash \ –trust-remote-code \ –speculative-algorithm DFLASH \ –speculative-draft-model-path incoai/GLM-5.3-Flash-DFlash2 \ –speculative-draft-attention-backend fa4»)
- Финальные результаты бенчмарков для этого checkpoint пока отсутствуют: их повторно измеряют и обещают опубликовать позже. (подтверждено первоисточником: доказательство; «Benchmark numbers for this checkpoint are being re-measured and will be published here once final.»)
- Модель выпущена под CC BY-NC-ND 4.0 для исследований и оценки; для коммерческой лицензии Inco AI просит обращаться отдельно. (подтверждено первоисточником: доказательство; «This model is released under CC BY-NC-ND 4.0 for research and evaluation. For commercial licensing, contact contact@inco.ai .»)
- Checkpoint содержит 1 млрд параметров и представлен в формате BF16. (подтверждено первоисточником: доказательство; «Model size 1B params Tensor type BF16 ·»)
- На момент публикации модель не была развёрнута ни у одного Hugging Face Inference Provider. (подтверждено первоисточником: доказательство; «This model isn’t deployed by any Inference Provider. 🙋 Ask for provider support»)
Первоисточники:
оценка 61.4 · тип release · ревизия 1 · истории st-1ehwn74