В репозитории Qwen3.8-Flash-Next-FP8 доступны FP8-квантованные веса модели, представленные с пониженной точностью, и файлы конфигурации для дообученной модели в формате Hugging Face Transformers.
Для квантования использован метод FP8 с блоками по 128 значений, а показатели производительности, по данным карточки, почти не отличаются от исходной модели. Артефакты совместимы с Hugging Face Transformers, vLLM, SGLang и TokenSpeed.
Проверка утверждений:
- В репозитории Qwen3.8-Flash-Next-FP8 доступны FP8-квантованные веса и файлы конфигурации для дообученной модели в формате Hugging Face Transformers. (подтверждено самой публикацией: доказательство; «This repository contains FP8-quantized model weights and configuration files for the post-trained model in the Hugging Face Transformers format.»)
- Для квантования использован метод FP8 с блоками по 128 значений, а показатели производительности почти не отличаются от исходной модели. (подтверждено самой публикацией: доказательство; «The quantization method is fine-grained fp8 quantization with block size of 128, and its performance metrics are nearly identical to those of the original model.»)
- Артефакты совместимы с Hugging Face Transformers, vLLM, SGLang и TokenSpeed. (подтверждено самой публикацией: доказательство; «These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, TokenSpeed, etc.»)
Публикации:
Первоисточники:
- https://huggingface.co/Qwen/Qwen3.8-Flash-Next-FP8
- https://huggingface.co/spiritfather/Qwen3.8-Flash-Next-heretic-2-GGUF
- https://github.com/architectds/collabosm
оценка 17,0 из 100 · тип: релиз · обновление 4